事實
單細胞基因體學 · 效能評測 · 研究綜覽Nature Biotechnology,2026 年 4 月 22 日
Stanford · Silesian University of Technology · Yale
一種完全不需要參考基因體的單細胞分析方法
史丹佛大學的 Julia Salzman 與西里西亞理工大學的 Sebastian Deorowicz 領導的團隊,發表了 sc-SPLASH:一種統計方法,直接從原始讀值中找出 barcoded 單細胞與空間定序資料中受規範的序列變異,不需比對參考基因體。該論文已經同儕審查,以 Brief Communication(暫譯:簡訊論文)形式發表於《Nature Biotechnology》,其自己的圖表顯示,在全部十一個基準資料集上,它都比領域標準工具 Cell Ranger 與 STARsolo 更快、更省記憶體。
- ~50×比 UMI-tools 快,適用於 barcode 與 UMI 前處理步驟(BKC)
- 11個基準資料集中,sc-SPLASH 都比 Cell Ranger 與 STARsolo 更快、更省記憶體
- 5個新分泌型蛋白基因,發現於沒有參考基因體的海綿
- 47個 YYD 重複序列同源基因,橫跨五個被囊動物基因組組裝
每一部分站得多穩 直接從已發表的圖表中讀取,以及僅見於前身預印本的內容。
| 確信程度 | 內容 | 誰這麼說 |
|---|---|---|
| 已證實 | Dehghannasiri、Kokot 與九位共同作者描述了 sc-SPLASH、其 BKC 前處理模組,以及在人類、海綿、被囊動物與電鱔資料中的發現 | 《Nature Biotechnology》,同儕審查並收錄於 PubMed(PMID 42020848) |
| 已證實 | 在 11 個基準資料集中,sc-SPLASH 在每一例中都比 Cell Ranger v8.0.1 與 STARsolo v2.7.10b 花更少時間、用更少記憶體 | 直接讀取自已發表論文的圖 1c |
| 已證實 | barcode 與 UMI 前處理步驟 BKC,速度約為 UMI-tools 的 50 倍 | 論文自身的摘要 |
| 已證實 | 在 Tabula Sapiens 資料中發現的所有 Pfam 蛋白質結構域中,V-set(免疫球蛋白可變區折疊)具有最高的平均熵、最高的平均效應量,並且無法比對的 extendor 數量最多 | 直接讀取自已發表論文的圖 1d |
| 曾有報導,但已被取代 | V-set 的效應量約為 0.90。較早的預印本給出的熵值為 2.16,但正式發表圖表的座標軸未及該值,並將 V-set 標於約 1.8 之處——因此本文不載其精確熵值。 | 效應量與直接判讀的圖 1d 相符;熵值出自前身 bioRxiv 預印本,而正式發表的圖表並未支持該數值 |
| 已確認,但本站無法查證 | 海綿的 Granrep 表現量隨發育週期上升,從芽球(第 0 天)到第 12 天;一項初步實驗發現,經 LPS 或環狀二核苷酸激活後,表現量並無明顯差異 | 語出於前身 bioRxiv 預印本自身的正文;未在需付費閱讀的最終正文中獨立重新確認 |
sc-SPLASH 究竟找到了什麼 五項結果,均讀取自已發表圖表或其自身的補充說明
- 免疫受體多樣性,人類——在 Tabula Sapiens 各組織中,共回收 5,212 條 in-frame V(D)J 序列(4,098 條來自漿細胞,1,114 條來自 B 細胞),主要集中於脾臟(1,632)、淋巴結(1,484)、唾液腺(409)、骨髓(378)與血液(332)。
- 具空間解析的癌症突變——在人類鱗狀細胞癌的 Visium 樣本中,最強訊號(效應量 0.757)為粒線體 MT-ND4 雙重突變(ChrM 11,413–11,466),主要但非僅限於在腫瘤區域表現。
- 相隔兩個門的相同剪接選擇——人類胎兒小腸上皮細胞會納入某個 RPS24 外顯子、基質細胞則排除它,這在電鰻自身的 RPS24 中同樣出現:其電器官的 electrocyte 會納入該外顯子,周圍的絕緣隔膜則將其排除。
- 海綿自身參考基因體中缺失的五個基因——一段 27 個核苷酸的 anchor,在 Spongilla lacustris 組裝與 NCBI 中均查無記錄(熵值 6.2、667 個相異 target,是該資料集中最高者),由此發現五個新命名的基因 Granrep1–5,主要表現於granulocyte(74 個受檢細胞中有 47 個表現)與 amoebocyte(49 個中有 12 個);RNA-FISH 證實 34 個細胞中有 30 個同時與 granulocyte 標記基因 Acp5 共同表現。
- 第二個門中的平行重複序列——被囊動物 Ciona 自身的高多樣性 anchor(熵值 4.80–5.97,是所調查九種無脊椎動物中唯一超過 4 的重複序列 anchor)指向橫跨五個被囊動物基因組組裝的 47 個同源「YYD」基因,表現於循環中的 hemocyte,並在孵化後十二小時、變態期時達到高峰。
時序
四年間,一項方法逐步成熟 從第一份 SPLASH 預印本到本篇論文,以及其後續發展
- 2022 年 6 月 24 日Chaung、Baharav、Henderson、Zheludev、Wang 與 Salzman 首次將原始 SPLASH 演算法發佈於 bioRxiv。
- 2023 年 3 月 17 日Kokot、Dehghannasiri、Baharav、Salzman 與 Deorowicz 將 SPLASH2 發佈於 bioRxiv——這是 sc-SPLASH 後續階段所沿用的快速、可擴充引擎。
- 2023 年 12 月 7 日SPLASH 通過同儕審查,發表於《Cell》。
- 2024 年 9 月 23 日SPLASH2 通過同儕審查,發表於《Nature Biotechnology》。
- 2024 年 12 月 24 日Dehghannasiri、Kokot 與同事將 sc-SPLASH 預印本發佈於 bioRxiv,首次將 SPLASH2 擴展至 barcoded 單細胞與空間資料。
- 2026 年 4 月 22 日經同儕審查、濃縮後的版本以 Brief Communication 形式發表於《Nature Biotechnology》。
- 2026 年 8 月 25 日Europe PMC 未收錄任何獨立引用、迴響或重現該論文的紀錄。
論點
統計方法換來什麼,又放棄了什麼 核心主張,歸於論文本身
論文的主張是:要在定序資料中找出真實、受規範的生物現象,並不需要參考基因體——只需要統計。sc-SPLASH 從每個讀值中取出一個固定的 k-mer,稱為anchor,以及緊隨其後、會變化的 k-mer,稱為target,然後檢驗特定 anchor 的 target 分布是否取決於它來自哪個樣本(在 barcoded 資料中即哪個細胞)。OASIS 檢定為此提供封閉形式的 p 值,以及一個從 0(分布完全相同)到 1(完全可分離)的效應量;效應量高於 0.2 且經 Benjamini–Yekutieli 校正後 p 值低於 0.05 的 anchor 會被判定為顯著。整個過程從未查看任何參考基因體。論文自身的方法段落也明確指出代價:單一 anchor 本身不帶有基因層級的意義——要把顯著的 anchor 轉回生物學意義(基因名稱、剪接位點、Pfam 結構域),需要另一個獨立、可選的步驟——建構「extendor」並加以比對或搜尋——而這並非無參考序列部分的流程所需要,也不會執行。
- 效應量,0 到 1兩組 target 分布的可分離程度。
- 封閉形式 p 值OASIS 檢定無須模擬即可控制多重檢定問題。
兩處頭條數字需要再三檢視之處 使論文本身框架複雜化的因素
基準比較的是兩件不同的工作
Cell Ranger 與 STARsolo 僅執行比對;之後仍需另一項工具,例如 Seurat 或 Scanpy,才能進行差異表達分析。sc-SPLASH 所報告的執行時間已經包含判定顯著 anchor 這一額外步驟。因此圖 1c 顯示的差距,若有偏差,也是低估了完整流程對流程的差距,而非高估——但兩者完成的並非同一件工作。
重複蛋白出現在免疫細胞中,不等於已證實其免疫角色
論文的生物學論點——即重複蛋白同時出現在海綿與被囊動物的免疫樣細胞中,可作為兩者在免疫壓力下發展出多樣性之共同策略的證據——所依據的是這些基因的表現位置,而非已證實的免疫觸發機制。在唯一一項直接測試觸發機制的海綿初步實驗中,表現量隨一般發育上升,但在免疫激活後並未出現明顯變化。跨兩個門的平行現象確實存在;但兩者的因果性免疫功能,目前皆尚未獲得證實。
補充
兩篇奠基論文,三項被拿來比較的工具 這些皆非 sc-SPLASH 本身的新發明
| 論文或工具 | 確立了什麼 |
|---|---|
| SPLASH Chaung 等人,《Cell》,2023 年 | anchor/target 統計方法本身:一種無需參考序列即可檢測樣本相依序列變異的檢定方法,最初應用於 SARS-CoV-2、盤式(plate-based)單細胞資料,以及大葉藻、章魚等非模式生物。 |
| SPLASH2 Kokot 等人,《Nature Biotechnology》,2024 年 | 快速、可擴充的 k-mer 計數引擎。sc-SPLASH 的第 2、3 階段(合併計數、計算 p 值、多重檢定校正)直接沿用此引擎;只有第 1 階段(BKC)是新的。 |
| UMI-tools Smith、Heger 與 Sudbery,《Genome Research》,2017 年 | 以網路方法修正 UMI 定序錯誤並去除重複讀值的標準做法——這正是 BKC 被拿來比較的工作,根據本論文自身的圖表,BKC 執行同一工作的速度約快 50 倍。 |
| 10x Chromium 化學方法 Zheng 等人,《Nature Communications》,2017 年 | Cell Ranger 所處理的droplet barcoding 化學方法,也是 sc-SPLASH 所有基準測試與展示資料集的生成方式。 |
| STARsolo Kaminow、Yunusov 與 Dobin,bioRxiv,2021 年 | 圖 1c 中第二個以比對為基礎的比較對象。這項工具除此預印本外從未正式發表過——提醒讀者:廣泛使用的工具,未必都經過同儕審查。 |
別人建立的圖譜,以及尚無迴響 展示用資料集的來源,以及論文本身目前得到的評論
sc-SPLASH 展示所用的三個人類資料集,沒有一個是它自己的:超過 40 萬個細胞的 Tabula Sapiens 圖譜屬於 Tabula Sapiens Consortium(《Science》,2022 年);鱗狀細胞癌 Visium 樣本屬於 Ji 及其同事(《Cell》,2020 年);胎兒小腸 Visium 樣本屬於 Fawkner-Corbett 及其同事(《Cell》,2021 年)。sc-SPLASH 對每一份資料重新分析,並未觸動其原始結論。至於論文本身的迴響:截至 2026 年 8 月 25 日,即論文發表後四個月,Europe PMC 尚未收錄任何獨立引用、迴響或重現。
結論
該記住的重點 扎實的工程成果、一個真實但因果尚未確立的生物學模式,以及尚無外部查核
速度與記憶體的結果,是最穩固的部分
在全部 11 個基準資料集中,sc-SPLASH 都比 Cell Ranger 與 STARsolo 花費更少的時間、使用更少的記憶體,而 BKC 的速度約為 UMI-tools 的 50 倍——這是直接讀取自論文自身的圖表與摘要。本頁面所載的 V(D)J 與 Ciona 同源基因計數,皆為論文圖 1e 與其補充說明中直接印出的數字,而非二手轉述。
生物學發現真實存在;免疫故事尚未有定論
在沒有匹配參考序列的海綿中發現五個新基因,以及在被囊動物中發現與之平行的重複蛋白家族,都是真實的發現——若非透過此方法,這些基因原本不會被標註,本論文所比較的以參考序列為基礎的工具,也就無從發現它們。兩個蛋白家族都出現在兩種截然不同動物的免疫樣細胞中,這是真實的模式。但它們是否會對免疫激活作出反應,目前尚未獲得證實——唯一一項相關的初步測試結果為陰性。
發表僅四個月,尚無獨立查核
本論文已通過同儕審查,程式碼也已公開,但截至 2026 年 8 月,尚無任何獨立團隊引用、重現或提出質疑。對一篇僅發表四個月的 Brief Communication 而言,這是常見現象,並非缺點——這只代表以上主張目前僅立基於這篇論文及其自身的前身預印本,尚未有他人予以確認。