摘要 · Nature Biotechnology 2026
單細胞基因體學 · 方法綜覽Nature Biotechnology · Brief Communication
Stanford · Silesian Univ. of Tech. · Yale
跳過對齊,直接從 raw reads 做統計推論
sc-SPLASH 把 reference-free 的統計優先推論擴展到 10x Chromium 與 Visium 資料。它不先對齊到參考基因體,而是從原始 reads 抽取 k-mer 對並檢定其分布是否與樣本相依。代價是放棄基因層級的直接解釋,換來的是能看見 reference-based pipeline 會抹除的東西:等位基因、旁系同源、重複序列,以及根本不在註解裡的新基因。
- ~20×比 Cell Ranger 快(且含統計推論)
- 50×BKC 預處理相對 UMI-tools 的提速
- 8 GB記憶體用量,Cell Ranger 為 70 GB
- 400K+Tabula Sapiens 分析的單細胞數
起 · 動機與方法 · 內容 1 / 3
為何 scRNA-seq 仍多半只看基因表達 既有工具的四個限制
- 對齊偏差難避免——對缺乏高品質 reference 的物種尤其嚴重。
- 工具各自為政——splicing、V(D)J、editing 各有專用工具,計算負擔重。
- Barcoded droplet 資料量爆炸——百萬級細胞共用一個 library,barcode 與 UMI 易出錯。
- 盲點:等位基因、旁系同源(paralogs)、重複序列等生物多樣性訊號,被 reference-based pipeline 抹除。
anchor + target 的統計直觀 不依賴 reference
方法直接從 raw reads 抽取 k-mer 對:一個固定的 k-mer(anchor)之後,出現多樣的 k-mer(target)。對每個 anchor 建立跨樣本的 target 計數表,再檢驗 target 的分布是否與樣本相依。SPLASH 已在 bulk 與 Smart-seq2 資料證明此路可行;本研究將它擴展到 barcoded 平台。
- Effect size 0 → 1兩群 target 分布的可分離度。
- Closed-form pOASIS test 給出封閉形式 p 值,可控多重檢定。
三階段管線 從 barcoded FASTQ 到 significant anchors
- 01BKCbarcode 萃取 · UMI 去重
- 02列聯表稀疏矩陣合併計數
- 03OASISp 值與 BY 校正
顯著性門檻為 effect size > 0.2 且 p < 0.05(Benjamini–Yekutieli 校正)。後處理可選:構建 extendor 後對 reference/Pfam/BLAST/IgBLAST 比對,並可用 JSON 設定自動化。
轉 · 效能與人類資料應用 · 內容 2 / 3
效能:BKC 預處理 並行 C++ 重寫,取代單線程 Python
| 項目 | BKC | UMI-tools |
|---|---|---|
| 平均耗時 | 165 s | 9,272 s(僅 whitelist + extract,未含去重) |
| 記憶體 | 7 GB | — |
| 額外功能 | 單鹼基 barcode 校正、3-to-1 base packing、SATC 輸出 | — |
效能:與 Cell Ranger、STARsolo 比較 Tabula Sapiens muscle(donor 1)· 16 threads
| 工具 | Runtime | Memory | 備註 |
|---|---|---|---|
| Cell Ranger v8.0.1 | 2,540 s | 70 GB | 僅對齊 |
| STARsolo v2.7.10b | 491 s | 35 GB | 僅對齊 |
| sc-SPLASH | 106 s | 8 GB | 含統計推論 |
這個比較要看清楚
Cell Ranger 與 STARsolo 只執行對齊,之後仍需 Seurat/Scanpy 才能做差異表達分析;sc-SPLASH 是一條 pipeline 直達 significant anchors。因此速度差距實際上比表中數字更大——但兩者的輸出也不是同一種東西。
Tabula Sapiens:40 萬人類細胞 跨 16 組織、2 donors
以 L1-regularized GLM 整合細胞類型 metadata 做監督式推論,找出 555 個細胞類型特異基因,包含 RPS24、MYL6 等已知的 splicing 靶點。同一 anchor 在多位 donor、跨組織重現(RPS24 37 次、MYL6 28 次)。SPLASH 對批次效應穩健——target 變異是作為「給定 anchor 的條件機率」來檢定,跨 donor 同組織的 anchor cluster 重疊顯著高於隨機(lung、muscle 兩組 p < 2.2 × 10⁻¹⁶)。
V(D)J:最高 entropy 的 Pfam domain 多樣性正是對齊的盲區
| 指標 | 數值 | 意義 |
|---|---|---|
| Entropy | 2.16 | V-set 為最高的 Pfam domain entropy,遠超 Keratin、Histone 等 |
| Effect size | 0.90 | 兩群 target 分布幾乎完全分離,細胞特異性明確 |
| 無法對齊 | 35 / 121 | 28.9% 無法對齊到基因組——高多樣性正是 reference-based 工具的盲區 |
| IgBLAST | 60,697 | in-frame V(D)J 序列(Plasma + B cells,跨 16 組織) |
合 · 空間、跨物種與新基因 · 內容 3 / 3
Visium:鱗狀細胞癌中的 mtDNA 雙突變 同一 pipeline,不需修改
在人類皮膚鱗狀細胞癌的 Visium 空間資料中,最高 effect size 的訊號是 MT-ND4 的 CC → TT 雙突變(effect size = 0.757,ChrM 11,413–11,466),主要但非完全表達於癌區——符合癌細胞譜系早期自發突變的假說。第二高的訊號區分 keratin 旁系同源 KRT16 與 KRT17(effect size = 0.348):癌區傾向表達 KRT17,正常上皮傾向 KRT16,兩者皆是 SCC 常見的上調基因。
- Spot-levelVisium 為 spot 解析度,但 barcoded 處理框架不需修改即可套用。
跨物種的剪接保守:RPS24 exon 6 人類胚胎與電鰻
| 物種 | 觀察 |
|---|---|
| 人類 | 胎兒小腸(Visium,最高 effect size):上皮細胞包含 3-nt microexon(exon 5),基質細胞排除。 |
| 電鰻 | 主電器官:electrocytes 包含 exon 6,絕緣隔膜的基質細胞排除(Chr11 7,503,567–7,506,064)。 |
為何這個對應說得通
電鰻的 electrocytes 源自骨骼肌系——正是少數會包含 exon 6 的人類細胞類型。兩者的 RPS24 exon 為同源序列,因此這不是巧合,而是一項跨物種保守的細胞型差異。
非模式生物:海綿的 granny anchor reference 中找不到的序列
| 指標 | 數值 | 說明 |
|---|---|---|
| Entropy | 6.2 | 整個 Spongilla lacustris 資料集中最高 |
| Distinct targets | 667 | 同一 anchor 後接的多樣序列數 |
| BLASTn / reference 命中 | 0 | odSpoLacu1.1 與 NCBI 皆無——此序列不在任何註解中 |
| 細胞型特異性 | 73 | 表達 granny 的細胞中,granulocytes 47(64%)、amebocytes 12(16%) |
HCR RNA-FISH 確認:88% 的 Acp5⁺ 細胞同時為 granny⁺。以 PacBio HiFi 長讀手動組裝後,揭露五個 Granrep 基因——分泌型重複蛋白,共同結構為 signal peptide → 30-bp granny repeats → lysine-rich → 18-bp C 端重複,granny 重複可能經 O-醣基化。LPS 或 cGAMP 處理後第 12 天,總 Granrep 表達上升約 1.4×,與 Acp5 等 granulocyte marker 一致,暗示其在免疫防禦中的角色。
跨物種平行:海鞘的 YYD repeat Ciona robusta hemocytes
Ciona 的 24-bp 串聯重複 anchor 是水生無脊椎動物中唯一 entropy > 4 的重複序列 anchor(跨子集 4.80–5.97)。基因主要由 24-bp 重複組成、僅含 signal peptide、蛋白為分泌型,多數同源序列共享保守的 YYD(推測為酪胺酸硫酸化,類似 cionin)——與海綿的 Granrep 形成清楚的平行。RNA-FISH 顯示幼體期主要表達於循環 hemocytes,表達高峰對應變態期(孵化後 12 小時)。
- 2 + 43HT 基因組 2 個同源基因,另有 C. intestinalis/savignyi 共 43 個 TBLASTn 命中。
sc-SPLASH 帶來什麼 五項結論
- 無需 reference 即可發現新基因——Granrep 不在 Spongilla 基因組註解中;YYD 跨海鞘物種高度多態。
- 同一 pipeline 處理 droplet 與 spatial——10x Chromium 與 Visium,且不需細胞標註。
- BKC 可獨立使用——50× 更快的 UMI 去重,可插入既有 pipeline。
- JSON 驅動的後處理——extendor → STAR/Bowtie2/Pfam/IgBLAST 全自動化。
- 適合非模式生物——repeat-rich、高多態、缺 reference 的免疫與多樣性研究場景。