English

單細胞基因體學 · 方法綜覽Nature Biotechnology · Brief Communication

Stanford · Silesian Univ. of Tech. · Yale

跳過對齊,直接從 raw reads 做統計推論

sc-SPLASH 把 reference-free 的統計優先推論擴展到 10x Chromium 與 Visium 資料。它不先對齊到參考基因體,而是從原始 reads 抽取 k-mer 對並檢定其分布是否與樣本相依。代價是放棄基因層級的直接解釋,換來的是能看見 reference-based pipeline 會抹除的東西:等位基因、旁系同源、重複序列,以及根本不在註解裡的新基因。

  • ~20×比 Cell Ranger 快(且含統計推論)
  • 50×BKC 預處理相對 UMI-tools 的提速
  • 8 GB記憶體用量,Cell Ranger 為 70 GB
  • 400K+Tabula Sapiens 分析的單細胞數

為何 scRNA-seq 仍多半只看基因表達 既有工具的四個限制

  • 對齊偏差難避免——對缺乏高品質 reference 的物種尤其嚴重。
  • 工具各自為政——splicing、V(D)J、editing 各有專用工具,計算負擔重。
  • Barcoded droplet 資料量爆炸——百萬級細胞共用一個 library,barcode 與 UMI 易出錯。
  • 盲點:等位基因、旁系同源(paralogs)、重複序列等生物多樣性訊號,被 reference-based pipeline 抹除。

anchor + target 的統計直觀 不依賴 reference

方法直接從 raw reads 抽取 k-mer 對:一個固定的 k-mer(anchor)之後,出現多樣的 k-mer(target)。對每個 anchor 建立跨樣本的 target 計數表,再檢驗 target 的分布是否與樣本相依。SPLASH 已在 bulk 與 Smart-seq2 資料證明此路可行;本研究將它擴展到 barcoded 平台。

  • Effect size 0 → 1兩群 target 分布的可分離度。
  • Closed-form pOASIS test 給出封閉形式 p 值,可控多重檢定。

三階段管線 從 barcoded FASTQ 到 significant anchors

  1. 01BKCbarcode 萃取 · UMI 去重
  2. 02列聯表稀疏矩陣合併計數
  3. 03OASISp 值與 BY 校正

顯著性門檻為 effect size > 0.2 且 p < 0.05(Benjamini–Yekutieli 校正)。後處理可選:構建 extendor 後對 reference/Pfam/BLAST/IgBLAST 比對,並可用 JSON 設定自動化。

效能:BKC 預處理 並行 C++ 重寫,取代單線程 Python

項目BKCUMI-tools
平均耗時165 s9,272 s(僅 whitelist + extract,未含去重)
記憶體7 GB
額外功能單鹼基 barcode 校正、3-to-1 base packing、SATC 輸出

效能:與 Cell Ranger、STARsolo 比較 Tabula Sapiens muscle(donor 1)· 16 threads

工具RuntimeMemory備註
Cell Ranger v8.0.12,540 s70 GB僅對齊
STARsolo v2.7.10b491 s35 GB僅對齊
sc-SPLASH106 s8 GB含統計推論

這個比較要看清楚

Cell Ranger 與 STARsolo 只執行對齊,之後仍需 Seurat/Scanpy 才能做差異表達分析;sc-SPLASH 是一條 pipeline 直達 significant anchors。因此速度差距實際上比表中數字更大——但兩者的輸出也不是同一種東西。

Tabula Sapiens:40 萬人類細胞 跨 16 組織、2 donors

以 L1-regularized GLM 整合細胞類型 metadata 做監督式推論,找出 555 個細胞類型特異基因,包含 RPS24、MYL6 等已知的 splicing 靶點。同一 anchor 在多位 donor、跨組織重現(RPS24 37 次、MYL6 28 次)。SPLASH 對批次效應穩健——target 變異是作為「給定 anchor 的條件機率」來檢定,跨 donor 同組織的 anchor cluster 重疊顯著高於隨機(lung、muscle 兩組 p < 2.2 × 10⁻¹⁶)。

V(D)J:最高 entropy 的 Pfam domain 多樣性正是對齊的盲區

指標數值意義
Entropy2.16V-set 為最高的 Pfam domain entropy,遠超 Keratin、Histone 等
Effect size0.90兩群 target 分布幾乎完全分離,細胞特異性明確
無法對齊35 / 12128.9% 無法對齊到基因組——高多樣性正是 reference-based 工具的盲區
IgBLAST60,697in-frame V(D)J 序列(Plasma + B cells,跨 16 組織)

Visium:鱗狀細胞癌中的 mtDNA 雙突變 同一 pipeline,不需修改

在人類皮膚鱗狀細胞癌的 Visium 空間資料中,最高 effect size 的訊號是 MT-ND4 的 CC → TT 雙突變(effect size = 0.757,ChrM 11,413–11,466),主要但非完全表達於癌區——符合癌細胞譜系早期自發突變的假說。第二高的訊號區分 keratin 旁系同源 KRT16 與 KRT17(effect size = 0.348):癌區傾向表達 KRT17,正常上皮傾向 KRT16,兩者皆是 SCC 常見的上調基因。

  • Spot-levelVisium 為 spot 解析度,但 barcoded 處理框架不需修改即可套用。

跨物種的剪接保守:RPS24 exon 6 人類胚胎與電鰻

物種觀察
人類胎兒小腸(Visium,最高 effect size):上皮細胞包含 3-nt microexon(exon 5),基質細胞排除。
電鰻主電器官:electrocytes 包含 exon 6,絕緣隔膜的基質細胞排除(Chr11 7,503,567–7,506,064)。

為何這個對應說得通

電鰻的 electrocytes 源自骨骼肌系——正是少數會包含 exon 6 的人類細胞類型。兩者的 RPS24 exon 為同源序列,因此這不是巧合,而是一項跨物種保守的細胞型差異。

非模式生物:海綿的 granny anchor reference 中找不到的序列

指標數值說明
Entropy6.2整個 Spongilla lacustris 資料集中最高
Distinct targets667同一 anchor 後接的多樣序列數
BLASTn / reference 命中0odSpoLacu1.1 與 NCBI 皆無——此序列不在任何註解中
細胞型特異性73表達 granny 的細胞中,granulocytes 47(64%)、amebocytes 12(16%)

HCR RNA-FISH 確認:88% 的 Acp5⁺ 細胞同時為 granny⁺。以 PacBio HiFi 長讀手動組裝後,揭露五個 Granrep 基因——分泌型重複蛋白,共同結構為 signal peptide → 30-bp granny repeats → lysine-rich → 18-bp C 端重複,granny 重複可能經 O-醣基化。LPS 或 cGAMP 處理後第 12 天,總 Granrep 表達上升約 1.4×,與 Acp5 等 granulocyte marker 一致,暗示其在免疫防禦中的角色。

跨物種平行:海鞘的 YYD repeat Ciona robusta hemocytes

Ciona 的 24-bp 串聯重複 anchor 是水生無脊椎動物中唯一 entropy > 4 的重複序列 anchor(跨子集 4.80–5.97)。基因主要由 24-bp 重複組成、僅含 signal peptide、蛋白為分泌型,多數同源序列共享保守的 YYD(推測為酪胺酸硫酸化,類似 cionin)——與海綿的 Granrep 形成清楚的平行。RNA-FISH 顯示幼體期主要表達於循環 hemocytes,表達高峰對應變態期(孵化後 12 小時)。

  • 2 + 43HT 基因組 2 個同源基因,另有 C. intestinalis/savignyi 共 43 個 TBLASTn 命中。

sc-SPLASH 帶來什麼 五項結論

  • 無需 reference 即可發現新基因——Granrep 不在 Spongilla 基因組註解中;YYD 跨海鞘物種高度多態。
  • 同一 pipeline 處理 droplet 與 spatial——10x Chromium 與 Visium,且不需細胞標註。
  • BKC 可獨立使用——50× 更快的 UMI 去重,可插入既有 pipeline。
  • JSON 驅動的後處理——extendor → STAR/Bowtie2/Pfam/IgBLAST 全自動化。
  • 適合非模式生物——repeat-rich、高多態、缺 reference 的免疫與多樣性研究場景。