過濾條件濾掉了什麼
單細胞基因體學 · 生物資訊學 · 資料品質 · 方法簡報同行評審文獻收錄至 2026 年 1 月 · 廠商資料擷取於 2026-08-26
方法簡報 · 一個細胞如何成為一個欄位
決定單細胞實驗看見什麼的那些過濾條件
在定序儀與「基因 × 細胞」矩陣之間,隔著一連串過濾條件,各自剔除一種不屬於健康單細胞的東西:只是背景訊號的條碼、早已瀕死的細胞、共用同一標籤的兩個細胞,以及從某個細胞漏出、卻被算到另一個細胞頭上的 RNA。每一道過濾都是一個門檻,而門檻本身就是一項主張:什麼不可能是細胞。其中最通用的一道——粒線體佔比超過 5% 即剔除——已在 5,530,106 個細胞上受檢,而它經不起換一種組織。
關鍵數據 已經量測過的部分
- 13 / 44種人類組織中,5% 粒線體預設值無法分辨健康與低品質細胞
- 5,530,106個細胞、1,349 組已標註資料集,構成該項發現的基礎
- 1.7%某組合條碼套組公布的跨物種雙細胞率——是下限,不是總量
- 3篇同行評審的兩種化學方法比較——得出三種不同結論
每道過濾剔除什麼,以及我們有多確定 先標明確信程度,再列主張
| 確信程度 | 內容 | 誰這麼說 |
|---|---|---|
| 已證實 | 鏈上每一道過濾都有已發表的方法支撐:EmptyDrops 區分細胞與背景;Scrublet、DoubletFinder 與 scDblFinder 找出共用同一標籤的兩個細胞;SoupX、DecontX 與 CellBender 移除算錯細胞的 RNA | 各方法論文本身,2019 至 2023 年 |
| 已證實 | 5% 粒線體預設值在受檢的 44 種人類組織中有 13 種無法分辨健康與低品質細胞,比例為 29.5%。人類組織的粒線體平均佔比顯著高於小鼠,而定序平台並不能解釋這項差異。在小鼠組織上,同一門檻大致堪用 | Osorio 與 Cai,Bioinformatics,2021 年,涵蓋 1,349 組資料集中的 5,530,106 個細胞 |
| 已證實 | 在 16 組帶有實驗標註雙細胞的真實資料集與 112 組合成資料集上,對九種雙細胞偵測方法進行基準測試,其中 DoubletFinder 偵測準確度最佳,cxds 運算效率最高 | Xi 與 Li,Cell Systems,2020 年 |
| 已證實 | 在小腦類器官上,組合條碼法與液滴捕捉法呈現相當的細胞多樣性與技術再現性——但液滴組帶有更多受壓細胞,組合條碼組則有較低的粒線體與核糖體蛋白編碼轉錄本佔比,以及更高的基因型別多樣性 | Sarieva 等人,iScience,2026 年 1 月 |
| 廠商自述 | 雙細胞率即使在 10 萬個細胞下仍低於 3%,某版本套組為 1.7%,前一版本為 1.3%;測法是將人類與小鼠細胞株等量混合,計數同時帶有兩個基因體的轉錄組 | Parse Biosciences 支援中心與資料集頁面,擷取於 2026-08-26 |
| 廠商自述 | 游離 RNA 必須完整走完某個細胞在四輪分裝—混合條碼中的同一路徑,才會被錯誤歸屬——機率為 三百五十三萬八千九百四十四分之一——且裂解前另有清洗步驟移除游離分子。環境 RNA 比訊號缺失更糟,因為缺失只是漏掉一個基因,環境 RNA 卻把基因算到錯的細胞上:一個 CD8+ T 細胞看起來像是帶有 CD4 | Parse Biosciences 支援中心,擷取於 2026-08-26;未找到該數字的獨立量測 |
| 本站推論 | 物種混合圖看不見由同物種兩個細胞組成的雙細胞。在等量雙向混合下,約有一半的雙細胞因此隱形,任何已發表的跨物種數字都只是真實比率的下限,而非估計值。這對所有廠商的物種混合數字都成立,不限於某一家 | 本站的判讀,依據 Bloom 於 PeerJ(2018 年)提出的算式 |
發生的順序
這套工具是怎麼建起來的 僅列出版品——廠商支援頁面各帶三個日期,故不列入
- 2016Ilicic 等人提出低品質細胞分類的一般性問題,在超過 5,000 個細胞上取得比傳統方法高出 30% 以上的準確度——Genome Biology
- Mar 2018SPLiT-seq:以分裝—混合接合反應,用組合條碼標記每個細胞的 RNA,不需微流體、不需訂製設備。156,049 個細胞核、超過 100 種細胞類型——Science。以下每一項比較中的組合條碼平台都源於此法
- Sep 2018Bloom 推導出在任意混合比例下,觀察到的混合轉錄組比率與真實多細胞頻率之間的關係——PeerJ
- Mar 2019EmptyDrops 以每個條碼與環境表現譜的偏離程度來判定細胞,保住了先前方法會丟棄的特殊細胞類型——Genome Biology
- Apr 2019Scrublet 與 DoubletFinder 同期刊登於 Cell Systems。兩者都用資料本身合成人工雙細胞,再看哪些真實細胞離它們最近
- Jun 2019Luecken 與 Theis 發表該領域第一份從品質控管到下游分析的端到端最佳實務教學——Molecular Systems Biology
- 2020環境 RNA 問題有了工具:3 月的 DecontX 以貝氏混合模型估計每個細胞的污染程度,12 月的 SoupX 量化污染並校正計數。兩者之間,12 月 Xi 與 Li 對九種雙細胞偵測工具做了基準測試
- 2021Osorio 與 Cai 在 5,530,106 個細胞上檢驗 5% 粒線體預設值,並改為公布 121 種小鼠與 44 種人類組織的參考值——Bioinformatics,5 月。scDblFinder 於 9 月接續問世
- 2023Heumos 等人於 3 月在 Nature Reviews Genetics 將最佳實務延伸至多模態。CellBender 於 8 月接續,把液滴背景雜訊建模為生成過程,並在模擬資料上報告其表現接近理論最佳去雜訊極限——Nature Methods
- 2024兩種化學方法首度正面比較,兩次,結論不一致。3 月 Xie 等人以人類周邊血單核細胞為材料——International Journal of Molecular Sciences;11 月 Filippov 等人以小鼠胸腺為材料——BMC Genomics
- Jan 2026Sarieva 等人第三度比較,材料為小腦類器官,發現兩種流程之間連壓力訊號本身都有差異——iScience。這是本頁最新的技術性發現
- Aug 2026商業背景,且僅有單方說法:Parse Biosciences 宣布美國聯邦巡迴上訴法院駁回 10x Genomics 的上訴,維持對其主張之專利無效的認定。本站未閱讀法院判決書,且該新聞稿本身的發稿日(8 月 19 日)與署名日期(8 月 20 日)互相矛盾。此事關乎誰能販售什麼;與上述任何量測皆無關
論點
一個帶不走的門檻 量測說了什麼,又沒有說什麼
粒線體佔比是單細胞品質控管的主力指標,其背後邏輯站得住腳:受壓細胞的細胞質轉錄本會透過崩解中的細胞膜漏出,而粒線體轉錄本因為包在自己的胞器裡而留下。於是細胞越接近死亡,粒線體在其計數中的佔比就越高,超過某個比例的細胞便予剔除。幾乎人人採用的比例是 5%。Osorio 與 Cai 指出,這個數字由早期論文訂下,被數套分析軟體採為預設值,進而成為事實上的標準——而它在不同物種、技術、組織與細胞類型之間是否成立,從未被充分檢驗。於是他們動手檢驗,範圍是 1,349 組已標註資料集中的 5,530,106 個細胞。在小鼠組織上,這個門檻大致成立。在人類組織上,它在受檢的 44 種組織中有 13 種無法分辨健康與低品質細胞,且人類的粒線體平均佔比顯著高於小鼠,而定序平台並不能解釋原因。他們給出的答案不是一個更好的常數,而是一張表:121 種小鼠組織與 44 種人類組織的參考值。五年後,Sarieva 等人發現同一項指標又動了,這次是隨化學方法而動——在他們的類器官比較中,液滴組帶有更多受壓細胞,粒線體與核糖體轉錄本佔比也高於組合條碼組,而兩者的生物材料相同。一個會隨物種、組織與捕捉方式移動的門檻,並不是細胞的性質。它是實驗的性質,卻被當成細胞的性質寫進程式。
- 29.5%受檢人類組織中的比例——44 種裡有 13 種——5% 預設值無法分辨健康與低品質細胞
- 121 + 44種組織,小鼠與人類,改以參考值表取代單一數字
- 1,349組已標註資料集構成該發現的基礎,共含 5,530,106 個細胞
這不代表什麼
這不代表 5% 這個數字是錯的。在小鼠組織上,作者報告它大致堪用,在許多人類組織上也行得通。這項發現談的是可遷移性,不是那個數字本身:一個從當初推導所用的組織,原封不動搬到沒人查證過的組織上的預設值。
這代表什麼
過濾條件不是中性的機械裝置。它剔除的每一個細胞,都是實驗從此不被允許看見的細胞;而在受檢人類組織中,將近三分之一的情況下,最常用的那道過濾分不出瀕死細胞與富含粒線體的細胞。作者把後果講得很白:省略這道過濾,或採用不恰當的門檻,可能導致錯誤的生物學詮釋。
其他來源補充了什麼
文獻其餘部分補上的四件事 化學方法、雙細胞、環境 RNA、規模
化學方法
三項比較,三種結論
- 人類周邊血單核細胞,兩位捐贈者——細胞類型比例相當。組合條碼法捕捉到的細胞較少,但憑較高的基因偵測靈敏度,偵測到漿母細胞、樹突細胞等稀有類型。兩平台的基因長度與 GC 含量分布不同(Xie,2024)
- 小鼠胸腺——組合條碼法偵測到的基因數接近兩倍,且兩平台各自偵測到不同的基因集合。但液滴資料的技術變異較低,對生物狀態的標註也更精確(Filippov,2024)
- 小腦類器官——多樣性與再現性相當,但液滴組的受壓細胞較多,組合條碼組的粒線體與核糖體佔比較低(Sarieva,2026)
雙細胞
沒有人對該用哪個工具有共識
- Xi 與 Li 對九種方法做基準測試,偵測準確度以 DoubletFinder 居首,運算效率以 cxds 居首(2020)
- scDblFinder 的論文表示,已有獨立基準測試發現 scDblFinder 勝過其他選項(2021)。那是另一份基準測試,並非重跑前一份
- 無論用哪個工具,它通常需要的輸入參數都是預期雙細胞率——而現成可用的數字來自物種混合實驗,那種實驗根本看不見同物種的雙細胞
環境 RNA
這套工具是為液滴而生的
- SoupX、DecontX 與 CellBender 在各自的摘要中都自述為液滴方法。CellBender 的模型更是明確地在推論含細胞液滴與無細胞液滴之間的差異
- 環境 RNA 比訊號缺失更糟,理由值得記住:缺失只是漏掉一個基因,環境 RNA 卻把基因交給錯的細胞——一個 CD8+ T 細胞讀起來像是同時帶有 CD4
- 沒有液滴的流程,也就沒有無細胞液滴可供建模。Parse Biosciences 自陳其錯誤歸屬機率為四輪條碼下的 三百五十三萬八千九百四十四分之一,裂解前另有清洗步驟——這是廠商自己的數字,算術上自洽,但無第三方重複驗證
規模
已發表的指引究竟怎麼說
- 某組合條碼平台公布的最低定序深度:套組第 2、3 版為每細胞 20,000 條讀序,第 4 版因文庫效率提升而降為 10,000。在異質群體中尋找稀有細胞類型需更深,同質群體則可以較淺
- 一份公布的百萬細胞操作教學,材料為 24 位捐贈者的周邊血,指定使用至少 8 個執行緒與 160 GB 記憶體的雲端執行個體
- 商業平台提供的自動細胞類型標註為 ScType、Decoupler 與 CellTypist;分群則為 Leiden 或 Louvain。這些都不是專有技術,而選哪一個,是平台交還給使用者的判斷
所以呢
從這裡帶走的五件事 以及一個沒人解決的問題
- 用你的組織去核對粒線體門檻,別去核對預設值。目前已有 121 種小鼠與 44 種人類組織的參考值,而那 44 種裡有 13 種,5% 這個數字並不管用。
- 把物種混合的雙細胞數字當成下限來讀。無論圖上顯示多少,同物種那一半的雙細胞從來就不在圖裡——而那個數字,通常正是你的雙細胞偵測工具要你填進去的參數。
- 別把平台比較當成計分板看。三份同行評審研究、三種組織、三種不同答案。挑組織與評估指標最接近你的那一份,另外兩份就當作「這個問題還沒定論」的證據。
- 問問你的環境 RNA 工具是不是為你的化學方法而寫的。三個常用工具在自己的摘要裡都寫著液滴。這不能證明它們在別處會失效;但這是個理由,值得在信任校正後的計數之前先弄清楚。
- 把廠商數字當成廠商數字看待。本頁上的每一個都很可能是對的。但沒有一個經過第三方重複驗證,而且每一個都是廠商對自家產品所做的量測。
仍未定論
該用哪個雙細胞偵測工具。一份針對九種方法的基準測試把 DoubletFinder 排在準確度第一;scDblFinder 的論文則引用另一份獨立基準測試,指其領先。兩者都已發表,本站未對它們重跑比較,也不在兩者之間做選擇。
總結
這條鏈上的每一步都是門檻,而門檻本身就是一項主張:什麼不可能是細胞。其中最通用的那一道,已被量測證實會隨組織而異、對平台敏感,卻仍以常數的形式寫進程式。問題不在這項指標失效,而在於它的適用條件沒有跟著一起被帶走——而那些條件早在 2021 年就已逐一組織地公布。