改變了什麼
定序技術 · AI 人工智慧 · 效能評測 · 基因體學 · 比較Tratopedia · 2026 年 8 月 17 日
Oxford Nanopore 的四代鹼基判讀模型,當成一段「改了什麼」的歷史來讀,而不是一張排名表
Dorado v3 到 v6——改變了什麼、改變大不大、改變得好不好
從 2023 年到 2026 年 5 月,Oxford Nanopore 推出了四代鹼基判讀模型。就現有的量測而言,每一代都比上一代好。但每一步的增幅都在縮小,運算成本曾經一次大幅跳升,而最新一代乾脆放掉了最準的那個層級——所以 Oxford Nanopore 目前最準的模型,仍然是 2025 年 5 月推出的 sup@v5.2.0。本文要交代的是:改變了什麼、每一次改變有多大,以及哪些改變值得。
- 0推出的 DNA
sup@v6模型數量——v6 是只有 HAC 的一代 - 18.7%HAC 從 v5.2.0 到 v6.0.0 減少的讀取錯誤,依已發表的 Q 值重新計算
- 43.8%
sup@v5.2.0的讀取錯誤仍比hac@v6.0.0少的幅度 - 2.7–5.7×同一次執行中,SUP 比 HAC 慢多少
改變了什麼,以及每一項確立到什麼程度 把可信度放在第一欄,因為放在主張後面就會被當成註腳;各列依可信度分組,絕不交錯
| 可信度 | 改變 | 幅度 |
|---|---|---|
| 已確認——可自行重現 | SUP 在 v5.0.0 改成 transformer;HAC 一路都是遞迴架構,並在 v6.0.0 換上新的自訂遞迴設計 | sup 有 78,718,162 個參數,hac@v5.2.0 是 8,790,768——8.95× |
| 已確認——可自行重現 | Oxford Nanopore 沒有推出 sup@v6.0.0,也沒有 fast@v6.0.0 | v6.0.0 只有 HAC |
| 已確認——可自行重現 | sup@v5.0.0 與 sup@v5.2.0 大小相同 | 兩者都是 78,718,162 個參數——變的是權重與訓練,架構沒變 |
| 已發表的量測 | HAC 的讀取準確率中位數每一步都上升:v5.0.0 → v5.2.0 → v6.0.0 | Q16.3 → Q17.2 → Q18.1,也就是每一步減少 18.7% 的錯誤 |
| 已發表的量測 | 整段歷史中 SUP 最大的進步是 v4.2.0 → v4.3.0,發生在換成 transformer 之前 | 中位數 Q18.5 → Q20.5,讀取錯誤少 36.9%;九個基因體的組裝錯誤 173 → 37 |
| 已發表的量測 | SUP 的讀取準確率從 v5.0.0 到 v5.2.0 沒有變化 | 兩者中位數都約 Q20.6;組裝平均 Q60.4 → Q61.6 |
| 廠商說法 | v5 SUP「achieves Q26」——原始讀取準確率眾數 99.75% | 眾數,而且用的是 Oxford Nanopore 自己挑的資料 |
| 廠商說法 | HAC v6.0.0 達到單分子準確率 Q23.5 | 而獨立量測到的中位數是 Q18.1,眾數約 Q19.7 |
| 廠商說法 | SUP 這個層級「已經不需要了」 | 這是不推出 SUP v6 所給的理由 |
| 單一使用者報告 | 在一組配對資料上,sup@v5.2.0 的 Q 值低於 sup@v5.0.0 | 27,751 條完全相同的讀取;通過 Q20 的少了 62.5% |
| 未公開 | 任何在相同原始資料上、逐條讀取比較 sup@v4.3.0 與 sup@v5.0.0 的結果 | 架構變更是這裡最大的事件,證據卻最薄弱 |
| 已被取代 | 早先一份研究整理把第四代 SUP 的準確率、產出量、記憶體與吞吐量都列成了表 | 它描述的那個模型並不存在 |
被虛構出來的那一欄是一項發現,不是主題
本文最初是依一份研究整理寫成的,那份整理為 DNA sup@v6 列出了準確率數字。這樣的模型從未推出,而 Oxford Nanopore 也公開說明了為什麼不推出。這件事值得知道——一張讀起來順暢的表格,並不足以證明它的欄位存在——但它只是上表中的一列。把整篇文章建立在工具的失誤上,寫出來的是那個工具,而不是主題。
本頁每一個百分比都重新算過
讀取準確率以 Q 值表示,而 Q 值是對數:錯誤率是 10^(−Q/10)。因此 Q 值不能相減,本頁的錯誤下降幅度都是從旁邊那些 Q 值自行推導出來的,而不是從來源直接抄過來。其中三個算出來不一樣——見「其他來源補充了什麼」。
先後順序
事情發生的順序 模型版本以推出時間為準;此處每一項都有文獻,唯一無法排進序列的一項列在最後
- 2023v4.2.0 帶來 5 kHz 取樣——每個核苷酸約 12.5 個取樣點,原本約 10 個。這是化學端的改變,不是模型品質的改變,不該併進準確率趨勢裡。
- 2024v4.3.0 的 SUP 併入了細菌甲基化訓練,那原本需要另一個研究用模型。架構仍是 LSTM,而它仍是這段歷史裡單次最大的準確率躍升。
- May 2024v5.0.0 在 London Calling 發表,搭配 Dorado 0.7:SUP 從 LSTM 換成 transformer;HAC 維持遞迴。Oxford Nanopore 以 Q26 作為標題數字。Clive Brown 說最高準確率的 Q30 模式「four times slower」,產出量約少 15%。
- 2025Dorado 1.0.0 移除 R9.4.1 支援——最後一次支援是 v0.9.6——同時移除 4 kHz 的 R10.4.1 與 RNA002。模型是綁定化學的,所以這也關上了用新模型重跑舊資料的門。
- May 2025v5.2.0 在 London Calling 發表,搭配 Dorado 1.0.0:HAC 由五層 LSTM 增為七層;SUP 保持架構不變,只換權重與訓練。
- May 2026v6.0.0 在 London Calling 發表,搭配 Dorado 2.0.0:只有 HAC 換上新的自訂遞迴架構。機器學習副總裁 Mike Vella 說:「Importantly, we’re not releasing a sup model this time… we believe that this particular model is good enough that a sup tier is no longer needed.」
- 9 Jul 2026HAC v6 在某個 Klebsiella 基因體上約 100 個錯誤,解釋改變了:依 Biggel 的預印本,成因是 dpd 系統帶來的 7-去氮鳥嘌呤,取代了先前關於硫代磷酸骨架修飾的推測。兩者其實是同一種成因——訓練資料裡沒有的修飾。
讀者可能採用的兩種排序——依日期,以及依證據強弱——只在一個地方彼此不合,而那正是最要緊的地方。v5.0.0 換成 transformer 是這段歷史裡最大的改變,也是直接證據最薄弱的一項。沒有任何公開資料在相同原始資料上逐條比較 sup@v4.3.0 與 sup@v5.0.0,那次轉換也沒有乾淨的產出量比較。存在的是共識序列層級的證據:經同儕審查的 cgMLST 研究發現,在相同菌株上 v5.0 明顯優於 v4.3,經修飾後與 Illumina 參考序列的平均等位基因距離從約 1.78 降到約 0.04。
那是真的證據,但不是同一種證據。多數實驗室在意的是共識序列準確率;而模型版本聲稱改變的是逐條讀取的準確率。這個大家都當成架構轉折點的一步,有一部分只能相信廠商的說法。
- 1.78 → 0.04v4.3 對 v5.0、經修飾後與 Illumina 參考序列的平均 cgMLST 等位基因距離——經同儕審查,且屬共識序列層級而非逐條讀取
- none在相同原始資料上、逐條比較 v4.3.0 與 v5.0.0 的公開結果
來源的主張
這份比較自己的論點 這份附件報告主張什麼,以及它自己的數字在哪裡讓事情變複雜
這份報告的論點是一個形狀,而不是一個判決:在同一層級內,較新的世代整體上提升了準確率,但增幅急遽放緩,而且並非總是單向——同時效能往相反方向走,因為 transformer 版的 SUP 模型比它取代的 LSTM 版明顯更慢、更吃資源。
它在這個題目最容易草率的兩處都很謹慎。它把廠商數字和獨立數字分開,而不是取平均;也明白說出:儘管 Oxford Nanopore 對外表示 SUP 已不需要,這個層級仍是追求準確率時的選擇。接著它自己的數字兩度讓趨勢線變得複雜:SUP 從 v5.0.0 到 v5.2.0 是平的,在某一組資料上還略為下降;而修飾鹼基判讀根本不跟著版本順序走——就一般的 CpG 5mC 而言,v4 世代的模型分數最高。
- decelerating報告關於準確率的核心主張,也是為什麼版本號不適合當作決策依據
- opposite準確率提升時,效能移動的方向
主張 1
準確率提升過,然後就不太提升了
- SUP 最大的一次躍升是 v4.2.0 到 v4.3.0——那時架構還完全沒變。
- v5.0.0 到 v5.2.0 幾乎沒有改動 SUP 的讀取準確率。
- HAC 持續以真實但溫和的幅度前進:每一代少 18.7% 的讀取錯誤。
主張 2
代價往另一個方向走
- SUP 的參數量是 HAC 的 8.95×,在每一次量測到的執行中都是運算瓶頸。
- Oxford Nanopore 自己的 Q30 模式,代價約是四倍的速度與約 15% 的產出量。
- HAC v6.0.0 是例外:參數比 v5.2.0 多,卻靠最佳化略快一些。
主張 3
被放掉的那個層級仍然是最好的
- 並不存在
sup@v6.0.0;給出的理由是 HAC v6 讓這個層級變得沒有必要。 - 獨立測試顯示
sup@v5.2.0的讀取錯誤比hac@v6.0.0少 43.8%。 - 組裝錯誤中位數:SUP v5.2.0 是 4,HAC v6.0.0 是 11。
- 並不存在
其他來源補充了什麼
量測結果,以及我們算出來不一樣的三處 此處每一個數字都以獨立測試為骨幹;以下三處分歧是本文自己的,由來源自己的數字推導而來
| 轉換 | 讀取準確率中位數 | 讀取錯誤減少 | 組裝錯誤中位數 |
|---|---|---|---|
| HAC v5.0.0 → v5.2.0 | Q16.3 → Q17.2 | 18.7% | 37.5 → 13 |
| HAC v5.2.0 → v6.0.0 | Q17.2 → Q18.1 | 18.7% | 25.5 → 11 |
| SUP v4.2.0 → v4.3.0 | Q18.5 → Q20.5 | 36.9% | 173 → 37 total, nine genomes |
| SUP v5.0.0 → v5.2.0 | ~Q20.6 → ~Q20.6 | — | 3 → 3 |
sup@v5.2.0 對 hac@v6.0.0 | Q20.6 against Q18.1 | 43.8% | 4 against 11 |
| 同一次執行、同一份資料 | HAC | SUP | 比值 |
|---|---|---|---|
| Dorado 1.0.0,未開啟修飾判讀 | hac@v5.2.0 3h18m | sup@v5.2.0 18h45m | 5.7× |
| Dorado 2.0.0,開啟修飾判讀 | hac@v5.2.0 8h04m | sup@v5.2.0 21h33m | 2.7× |
我們的算式,一
一個百分比跟它的數字走散了
- 來源說讀取錯誤約少 15%,而它列出的是 Q16.3 到 Q17.2。
- Q16.3 到 Q17.2 是 18.7%。那個 15% 屬於 Q17.0——14.9%。
- 來源自己記載了:較早那篇寫 Q17.0,較晚那篇寫 Q17.2,所以 Q 值更新了,百分比沒有。這是小事,卻正好示範了為什麼百分比應該用旁邊的數字重新算一次。
我們的算式,二
並不是一個數量級
- 只在同一次執行內比較,關閉修飾判讀時 SUP 花的時間是 HAC 的 5.7×,開啟時是 2.7×。
- 兩次執行中,吞吐量比值與實際耗時比值都吻合到小數第二位,所以這不是誤讀。
- 9× 那個數字是參數比,這是對的。要抵抗的是從參數滑到吞吐量那一步。
我們的算式,三
有一代真正的進步只在軟體
- 參數量完全相同,讀取準確率也沒有動。
- 吞吐量提升 34%——同一份資料從 25h06m 降到 18h45m。
- 來源把這兩個數字都印出來了,卻沒有把它們連起來。在這次轉換裡,變好的是工程,而不是模型。
改變得好不好
每一項改變,量過也判過 一部版本史必須回答的三個問題:改變了什麼、改變大不大、改變得好不好
| 改變 | 幅度多大 | 好不好 |
|---|---|---|
| SUP v4.2.0 → v4.3.0,LSTM 權重 | 大——讀取錯誤少 36.9%,組裝錯誤降到原本的 21.4% | 好,毫無疑問。整段歷史中最划算的一次,而且來自訓練而非架構 |
| SUP v4.3.0 → v5.0.0,LSTM 換 transformer | 聲稱很大;但公開資料無法逐條量測 | 就共識序列證據看,大概是好的。經同儕審查的 cgMLST 改善是真的,逐條讀取那一面則靠廠商數字 |
| SUP v5.0.0 → v5.2.0,只換權重 | 準確率沒有;吞吐量 34% | 是好的,但不是宣傳的那樣。一次穿著模型版號的速度發布,而且在某一組資料上 Q 值還下降了 |
| HAC v5.0.0 → v5.2.0,五層變七層 | 讀取端溫和,18.7%;組裝端大,錯誤少 65% | 好——代價是約 20% 的吞吐量,這是誠實的價格 |
| HAC v5.2.0 → v6.0.0,新的遞迴設計 | 讀取端溫和,18.7%;組裝錯誤少 57%,但取樣深度不同 | 好,而且便宜——參數更多卻略快。要留意的是它會失手的那個基因體 |
| 沒有 SUP v6 | 2026 年準確率的天花板沒有移動 | 就證據看並不好。那個被說成不需要的層級,讀取錯誤仍比據稱要取代它的模型少 43.8% |
- 準確率要緊的工作,用
sup@v5.2.0。到 2026 年 8 月為止,它是已推出的模型中最準的,較新的 HAC 世代並沒有追上。不要把沒有 SUP v6 讀成「該換了」的建議。 - 若受限於運算資源,
hac@v6.0.0是正確的 HAC 選擇——比 v5.2.0 更準,而且不會更慢。要知道它唯一有記載的失手:在一個帶有訓練資料所無之鹼基修飾的基因體上約 100 個錯誤。 - 不要把版本較新當成在你的資料上一定品質較好。有一次 SUP 的轉換是平的,在某一組資料上還是負的。採用前先在子集上驗證。
- 換模型後,重新檢視任何 Q 值篩選門檻。在完全相同的讀取上,較新的模型讓通過 Q20 的少了 62.5%——那是重新校準,不是失去序列。要看對齊後的準確率,而不是 Q 值。
- 依修飾種類挑模型,而不是依日期。一般的 CpG 5mC 以 v4 世代分數最高;非 CpG 的 5mC 與 4mC,以及 6mA,則是 v5 世代之後較好。
- 比較不同研究之前,先用該化學自己最新的模型重跑舊資料——但只限它自己的:R10 的模型不能用在 R9 的資料上,而 R9.4.1 的支援在 Dorado v0.9.6 之後就結束了。
一句話說完這個模式
每一代都是進步,而每一次進步都比上一次小;同時運算成本猛然跳升過一次,然後就留在那裡。這是一項技術成熟時的常見形狀,也正是為什麼版本號不適合當作決策依據:這段歷史中最大的準確率增幅,來自重新訓練一個舊架構;而最近一代最清楚的勝利,是它沒有變慢。
哪些要保留懷疑
此處幾乎每一個跨版本數字,都來自單一化學條件下的細菌菌株,由同一位獨立測試者量測;人類、宏基因體與 RNA 的結果可能不同。廠商數字與獨立數字並非同一基準——眾數對中位數,資料的挑選方式也不同——而兩者之間的差距,本身並不足以證明其中任一個是錯的。時間數字來自共用機器,其作者自己說控制得不嚴謹,這也是為什麼本頁每一個比值都只在同一次執行內取得。
什麼會改變這個答案
推出 sup@v6.0.0;或是有 HAC 模型經獨立驗證達到 SUP 約 Q20.6 的讀取準確率與四個錯誤的組裝水準;或是有一版 Dorado 把吞吐量差距補上。在其中一項發生之前,準確率的天花板是 2025 年 5 月的一個模型,而達到那個高度的層級已經停產。