事實
生物醫學 · 機器學習 · 效能評測 · 研究簡報Nature Biotechnology · 2026 年 4 月
220 個 Biomedical Foundation Models 全景分析
生醫基礎模型正從單模態走向多模態
一項涵蓋 220 個生醫專屬基礎模型、時間跨度四年的調查。過半數(53.6%)已整合兩種以上資料模態,而自然語言正逐漸成為串接各類生醫資料的「連接介面」。研究刻意排除 ChatGPT、Gemini、Claude 等通用大型語言模型。
- 220收錄模型數,四年累積
- 53.6%多模態模型比例(118 個整合 ≥2 種模態)
- 17資料模態總類
- 4領域:語言/影像/組學/序列
| 確認程度 | 事件 | 細節 |
|---|---|---|
| 已證實 | 綜覽論文發表 | Chang、Cheng、Modi、Wang、Xu 與 Ma 發表於《Nature Biotechnology》:2026 年 4 月 30 日線上刊出,同年 8 月印行於第 44 卷第 8 期第 1263–1266 頁。DOI 10.1038/s41587-026-03135-y。 |
| 已證實 | 220 個模型、四大領域,逾半為多模態 | 本頁的每一項計數與比例——220、118(53.6%)、架構分布與評估分布——皆載於論文正文,並由該處讀得。 |
| 已證實,但此處無法查驗 | 這 220 個模型究竟是哪些 | 名單見補充表 1。該檔案由資料庫以驗證機制保護,本專案無法通過,因此並未逐一讀過——此處的計數出自論文,而非重新清點。 |
| 已證實,但此處無法查驗 | 引用數 | 引用數取自 Semantic Scholar,且僅印於論文的圖中,而該圖並未註明擷取時間。此處是自該圖讀得。引用數會變動,故應視為某個未註明日期的時點,而非當下排名。 |
何謂生醫基礎模型 本調查的界定範圍
- 大規模機器學習模型,訓練於多元的生醫與臨床資料。
- 資料涵蓋基因序列、分子剖析(molecular profiling)、生醫影像、電子病歷(EHR)。
- 學習通用表徵(generalizable representations),以支援下游發現與臨床應用。
- 調查涵蓋四大領域:自然語言、影像訊號、組學(omics)、分子序列。
- 排除通用 LLM,聚焦 220 個生醫專屬模型。
時序
從 BioBERT 到 Evo 2 調查中提及的每個模型,均標示其首次發表日期
- 2020 年 2 月 15 日BioBERT 發表——以 PubMed 摘要與 PMC 全文重新訓練的 BERT;後來成為調查中自然語言領域引用數最高的模型。
- 2021 年 4 月 13 日ESM-1b 證明,僅以 2.5 億條蛋白質序列訓練、完全不需標註的語言模型也能學得真實的結構資訊;它是調查中分子序列領域引用數最高模型的前身。
- 2024 年 2 月 26 日scGPT 發表,其預訓練資料涵蓋超過 3,300 萬個單一細胞;後來成為調查中組學領域引用數最高的模型。
- 2024 年 3 月 19 日UNI 發表,其預訓練資料取自超過 10 萬張病理全玻片影像;後來成為調查中影像訊號領域引用數最高的模型。
- 2025 年 1 月 16 日ESM3 發表——一個能同時對蛋白質序列、結構與功能進行推理的生成式模型;調查後來將其列為 2025 年後新興領跑者之一。
- 2026 年 3 月 4 日Evo 2 發表,其訓練資料涵蓋所有生命域、共 9 兆個 DNA 鹼基對;調查將其列為另一個 2025 年後新興領跑者。
- 2026 年 4 月 30 日Chang、Cheng、Modi、Wang、Xu 與 Ma 於《Nature Biotechnology》線上發表本篇調查本身。
- 2026 年 8 月本篇調查刊登於《Nature Biotechnology》紙本期刊,第 44 卷第 8 期,頁 1263–1266。
論點
關鍵觀察
自然語言最常與其他模態配對,逐漸成為跨資料類型的連接介面(connective interface)。這一點貫穿全文——後段的新興引用領跑者與未充分發展方向,都指回同一個結構。
編碼器架構占主導 架構分布
| 架構 | 數量 | 占比 |
|---|---|---|
| Encoder-based 編碼器 | 114 | 51.8% |
| Mixed 混合架構 | 67 | 30.5% |
| Decoder-based 解碼器 | 31 | 14.1% |
| Non-Transformer(如 Mamba) | — | 3.6% |
解碼器較少的原因並非架構偏好,而是資料條件:文字生成任務需要高品質的 image–text 標註配對,這在生醫領域取得困難。
評估方式仍偏單一 下游任務分布
| 評估任務 | 占比 |
|---|---|
| Classification 分類 | 50.9% |
| Report generation 報告生成 | 10.9% |
| Question answering 問答 | 8.6% |
| Segmentation 分割 | 7.3% |
評估缺口
缺乏多任務基準(multitask benchmarks)、人在迴路評估(human-in-the-loop),以及對資料品質、可解釋性與轉譯相關性的綜合考量。半數模型只在分類任務上被檢驗過。
各領域的引用王者 * 表示多模態模型 · 引用數為 Semantic Scholar 的某次快照,原文未註明日期
| 領域 | 領先模型與引用數 |
|---|---|
| Natural language 自然語言 | BioBERT 6,925 · MultiMedQA 3,707 · PubMedBERT 2,278 |
| Imaging & signals 影像訊號 | UNI 1,141 · ConVIRT* 1,003 · MedCLIP* 794 |
| Omics 組學 | scGPT 846 · Geneformer 836 · scBERT 509 |
| Molecular sequences 分子序列 | ESM-1b 2,807 · ProtTrans 1,207 · DNABERT 1,051 |
2025 年後的新興領跑者 增長由多模態推動
| 領域 | 2025 年後的新興領跑者與引用數 |
|---|---|
| Natural language 自然語言 | MedGemma-27B 165 · MediPhi-Instruct 13 |
| Imaging & signals 影像訊號 | BiomedCLIP* 498 · Quilt-1M* 216 · MedGemma* 165 |
| Omics 組學 | Nicheformer* 81 · OmiCLIP* 58 · scGPT-spatial 34 |
| Molecular sequences 分子序列 | ESM3 201 · Evo 2 197 · Borzoi 190 |
引用成長的動力來自整合異質模態的模型,而非單一資料類型的專門模型。十一個新興領跑者中有五個是多模態;四個領域裡,只有自然語言不足三個。
補充
領先模型實際上在做什麼 各領域領跑者背後的獨立論文
調查中引用數最高的那些名字,都有各自獨立的文獻,說明的是為什麼它們能夠領先,而不只是被引用了多少次。BioBERT 是以 PubMed 摘要與 PMC 全文重新訓練的 BERT,這正是它在生醫命名實體辨識、關係抽取與問答任務上優於通用 BERT 的原因。ESM-1b 從 2.5 億條未標註的蛋白質序列中學得表徵;其直系後繼者 ESM3 能同時對蛋白質的序列、結構與功能進行推理,本身也是調查中 2025 年後新興領跑者之一。影像訊號領域領跑者 UNI,其預訓練資料取自 20 種組織類型、超過 10 萬張病理全玻片影像,並在 34 項不同的診斷任務上接受測試。組學領域領跑者 scGPT,其預訓練資料涵蓋超過 3,300 萬個單一細胞。另一個新興領跑者 Evo 2,訓練資料涵蓋所有生命域、共 9 兆個 DNA 鹼基對,即使未針對該任務進行微調,也能預測基因變異的影響——包括具臨床意義的 BRCA1 突變。
- 250MESM-1b 學習所用的蛋白質序列數,完全沒有標註(Rives 等人,2021)。
- 100k+UNI 預訓練所用的病理全玻片影像數,涵蓋 20 種組織類型(Chen 等人,2024)。
- 33MscGPT 預訓練所用的單一細胞數(Cui 等人,2024)。
- 9TEvo 2 訓練資料所涵蓋的 DNA 鹼基對數,橫跨所有生命域(Brixi 等人,2026)。
尚未充分發展的整合方向 三個機會,一個共同瓶頸
機制可解釋性
語言 ↔ 序列/組學
- 以語言介面協助 scRNA-seq 註解、通路富集(pathway enrichment)、空間轉錄體。
治療標的
影像 ↔ 組學
- H&E 病理 ↔ omics 的整合仍偏弱。
- 連結組織形態與分子機制的潛力大。
跨調控層次
DNA / RNA / 蛋白質 / 表觀
- 各層次連結度有限,尤其蛋白質與其他模態之間。
主要瓶頸不是想法
阻礙並非概念缺乏,而是資料條件:配對資料稀少、預處理與標註標準不一、缺乏標準化的多模態基準。這與前文「解碼器較少」的成因是同一件事。
結論
高採用因素與展望 什麼讓一個模型被真正使用
- 對應高影響應用:臨床語言處理、蛋白質建模、數位病理。
- 評估嚴謹度:多元下游任務測試提升信任與重用。
- 可近用性:公開預訓練權重、程式碼、易用介面。
- 新關鍵:與 agent-based AI 工作流的整合相容性。
待解難題
資料品質、世代多樣性(cohort diversity)、批次效應(batch effects)、隱私安全、幻覺(hallucination)、對抗穩健性——這些仍限制真實場景的部署。作者建議以跨領域協作(生物學家 × 臨床醫師 × 模型開發者),並以高效微調強預訓練骨幹(efficient adaptation)取代從頭訓練。