Apa Yang Berlaku
Bioperubatan · Pembelajaran mesin · Penanda aras · Ringkasan PenyelidikanNature Biotechnology · April 2026
Tinjauan terhadap 220 model asas bioperubatan
Model Asas Bioperubatan Sedang Beralih Daripada Satu Modaliti kepada Banyak
Tinjauan terhadap 220 model asas khusus bioperubatan yang dibangunkan sepanjang empat tahun. Lebih separuh — 53.6% — sudah pun menggabungkan dua atau lebih modaliti data, dan bahasa tabii sedang muncul sebagai antara muka penghubung antara jenis data bioperubatan yang selainnya tidak berkaitan. Model bahasa besar serba guna seperti ChatGPT, Gemini dan Claude dikecualikan dengan sengaja.
- 220model dikumpulkan, sepanjang empat tahun
- 53.6%adalah multimodal — 118 menggabungkan dua atau lebih modaliti
- 17modaliti data yang berbeza kesemuanya
- 4domain: bahasa, pengimejan, omik, jujukan
| Taraf | Apa yang berlaku | Perincian |
|---|---|---|
| Disahkan | Tinjauan itu diterbitkan | Chang, Cheng, Modi, Wang, Xu dan Ma, dalam Nature Biotechnology — dalam talian pada 30 April 2026, bercetak pada Ogos tahun itu di 44(8):1263–1266. DOI 10.1038/s41587-026-03135-y. |
| Disahkan | 220 model, empat bidang, lebih separuh multimodal | Setiap kiraan dan bahagian pada halaman ini — 220, 118 (53.6%), pecahan seni bina dan pecahan penilaian — dinyatakan dalam teks makalah itu sendiri dan dibaca dari situ. |
| Disahkan, tidak dapat disemak di sini | Model 220 yang mana satu | Senarainya ialah Jadual Tambahan 1. Repositori menyajikan fail itu di sebalik cabaran yang tidak dapat dilepasi projek ini, jadi senarai itu tidak pernah dibaca model demi model — kiraan itu milik makalah, bukan kiraan semula. |
| Disahkan, tidak dapat disemak di sini | Kiraan petikan | Ia datang daripada Semantic Scholar dan hanya dicetak di dalam rajah makalah itu, yang tidak menyatakan bila petikan sesaat itu diambil. Ia dibaca daripada rajah tersebut. Kiraan petikan berubah, jadi anggaplah ia satu detik tanpa tarikh dan bukan kedudukan semasa. |
Apa Yang Dikira Sebagai Model Asas Bioperubatan sempadan tinjauan itu
- Model pembelajaran mesin berskala besar yang dilatih dengan pelbagai data bioperubatan dan klinikal.
- Data itu merangkumi jujukan genetik, pemprofilan molekul, pengimejan bioperubatan dan rekod kesihatan elektronik.
- Ia mempelajari perwakilan yang boleh digeneralisasikan untuk menyokong penemuan dan kerja klinikal di hiliran.
- Tinjauan ini merangkumi empat domain: bahasa tabii, pengimejan dan isyarat, omik, dan jujukan molekul.
- LLM serba guna dikecualikan; fokusnya ialah 220 model khusus bioperubatan.
Garis Masa
Dari BioBERT ke Evo 2 Setiap model yang disebut tinjauan ini, bertarikh mengikut penerbitan pertamanya sendiri
- 15 Feb 2020BioBERT diterbitkan — BERT yang dilatih semula menggunakan abstrak PubMed dan teks penuh PMC; ia kemudian menjadi model bahasa tabii paling banyak dipetik dalam tinjauan itu.
- 13 Apr 2021ESM-1b menunjukkan bahawa model bahasa yang dilatih dengan 250 juta jujukan protein, tanpa sebarang label, mempelajari maklumat struktur yang sebenar; ia ialah moyang bagi model peneraju jujukan molekul dalam tinjauan itu.
- 26 Feb 2024scGPT diterbitkan, dipralatih menggunakan lebih 33 juta sel individu; ia menjadi peneraju omik dalam tinjauan itu.
- 19 Mac 2024UNI diterbitkan, dipralatih menggunakan imej tisu daripada lebih 100,000 imbasan patologi slaid penuh; ia menjadi peneraju pengimejan dan isyarat dalam tinjauan itu.
- 16 Jan 2025ESM3 diterbitkan — model generatif yang membuat penaakulan serentak terhadap jujukan, struktur dan fungsi protein; tinjauan itu kemudiannya menamakannya sebagai salah satu peningkat selepas 2025.
- 4 Mac 2026Evo 2 diterbitkan, dilatih menggunakan 9 trilion pasangan asas DNA merentasi semua domain kehidupan; tinjauan itu menamakannya sebagai peningkat kedua selepas 2025.
- 30 Apr 2026Chang, Cheng, Modi, Wang, Xu dan Ma menerbitkan tinjauan ini sendiri, dalam talian, di Nature Biotechnology.
- Ogos 2026Tinjauan ini muncul dalam terbitan bercetak Nature Biotechnology, jilid 44, nombor 8, muka surat 1263–1266.
Hujah
Pemerhatian utama
Bahasa tabii ialah modaliti yang paling kerap dipasangkan dengan yang lain, dan sedang menjadi antara muka penghubung antara jenis data. Ini menyeluruh sepanjang kertas itu: pemimpin petikan yang muncul dan hala tuju yang kurang dibangunkan kedua-duanya menunjuk kembali kepada struktur yang sama.
Pengekod Menguasai pecahan seni bina
| Seni bina | Bilangan | Bahagian |
|---|---|---|
| Berasaskan pengekod | 114 | 51.8% |
| Campuran | 67 | 30.5% |
| Berasaskan penyahkod | 31 | 14.1% |
| Bukan Transformer (cth. Mamba) | — | 3.6% |
Penyahkod jarang ditemui bukan kerana pilihan seni bina tetapi kerana data: tugas penjanaan teks memerlukan anotasi imej–teks berpasangan yang bermutu tinggi, dan itu sukar diperoleh dalam bioperubatan.
Penilaian Masih Sempit tugas hiliran yang digunakan
| Tugas | Bahagian |
|---|---|
| Pengelasan | 50.9% |
| Penjanaan laporan | 10.9% |
| Menjawab soalan | 8.6% |
| Segmentasi | 7.3% |
Jurang penilaian
Tiada penanda aras berbilang tugas, sedikit sahaja penilaian dengan campur tangan manusia, dan tiada layanan bersepadu terhadap kualiti data, kebolehtafsiran dan kerelevanan translasi. Separuh daripada model ini diuji pada pengelasan sahaja.
Peneraju Petikan Mengikut Domain * menandakan model multimodal · kiraan ialah petikan sesaat Semantic Scholar yang tidak ditarikhkan oleh makalah itu
| Domain | Model terkemuka dan petikan |
|---|---|
| Bahasa tabii | BioBERT 6,925 · MultiMedQA 3,707 · PubMedBERT 2,278 |
| Pengimejan dan isyarat | UNI 1,141 · ConVIRT* 1,003 · MedCLIP* 794 |
| Omik | scGPT 846 · Geneformer 836 · scBERT 509 |
| Jujukan molekul | ESM-1b 2,807 · ProtTrans 1,207 · DNABERT 1,051 |
Yang Meningkat Sejak 2025 pertumbuhan datang daripada kerja multimodal
| Domain | Yang meningkat sejak 2025, dan petikannya |
|---|---|
| Bahasa tabii | MedGemma-27B 165 · MediPhi-Instruct 13 |
| Pengimejan dan isyarat | BiomedCLIP* 498 · Quilt-1M* 216 · MedGemma* 165 |
| Omik | Nicheformer* 81 · OmiCLIP* 58 · scGPT-spatial 34 |
| Jujukan molekul | ESM3 201 · Evo 2 197 · Borzoi 190 |
Pertumbuhan petikan didorong oleh model yang menyatukan modaliti heterogen, bukan pakar dalam satu jenis data sahaja. Lima daripada sebelas yang meningkat adalah multimodal, dan bahasa tabii ialah satu-satunya domain dengan kurang daripada tiga.
Apa Yang Ditambah Orang Lain
Apa Yang Sebenarnya Dilakukan Model Peneraju Kertas kerja bebas di sebalik peneraju setiap domain
Nama-nama di sebalik kiraan petikan tinjauan ini mempunyai literatur tersendiri, dan itulah yang menjelaskan mengapa setiap satu menjadi peneraju, bukan sekadar berapa kerap ia dipetik. BioBERT ialah BERT yang dilatih semula menggunakan abstrak PubMed dan teks penuh PMC, itulah yang membolehkannya mengatasi BERT serba guna dalam pengecaman entiti bernama bioperubatan, pengekstrakan hubungan dan menjawab soalan. ESM-1b mempelajari perwakilannya daripada 250 juta jujukan protein yang tidak berlabel; keturunan langsungnya, ESM3, membuat penaakulan serentak terhadap jujukan, struktur dan fungsi protein, dan ia sendiri ialah salah satu peningkat selepas 2025 dalam tinjauan itu. UNI, peneraju pengimejan dan isyarat, dipralatih menggunakan imej tisu daripada lebih 100,000 imbasan patologi slaid penuh merentasi 20 jenis tisu, dan telah diuji pada 34 tugas diagnostik yang berasingan. scGPT, peneraju omik, dipralatih menggunakan lebih 33 juta sel individu. Evo 2, peningkat kedua, dilatih menggunakan 9 trilion pasangan asas DNA merentasi semua domain kehidupan, dan meramalkan kesan varian genetik — termasuk mutasi BRCA1 yang signifikan secara klinikal — tanpa langsung ditala-halus untuk tugas itu.
- 250MJujukan protein yang dipelajari ESM-1b, tanpa sebarang label (Rives et al., 2021).
- 100k+Imbasan patologi slaid penuh di sebalik pra-latihan UNI, merentasi 20 jenis tisu (Chen et al., 2024).
- 33MSel individu di sebalik pra-latihan scGPT (Cui et al., 2024).
- 9TPasangan asas DNA di sebalik Evo 2, merentasi semua domain kehidupan (Brixi et al., 2026).
Penyepaduan Yang Belum Dibina Sesiapa tiga peluang, satu halangan yang dikongsi
Kebolehtafsiran mekanistik
Bahasa ↔ jujukan dan omik
- Antara muka bahasa boleh membantu anotasi scRNA-seq, pengayaan laluan dan transkriptomik ruang.
Sasaran terapeutik
Pengimejan ↔ omik
- Penyepaduan patologi H&E dengan omik masih lemah.
- Potensi untuk menghubungkan morfologi tisu dengan mekanisme molekul adalah besar.
Lapisan pengawalaturan
DNA, RNA, protein, epigenom
- Lapisan-lapisan itu hanya berhubung secara longgar, terutamanya protein dengan yang lain.
Halangannya bukan idea
Yang menghalangnya bukan kekurangan konsep tetapi keadaan datanya: set data berpasangan jarang ditemui, prapemprosesan dan anotasi tidak diseragamkan, dan tiada penanda aras multimodal yang standard. Ia punca yang sama yang menjelaskan kekurangan penyahkod tadi.
Kesimpulan
Apa Yang Menyebabkan Sesebuah Model Diterima Pakai dan apa yang masih menghalang
- Ia menangani aplikasi berimpak tinggi: pemprosesan bahasa klinikal, pemodelan protein, patologi digital.
- Ia dinilai dengan teliti: pengujian merentasi pelbagai tugas hiliran membina kepercayaan dan penggunaan semula.
- Ia mudah diakses: pemberat pralatih terbuka, kod terbuka, antara muka yang boleh digunakan.
- Dan yang baharu menjadi penentu: ia sesuai dengan aliran kerja AI berasaskan ejen.
Masih belum selesai
Kualiti data, kepelbagaian kohort, kesan kelompok, privasi, halusinasi dan keteguhan terhadap serangan semuanya masih membataskan penggunaan di dunia sebenar. Penulis mengesyorkan kerjasama merentas disiplin — ahli biologi, doktor dan pembangun model bersama-sama — dan penyesuaian cekap tulang belakang pralatih yang kukuh dan bukannya melatih dari awal.