Tratopedia
ES
Tetapan

Saiz teks

Tema

Kontras tinggi

Versi

v1.81.0

Keluaran yang menjadi asas halaman ini dibina. Itulah versi yang disimpan oleh service worker.

Bioperubatan · Pembelajaran mesin · Penanda aras · Ringkasan PenyelidikanNature Biotechnology · April 2026

Tinjauan terhadap 220 model asas bioperubatan

Model Asas Bioperubatan Sedang Beralih Daripada Satu Modaliti kepada Banyak

Tinjauan terhadap 220 model asas khusus bioperubatan yang dibangunkan sepanjang empat tahun. Lebih separuh — 53.6% — sudah pun menggabungkan dua atau lebih modaliti data, dan bahasa tabii sedang muncul sebagai antara muka penghubung antara jenis data bioperubatan yang selainnya tidak berkaitan. Model bahasa besar serba guna seperti ChatGPT, Gemini dan Claude dikecualikan dengan sengaja.

  • 220model dikumpulkan, sepanjang empat tahun
  • 53.6%adalah multimodal — 118 menggabungkan dua atau lebih modaliti
  • 17modaliti data yang berbeza kesemuanya
  • 4domain: bahasa, pengimejan, omik, jujukan
TarafApa yang berlakuPerincian
DisahkanTinjauan itu diterbitkanChang, Cheng, Modi, Wang, Xu dan Ma, dalam Nature Biotechnology — dalam talian pada 30 April 2026, bercetak pada Ogos tahun itu di 44(8):1263–1266. DOI 10.1038/s41587-026-03135-y.
Disahkan220 model, empat bidang, lebih separuh multimodalSetiap kiraan dan bahagian pada halaman ini — 220, 118 (53.6%), pecahan seni bina dan pecahan penilaian — dinyatakan dalam teks makalah itu sendiri dan dibaca dari situ.
Disahkan, tidak dapat disemak di siniModel 220 yang mana satuSenarainya ialah Jadual Tambahan 1. Repositori menyajikan fail itu di sebalik cabaran yang tidak dapat dilepasi projek ini, jadi senarai itu tidak pernah dibaca model demi model — kiraan itu milik makalah, bukan kiraan semula.
Disahkan, tidak dapat disemak di siniKiraan petikanIa datang daripada Semantic Scholar dan hanya dicetak di dalam rajah makalah itu, yang tidak menyatakan bila petikan sesaat itu diambil. Ia dibaca daripada rajah tersebut. Kiraan petikan berubah, jadi anggaplah ia satu detik tanpa tarikh dan bukan kedudukan semasa.

Apa Yang Dikira Sebagai Model Asas Bioperubatan sempadan tinjauan itu

  • Model pembelajaran mesin berskala besar yang dilatih dengan pelbagai data bioperubatan dan klinikal.
  • Data itu merangkumi jujukan genetik, pemprofilan molekul, pengimejan bioperubatan dan rekod kesihatan elektronik.
  • Ia mempelajari perwakilan yang boleh digeneralisasikan untuk menyokong penemuan dan kerja klinikal di hiliran.
  • Tinjauan ini merangkumi empat domain: bahasa tabii, pengimejan dan isyarat, omik, dan jujukan molekul.
  • LLM serba guna dikecualikan; fokusnya ialah 220 model khusus bioperubatan.

Dari BioBERT ke Evo 2 Setiap model yang disebut tinjauan ini, bertarikh mengikut penerbitan pertamanya sendiri

  1. 15 Feb 2020BioBERT diterbitkan — BERT yang dilatih semula menggunakan abstrak PubMed dan teks penuh PMC; ia kemudian menjadi model bahasa tabii paling banyak dipetik dalam tinjauan itu.
  2. 13 Apr 2021ESM-1b menunjukkan bahawa model bahasa yang dilatih dengan 250 juta jujukan protein, tanpa sebarang label, mempelajari maklumat struktur yang sebenar; ia ialah moyang bagi model peneraju jujukan molekul dalam tinjauan itu.
  3. 26 Feb 2024scGPT diterbitkan, dipralatih menggunakan lebih 33 juta sel individu; ia menjadi peneraju omik dalam tinjauan itu.
  4. 19 Mac 2024UNI diterbitkan, dipralatih menggunakan imej tisu daripada lebih 100,000 imbasan patologi slaid penuh; ia menjadi peneraju pengimejan dan isyarat dalam tinjauan itu.
  5. 16 Jan 2025ESM3 diterbitkan — model generatif yang membuat penaakulan serentak terhadap jujukan, struktur dan fungsi protein; tinjauan itu kemudiannya menamakannya sebagai salah satu peningkat selepas 2025.
  6. 4 Mac 2026Evo 2 diterbitkan, dilatih menggunakan 9 trilion pasangan asas DNA merentasi semua domain kehidupan; tinjauan itu menamakannya sebagai peningkat kedua selepas 2025.
  7. 30 Apr 2026Chang, Cheng, Modi, Wang, Xu dan Ma menerbitkan tinjauan ini sendiri, dalam talian, di Nature Biotechnology.
  8. Ogos 2026Tinjauan ini muncul dalam terbitan bercetak Nature Biotechnology, jilid 44, nombor 8, muka surat 1263–1266.

Pemerhatian utama

Bahasa tabii ialah modaliti yang paling kerap dipasangkan dengan yang lain, dan sedang menjadi antara muka penghubung antara jenis data. Ini menyeluruh sepanjang kertas itu: pemimpin petikan yang muncul dan hala tuju yang kurang dibangunkan kedua-duanya menunjuk kembali kepada struktur yang sama.

Pengekod Menguasai pecahan seni bina

Seni binaBilanganBahagian
Berasaskan pengekod11451.8%
Campuran6730.5%
Berasaskan penyahkod3114.1%
Bukan Transformer (cth. Mamba)3.6%

Penyahkod jarang ditemui bukan kerana pilihan seni bina tetapi kerana data: tugas penjanaan teks memerlukan anotasi imej–teks berpasangan yang bermutu tinggi, dan itu sukar diperoleh dalam bioperubatan.

Penilaian Masih Sempit tugas hiliran yang digunakan

TugasBahagian
Pengelasan50.9%
Penjanaan laporan10.9%
Menjawab soalan8.6%
Segmentasi7.3%

Jurang penilaian

Tiada penanda aras berbilang tugas, sedikit sahaja penilaian dengan campur tangan manusia, dan tiada layanan bersepadu terhadap kualiti data, kebolehtafsiran dan kerelevanan translasi. Separuh daripada model ini diuji pada pengelasan sahaja.

Peneraju Petikan Mengikut Domain * menandakan model multimodal · kiraan ialah petikan sesaat Semantic Scholar yang tidak ditarikhkan oleh makalah itu

DomainModel terkemuka dan petikan
Bahasa tabiiBioBERT 6,925 · MultiMedQA 3,707 · PubMedBERT 2,278
Pengimejan dan isyaratUNI 1,141 · ConVIRT* 1,003 · MedCLIP* 794
OmikscGPT 846 · Geneformer 836 · scBERT 509
Jujukan molekulESM-1b 2,807 · ProtTrans 1,207 · DNABERT 1,051

Yang Meningkat Sejak 2025 pertumbuhan datang daripada kerja multimodal

DomainYang meningkat sejak 2025, dan petikannya
Bahasa tabiiMedGemma-27B 165 · MediPhi-Instruct 13
Pengimejan dan isyaratBiomedCLIP* 498 · Quilt-1M* 216 · MedGemma* 165
OmikNicheformer* 81 · OmiCLIP* 58 · scGPT-spatial 34
Jujukan molekulESM3 201 · Evo 2 197 · Borzoi 190

Pertumbuhan petikan didorong oleh model yang menyatukan modaliti heterogen, bukan pakar dalam satu jenis data sahaja. Lima daripada sebelas yang meningkat adalah multimodal, dan bahasa tabii ialah satu-satunya domain dengan kurang daripada tiga.

Apa Yang Sebenarnya Dilakukan Model Peneraju Kertas kerja bebas di sebalik peneraju setiap domain

Nama-nama di sebalik kiraan petikan tinjauan ini mempunyai literatur tersendiri, dan itulah yang menjelaskan mengapa setiap satu menjadi peneraju, bukan sekadar berapa kerap ia dipetik. BioBERT ialah BERT yang dilatih semula menggunakan abstrak PubMed dan teks penuh PMC, itulah yang membolehkannya mengatasi BERT serba guna dalam pengecaman entiti bernama bioperubatan, pengekstrakan hubungan dan menjawab soalan. ESM-1b mempelajari perwakilannya daripada 250 juta jujukan protein yang tidak berlabel; keturunan langsungnya, ESM3, membuat penaakulan serentak terhadap jujukan, struktur dan fungsi protein, dan ia sendiri ialah salah satu peningkat selepas 2025 dalam tinjauan itu. UNI, peneraju pengimejan dan isyarat, dipralatih menggunakan imej tisu daripada lebih 100,000 imbasan patologi slaid penuh merentasi 20 jenis tisu, dan telah diuji pada 34 tugas diagnostik yang berasingan. scGPT, peneraju omik, dipralatih menggunakan lebih 33 juta sel individu. Evo 2, peningkat kedua, dilatih menggunakan 9 trilion pasangan asas DNA merentasi semua domain kehidupan, dan meramalkan kesan varian genetik — termasuk mutasi BRCA1 yang signifikan secara klinikal — tanpa langsung ditala-halus untuk tugas itu.

  • 250MJujukan protein yang dipelajari ESM-1b, tanpa sebarang label (Rives et al., 2021).
  • 100k+Imbasan patologi slaid penuh di sebalik pra-latihan UNI, merentasi 20 jenis tisu (Chen et al., 2024).
  • 33MSel individu di sebalik pra-latihan scGPT (Cui et al., 2024).
  • 9TPasangan asas DNA di sebalik Evo 2, merentasi semua domain kehidupan (Brixi et al., 2026).

Penyepaduan Yang Belum Dibina Sesiapa tiga peluang, satu halangan yang dikongsi

  • Kebolehtafsiran mekanistik

    Bahasa ↔ jujukan dan omik

    • Antara muka bahasa boleh membantu anotasi scRNA-seq, pengayaan laluan dan transkriptomik ruang.
  • Sasaran terapeutik

    Pengimejan ↔ omik

    • Penyepaduan patologi H&E dengan omik masih lemah.
    • Potensi untuk menghubungkan morfologi tisu dengan mekanisme molekul adalah besar.
  • Lapisan pengawalaturan

    DNA, RNA, protein, epigenom

    • Lapisan-lapisan itu hanya berhubung secara longgar, terutamanya protein dengan yang lain.

Halangannya bukan idea

Yang menghalangnya bukan kekurangan konsep tetapi keadaan datanya: set data berpasangan jarang ditemui, prapemprosesan dan anotasi tidak diseragamkan, dan tiada penanda aras multimodal yang standard. Ia punca yang sama yang menjelaskan kekurangan penyahkod tadi.

Apa Yang Menyebabkan Sesebuah Model Diterima Pakai dan apa yang masih menghalang

  • Ia menangani aplikasi berimpak tinggi: pemprosesan bahasa klinikal, pemodelan protein, patologi digital.
  • Ia dinilai dengan teliti: pengujian merentasi pelbagai tugas hiliran membina kepercayaan dan penggunaan semula.
  • Ia mudah diakses: pemberat pralatih terbuka, kod terbuka, antara muka yang boleh digunakan.
  • Dan yang baharu menjadi penentu: ia sesuai dengan aliran kerja AI berasaskan ejen.

Masih belum selesai

Kualiti data, kepelbagaian kohort, kesan kelompok, privasi, halusinasi dan keteguhan terhadap serangan semuanya masih membataskan penggunaan di dunia sebenar. Penulis mengesyorkan kerjasama merentas disiplin — ahli biologi, doktor dan pembangun model bersama-sama — dan penyesuaian cekap tulang belakang pralatih yang kukuh dan bukannya melatih dari awal.

Chang, Cheng, Modi, Wang, Xu dan Ma, Nature Biotechnology, diterbitkan dalam talian 30 Apr 2026, terbitan bercetak jilid 44 no. 8 ms. 1263–1266 (Ogos 2026). DOI 10.1038/s41587-026-03135-y (PMID 42062613) · Lee et al., Bioinformatics, 2020 (PMID 31501885) · Rives et al., PNAS, 2021 (PMID 33876751) · Chen et al., Nature Medicine, 2024 (PMID 38504018) · Cui et al., Nature Methods, 2024 (PMID 38409223) · Hayes et al., Science, 2025 (PMID 39818825) · Brixi et al., Nature, 2026 (PMID 41781614). Kiraan petikan dalam jadual artikel ini adalah seperti yang dilaporkan dalam Rajah 1 tinjauan itu sendiri, terkini setakat penerbitannya pada April 2026.