Qué pasó
Biomedicina · Aprendizaje automático · Evaluación comparativa · Informe de investigaciónNature Biotechnology · abril de 2026
Una revisión de 220 modelos fundacionales biomédicos
Los modelos fundacionales biomédicos pasan de una modalidad a muchas
Una revisión de 220 modelos fundacionales específicos de la biomedicina desarrollados a lo largo de cuatro años. Más de la mitad —el 53.6%— ya combinan dos o más modalidades de datos, y el lenguaje natural está emergiendo como la interfaz que conecta tipos de datos biomédicos por lo demás inconexos. Los grandes modelos de lenguaje de propósito general, como ChatGPT, Gemini y Claude, se excluyeron deliberadamente.
- 220modelos recopilados, a lo largo de cuatro años
- 53.6%son multimodales — 118 combinan dos o más modalidades
- 17modalidades de datos distintas en total
- 4ámbitos: lenguaje, imagen, ómicas, secuencias
| Grado de certeza | Qué pasó | Detalle |
|---|---|---|
| Confirmado | Se publica la revisión | Chang, Cheng, Modi, Wang, Xu y Ma, en Nature Biotechnology: en línea el 30 de abril de 2026 e impreso ese agosto en 44(8):1263–1266. DOI 10.1038/s41587-026-03135-y. |
| Confirmado | 220 modelos, cuatro campos, más de la mitad multimodales | Cada recuento y cada porcentaje de esta página — los 220, los 118 (53.6%), el reparto de arquitecturas y el de evaluación — consta en el texto corrido del propio artículo y de ahí se leyó. |
| Confirmado, no verificable aquí | Cuáles son esos 220 modelos | La lista es la tabla suplementaria 1. El repositorio sirve ese archivo tras una verificación que este proyecto no pudo superar, así que nunca se leyó modelo por modelo: el recuento es del artículo, no un recuento propio. |
| Confirmado, no verificable aquí | Los recuentos de citas | Proceden de Semantic Scholar y solo aparecen impresos dentro de la figura del artículo, que no dice cuándo se tomó la instantánea. Se leyeron de ahí. Las citas cambian, así que conviene tomarlos como un momento sin fecha y no como una clasificación actual. |
Qué cuenta como modelo fundacional biomédico los límites de la revisión
- Modelos de aprendizaje automático a gran escala entrenados con datos biomédicos y clínicos variados.
- Esos datos abarcan secuencias genéticas, perfilado molecular, imagen biomédica e historias clínicas electrónicas.
- Aprenden representaciones generalizables que sirven de apoyo al descubrimiento y al trabajo clínico posteriores.
- La revisión cubre cuatro ámbitos: lenguaje natural, imagen y señales, ómicas y secuencias moleculares.
- Se excluyen los LLM de propósito general; el foco son 220 modelos específicos de la biomedicina.
Cronología
De BioBERT a Evo 2 Cada modelo que cita la revisión, fechado en su propia primera publicación
- 15 feb 2020Se publica BioBERT, BERT reentrenado con resúmenes de PubMed y texto completo de PMC; se convertirá en el modelo de lenguaje natural más citado de la revisión.
- 13 abr 2021ESM-1b demuestra que un modelo de lenguaje entrenado con 250 millones de secuencias proteicas, sin ninguna etiqueta, aprende información estructural real; es el antecesor del modelo líder en secuencias moleculares de la revisión.
- 26 feb 2024Se publica scGPT, preentrenado con más de 33 millones de células individuales; se convierte en el líder en ómicas de la revisión.
- 19 mar 2024Se publica UNI, preentrenado con imágenes de tejido procedentes de más de 100,000 exploraciones patológicas de portaobjetos completos; se convierte en el líder en imagen y señales de la revisión.
- 16 ene 2025Se publica ESM3, un modelo generativo que razona conjuntamente sobre la secuencia, la estructura y la función de las proteínas; la revisión lo nombrará más tarde como uno de los modelos en ascenso posteriores a 2025.
- 4 mar 2026Se publica Evo 2, entrenado con 9 billones de pares de bases de ADN que abarcan todos los dominios de la vida; la revisión lo nombra como un segundo modelo en ascenso posterior a 2025.
- 30 abr 2026Chang, Cheng, Modi, Wang, Xu y Ma publican la propia revisión, en línea, en Nature Biotechnology.
- ago 2026La revisión aparece en el número impreso de Nature Biotechnology, volumen 44, número 8, páginas 1263–1266.
El argumento
La observación clave
El lenguaje natural es la modalidad que más a menudo se empareja con otras, y se está convirtiendo en la interfaz de conexión entre tipos de datos. Esto recorre todo el artículo: tanto los líderes emergentes en citas como las direcciones poco desarrolladas remiten a la misma estructura.
Dominan los codificadores desglose por arquitectura
| Arquitectura | Número | Proporción |
|---|---|---|
| Basados en codificador | 114 | 51.8% |
| Mixtos | 67 | 30.5% |
| Basados en decodificador | 31 | 14.1% |
| No Transformer (p. ej. Mamba) | — | 3.6% |
Los decodificadores escasean no por preferencia arquitectónica, sino por los datos: las tareas de generación de texto necesitan anotación pareada imagen–texto de alta calidad, y eso es difícil de conseguir en biomedicina.
La evaluación sigue siendo estrecha tareas posteriores empleadas
| Tarea | Proporción |
|---|---|
| Clasificación | 50.9% |
| Generación de informes | 10.9% |
| Respuesta a preguntas | 8.6% |
| Segmentación | 7.3% |
La brecha de evaluación
No hay bancos de pruebas multitarea, hay poca evaluación con intervención humana y ningún tratamiento conjunto de la calidad de los datos, la interpretabilidad y la relevancia traslacional. La mitad de estos modelos se han probado únicamente en clasificación.
Líderes en citas por ámbito * indica un modelo multimodal · los recuentos son una instantánea de Semantic Scholar que el artículo no fecha
| Ámbito | Modelos destacados y citas |
|---|---|
| Lenguaje natural | BioBERT 6,925 · MultiMedQA 3,707 · PubMedBERT 2,278 |
| Imagen y señales | UNI 1,141 · ConVIRT* 1,003 · MedCLIP* 794 |
| Ómicas | scGPT 846 · Geneformer 836 · scBERT 509 |
| Secuencias moleculares | ESM-1b 2,807 · ProtTrans 1,207 · DNABERT 1,051 |
Los que suben desde 2025 el crecimiento viene del trabajo multimodal
| Ámbito | Los que suben desde 2025, y sus citas |
|---|---|
| Lenguaje natural | MedGemma-27B 165 · MediPhi-Instruct 13 |
| Imagen y señales | BiomedCLIP* 498 · Quilt-1M* 216 · MedGemma* 165 |
| Ómicas | Nicheformer* 81 · OmiCLIP* 58 · scGPT-spatial 34 |
| Secuencias moleculares | ESM3 201 · Evo 2 197 · Borzoi 190 |
El crecimiento de las citas lo impulsan modelos que integran modalidades heterogéneas, y no especialistas en un solo tipo de dato. Cinco de los once que suben son multimodales, y el lenguaje natural es el único ámbito con menos de tres.
Lo que añaden otros
Qué hacen realmente los modelos líderes Los artículos independientes detrás de los líderes de cada ámbito
Los nombres que sostienen los recuentos de citas de la revisión tienen su propia bibliografía, y esta explica por qué cada uno lidera y no solo cuántas veces se le cita. BioBERT es BERT reentrenado con resúmenes de PubMed y texto completo de PMC, lo que le permite superar al BERT genérico en reconocimiento de entidades biomédicas, extracción de relaciones y respuesta a preguntas. ESM-1b aprendió sus representaciones a partir de 250 millones de secuencias proteicas sin etiquetar; su descendiente directo, ESM3, razona conjuntamente sobre la secuencia, la estructura y la función de una proteína, y es a su vez uno de los modelos en ascenso posteriores a 2025 de la revisión. UNI, el líder en imagen y señales, se preentrena con imágenes de tejido de más de 100,000 exploraciones patológicas de portaobjetos completos en 20 tipos de tejido, y se ha probado en 34 tareas diagnósticas distintas. scGPT, el líder en ómicas, se preentrena con más de 33 millones de células individuales. Evo 2, un segundo modelo en ascenso, se entrena con 9 billones de pares de bases de ADN que abarcan todos los dominios de la vida, y predice el efecto de una variante genética —incluidas mutaciones de BRCA1 clínicamente significativas— sin haber sido ajustado en absoluto para esa tarea.
- 250MSecuencias proteicas de las que aprendió ESM-1b, sin ninguna etiqueta (Rives et al., 2021).
- 100k+Exploraciones patológicas de portaobjetos completos tras el preentrenamiento de UNI, en 20 tipos de tejido (Chen et al., 2024).
- 33MCélulas individuales tras el preentrenamiento de scGPT (Cui et al., 2024).
- 9TPares de bases de ADN tras Evo 2, que abarcan todos los dominios de la vida (Brixi et al., 2026).
Las integraciones que nadie ha construido todavía tres oportunidades, un cuello de botella común
Interpretabilidad mecanicista
Lenguaje ↔ secuencia y ómicas
- Una interfaz de lenguaje podría ayudar en la anotación de scRNA-seq, el enriquecimiento de rutas y la transcriptómica espacial.
Dianas terapéuticas
Imagen ↔ ómicas
- La integración de la anatomía patológica con H&E y las ómicas sigue siendo débil.
- El potencial de vincular la morfología tisular con el mecanismo molecular es considerable.
Capas de regulación
ADN, ARN, proteína, epigenoma
- Las capas solo están conectadas de forma laxa, y la proteína con las demás más que ninguna.
El cuello de botella no son las ideas
Lo que lo frena no es la falta de conceptos, sino el estado de los datos: los conjuntos de datos pareados escasean, el preprocesado y la anotación no están normalizados y no existe un banco de pruebas multimodal estándar. Es la misma causa que explica la escasez de decodificadores señalada antes.
Conclusión
Qué hace que un modelo se adopte y qué sigue estorbando
- Aborda una aplicación de alto impacto: procesamiento del lenguaje clínico, modelado de proteínas, anatomía patológica digital.
- Está evaluado con rigor: probarlo en tareas posteriores variadas genera confianza y reutilización.
- Es accesible: pesos preentrenados abiertos, código abierto, una interfaz utilizable.
- Y algo nuevo y decisivo: encaja en flujos de trabajo de IA basados en agentes.
Todavía sin resolver
La calidad de los datos, la diversidad de las cohortes, los efectos de lote, la privacidad, las alucinaciones y la robustez frente a ataques siguen limitando el despliegue en el mundo real. Los autores recomiendan la colaboración interdisciplinar —biólogos, clínicos y desarrolladores de modelos juntos— y la adaptación eficiente de buenas redes preentrenadas en lugar del entrenamiento desde cero.