Resumen · La evaluación
Seguridad de la IA · Capacidad de la IA · Modelos de lenguaje · Cómputo · Gobernanza · Ficha de evaluaciónEvaluación de abril de 2026, registro hasta mayo
El AI Security Institute del Reino Unido
El primer modelo que termina el ejercicio de red del AISI
El AI Security Institute evaluó Claude Mythos Preview, de Anthropic, en su propia batería de retos de capture the flag y en una simulación aparte, en 32 pasos, de un ataque a una red corporativa. El modelo alcanzó el 73% en tareas de CTF de nivel experto y, en abril, se convirtió en el primero en terminar la simulación de red —en tres de diez intentos—. Una versión posterior, probada en mayo, llegó a seis de diez y fue la primera en terminar también el ejercicio aparte del AISI sobre un sistema de control industrial. El hallazgo más notable no es ninguna puntuación aislada: es que la capacidad sigue subiendo con más cómputo, sin que se haya encontrado todavía un techo.
- 73%tasa de éxito en CTF de nivel experto
- 3 → 6 / 10ejercicios de red completados enteros, de abril a mayo
- 22 / 32media de pasos completados en abril; el mejor anterior era 16
- 100Mpresupuesto de tokens por intento
Secuencia · El instituto, el método y ocho semanas de resultados
El AI Security Institute del Reino Unido quién realizó la evaluación
- Parte del Departamento de Ciencia, Innovación y Tecnología del Reino Unido, fundado en 2023.
- Cambió su nombre de AI Safety Institute a AI Security Institute, lo que refleja un giro hacia amenazas concretas a la seguridad nacional.
- Ha construido un marco graduado: sondeo conversacional, luego retos CTF, y después simulación de ataques en varios pasos.
- Sigue en el tiempo la capacidad cibernética ofensiva de los modelos de frontera, y colabora con el National Cyber Security Centre (NCSC) en las recomendaciones que siguen.
Dos vías: CTF y TLO una prueba la técnica, la otra una campaña entera
Retos CTF
Una sola situación técnica
- La batería propia del AISI de ataques simulados, graduados en cuatro niveles desde inicial hasta experto.
- Mide la capacidad ofensiva dentro de un único escenario técnico, no una campaña sostenida.
El ejercicio TLO
Un ataque a una red corporativa en 32 pasos
- Del reconocimiento inicial a la toma completa de la red, a lo largo de nueve hitos, de M1 a M9.
- La estimación del AISI para un experto humano ha cambiado entre informes: 14 horas en marzo, 20 horas en abril.
- Cada intento está limitado a 100 millones de tokens.
Los últimos: nueve hitos la cadena de ataque del ejercicio
| Hito | Tarea |
|---|---|
| M1 | Reconocimiento inicial |
| M2 | Movimiento lateral y extracción de credenciales |
| M3 | Robo de credenciales del navegador |
| M4 | Explotación del wiki y reutilización de credenciales |
| M5 | Explotación de aplicaciones web y escalada de privilegios |
| M6 | Ingeniería inversa del mando y control, y criptoanálisis |
| M7 | Persistencia avanzada |
| M8 | Compromiso de la infraestructura |
| M9 | Toma completa de la red |
Ocho semanas, seis publicaciones cómo se reconstruyó esta historia
- 5 mar 2026El AISI, con Irregular, publica evidencia de que el rendimiento cibernético de la IA sigue subiendo con presupuestos de tokens mayores — un hallazgo general, previo a Mythos Preview.
- 11–17 mar 2026Se presenta, y luego se revisa, un artículo de metodología que describe TLO y un segundo ejercicio de 7 pasos sobre un sistema de control industrial (“Cooling Tower”).
- 30 mar 2026NCSC y AISI publican un blog conjunto: antes de que existiera Mythos Preview, el mejor modelo (Opus 4.6) promediaba 15.6 pasos de TLO, con un mejor intento aislado de 22 de 32.
- 7 abr 2026Anthropic anuncia Claude Mythos Preview, publica su ficha de sistema y lanza el Proyecto Glasswing.
- 9 abr 2026El propio Frontier Red Team de Anthropic publica su relato sobre el hallazgo de vulnerabilidades del modelo, incluido el fallo de OpenBSD.
- 13 abr 2026El AISI publica su propia evaluación independiente — el origen de las cifras 73%, 3 de 10 y 22 de 32 anteriores.
- 13 may 2026El AISI informa de que una versión más reciente de Mythos Preview completó ambos ejercicios: TLO en 6 de 10 intentos, y “Cooling Tower” — que en abril no logró superar — en 3 de 10.
El argumento · Un salto real, medido contra un objetivo fácil
CTF: 73% a nivel experto la batería propia del AISI, no un banco de pruebas público
El nivel inicial está casi saturado y las puntuaciones intermedias son altas, pero el nivel experto llega al 73% en la batería propia y graduada del AISI. Antes de abril de 2025, ningún modelo era capaz de completar una tarea de nivel experto.
- Experto 73%La batería de CTF graduada del propio AISI, no un banco de pruebas de terceros.
- Cero, un año antesNingún modelo podía superar una tarea de nivel experto antes de abril de 2025.
TLO: el mejor intento de un modelo, luego la media de otro el tamaño del salto, expresado con precisión
| Modelo | Pasos de media | Ejercicios completos |
|---|---|---|
| Mythos Preview (abril) | 22 | 3 ✓ |
| Claude Opus 4.6 | 16 | 0 |
| GPT-5.4 | ~14 | 0 |
| Claude Opus 4.5 | 11 | 0 |
| GPT-4o (ago 2024) | 1.7 | 0, con un presupuesto de 10 millones de tokens |
Todos con un presupuesto de 100 millones de tokens salvo GPT-4o. El gráfico publicado por el AISI solo da los pasos de GPT-5.4 y Opus 4.5 como etiquetas del propio gráfico, no en su texto, así que esas dos cifras se leen directamente del gráfico y no se citan como texto. En marzo, antes de que existiera Mythos Preview, el mejor intento aislado de Opus 4.6 llegó a 22 de 32 pasos — el mismo número que la media de los diez intentos de Mythos Preview alcanzó unas semanas después.
La capacidad escala de forma logarítmico-lineal con el cómputo el hallazgo que el propio AISI llama más notable
El artículo de metodología del propio AISI halló que, entre los modelos más antiguos que evaluó, pasar de 10 a 100 millones de tokens elevaba el rendimiento hasta un 59%, sin alcanzar una meseta. Ese artículo es anterior a Mythos Preview. Para Mythos Preview en sí, el AISI afirma que su rendimiento siguió subiendo hasta el techo de 100 millones de tokens que usó su evaluación, y que espera que un presupuesto mayor siga mejorando los resultados — sin dar una cifra porcentual propia para Mythos Preview.
- +59%El hallazgo del artículo de metodología del AISI sobre modelos más antiguos, no una cifra de Mythos Preview.
- Sin techoLa afirmación del propio AISI sobre Mythos Preview en concreto, en el techo de 100 millones de tokens de su prueba.
Lo que una puntuación no significa dos lecturas que las propias evaluaciones descartan
Ninguna de las puntuaciones anteriores muestra lo que Mythos Preview podría hacer contra una red real y defendida — los propios ejercicios del AISI no tienen defensor activo, ni detección en el endpoint, ni penalización por acciones ruidosas, así que una puntuación es un límite frente a un objetivo fácil, no una predicción frente a uno duro. Y que Anthropic no publique el modelo no demuestra, por sí solo, que sea peligroso: la razón que da la propia Anthropic es que sus salvaguardas aún no están listas, lo cual es una afirmación sobre su preparación, no una calificación de peligro medida.
Lo que otros añaden · Las propias cifras de Anthropic, y el Proyecto Glasswing
Los propios bancos de pruebas de Anthropic de la ficha de sistema, no del AISI
| Banco de pruebas | Mythos Preview | Comparación |
|---|---|---|
| Cybench (35 de 40 tareas ejecutadas) | 100% | saturado, según Anthropic |
| CyberGym | 83.1% | Opus 4.6: 66.6%; Sonnet 4.6: 65% |
| Explotación de Firefox 147 (250 pruebas) | 84.0% | Opus 4.6: 15.2%; Sonnet 4.6: 4.4% |
| SWE-bench Verified | 93.9% | Opus 4.6: 80.8% |
Las propias pruebas de Anthropic hallaron un fallo hasta entonces desconocido, capaz de provocar un cierre remoto, en la gestión de red de OpenBSD, sin descubrir durante 27 años, entre lo que Anthropic describe como miles de vulnerabilidades adicionales de gravedad alta y crítica en todos los sistemas operativos y navegadores principales. Esa cifra total es una afirmación propia de Anthropic sobre la producción de su propio modelo, sin ningún recuento independiente publicado. Anthropic sí hizo revisar manualmente 198 de los informes de vulnerabilidad del modelo por sus propios contratistas humanos.
- “Miles”Afirmación propia de Anthropic sobre la producción de su modelo; no se halló un recuento independiente.
- 89 % / 98 %De 198 informes, los contratistas humanos coincidieron exactamente con la propia valoración de gravedad de Mythos, o dentro de un nivel.
Proyecto Glasswing: poner la capacidad al servicio de la defensa llamado así por la mariposa cristalina
El nombre
La mariposa cristalina
- Revelar lo oculto sin causar daño, según la propia explicación de Anthropic sobre el nombre.
Escala
11 socios fundadores, y más de 40 después
- Amazon Web Services, Apple, Broadcom, Cisco, CrowdStrike, Google, JPMorganChase, la Linux Foundation, Microsoft, Nvidia y Palo Alto Networks, además de más de 40 organizaciones adicionales con acceso para escanear sus sistemas.
- Financiación: hasta 100 millones de dólares en créditos de uso, más 4 millones en donaciones directas a organizaciones de seguridad de código abierto.
- 30 días después: unos 50 socios habían encontrado juntos más de diez mil vulnerabilidades de gravedad alta o crítica, y un análisis aparte de código abierto había hallado 6,202 vulnerabilidades estimadas, con un 90.6% confirmadas como reales entre las revisadas de forma independiente.
Por qué no se publica
Las salvaguardas aún no están listas
- Anthropic afirma que no tiene previsto un lanzamiento general, y da su propia razón: necesita salvaguardas capaces de detectar y bloquear las salidas más peligrosas del modelo, y planea introducirlas primero con un futuro modelo Opus menos capaz.
Lo que el entorno de prueba dejó fuera por qué las puntuaciones no se trasladan directamente
- Sin defensor activo: nadie del centro de operaciones de seguridad respondiendo en tiempo real.
- Sin detección en el endpoint: no había herramientas EDR en el entorno.
- Sin penalización por comportamiento ruidoso: acciones que en la realidad delatarían a un atacante aquí no costaban nada.
El consejo del NCSC: volver a lo fundamental qué hacer al respecto
- Aplicar las actualizaciones de seguridad con prontitud, para que las vulnerabilidades conocidas no puedan explotarse deprisa.
- Control de acceso robusto junto con una configuración segura.
- Registro exhaustivo, y la certificación Cyber Essentials del NCSC.
Conclusión · Un límite que sigue subiendo
Por qué esto es un punto de inflexión
Un modelo de IA alcanzó por primera vez, en abril, una capacidad autónoma de nivel experto humano en un ataque corporativo simulado completo, y una versión posterior mejoró eso en cuestión de semanas — duplicando su tasa de ejercicios completados enteros y terminando un segundo ejercicio, sobre un sistema de control industrial, que ningún modelo había logrado antes. Las dos lecturas contra las que el propio AISI advierte — que una puntuación demuestra peligro real, y que no publicar un modelo demuestra que es peligroso — merecen resistirse por la misma razón: ninguna de las dos es lo que las evaluaciones realmente muestran.
Lo que sigue genuinamente abierto
La propia estimación del AISI del tiempo que necesitaría un experto humano para el ejercicio de red pasó de 14 a 20 horas en seis semanas, sin razón declarada. Los “miles” de vulnerabilidades halladas por Anthropic no tienen un recuento independiente detrás. Y nadie ha publicado una prueba de Mythos Preview contra una red activamente defendida y monitorizada — que es exactamente la prueba que diría si el límite de hoy resiste el objetivo de mañana.