Qué pasó
Ingeniería de LLM · Modelos de lenguaje · Ingeniería de software · Agentes de IA · Análisis post mortem de ingenieríaBlog de ingeniería de Anthropic, abril de 2026 · registro hasta mayo de 2026
Resuelto en la v2.1.116 · la API en sí no se vio afectada
Tres cambios sin relación entre sí que parecían una sola regresión
Un esfuerzo de razonamiento por defecto rebajado; un fallo de caché que no dejaba de borrar el historial de razonamiento; una regla en el prompt del sistema que limitaba la longitud de la salida. Los tres afectaron a franjas distintas del tráfico en momentos distintos y, juntos, se presentaron como una caída amplia e inconsistente de la calidad. Claude Code, el Agent SDK y Cowork se vieron afectados; la API en sí no. La propia auditoría de datos de un ingeniero de AMD llegó a conclusiones similares tres semanas antes de que Anthropic dijera nada en público.
- 3problemas distintos, todos corregidos para el 20 de abril
- 34días para el más duradero de ellos
- −3%caída en la única evaluación que detectó el tercero
- v2.1.116la versión en la que se resolvieron los tres
| Estado | Suceso | Detalle |
|---|---|---|
| Confirmado | Tres cambios de producto sin relación entre sí, 4 de marzo – 20 de abril | Un esfuerzo de razonamiento por defecto rebajado, un fallo de caché que borraba el historial de razonamiento, y un prompt del sistema que limitaba la longitud — cada uno afectó a una franja distinta del tráfico en su propio calendario. Los tres se resolvieron en la v2.1.116; los límites de uso se reiniciaron para todos los suscriptores el 23 de abril. |
| Confirmado | La auditoría de datos pública de un ingeniero de AMD, 3 de abril | Stella Laurenzo, directora del grupo de IA de AMD, analizó 6,852 sesiones de Claude Code y presentó un informe en GitHub — tres semanas antes que el propio relato de Anthropic. |
| Confirmado pero no verificable aquí | La propia teoría de la auditoría sobre la causa | Los datos de Laurenzo correlacionan la caída con un ajuste de mediados de febrero que oculta el razonamiento en la interfaz. El relato de las tres causas de Anthropic no nombra ese ajuste, y la primera respuesta pública de Anthropic (7 de abril) dijo que no reducía el razonamiento en absoluto. |
| No confirmado | Que el verdadero motor fuera el racionamiento de cómputo, no las contrapartidas declaradas | Planteado por algunos usuarios y, aparte, por un ejecutivo rival. El análisis post mortem de Anthropic no aborda el cómputo en absoluto, aunque una declaración aparte a Fortune reconoció que la demanda había tensado la infraestructura. |
Cronología
Cronología trece hechos fechados en tres meses
- 02Opus 4.6 sale en Claude Code con el esfuerzo de razonamiento por defecto en
high. - 02-12El ajuste llamado
redact-thinking-2026-02-12oculta el razonamiento en la interfaz. Una auditoría externa lo señalará luego como posible causa; el propio relato de Anthropic nunca lo hace. - 03-04El esfuerzo de razonamiento por defecto baja a
medium(empieza el problema uno). - 03-26Se publica el fallo de caché (empieza el problema dos).
- 04-03Stella Laurenzo, directora de IA de AMD, presenta un informe en GitHub que analiza 6,852 sesiones.
- 04-06The Register informa sobre el caso.
- 04-07Se corrige el problema uno; el valor por defecto vuelve a
high(xhighpara Opus 4.7). Boris Cherny, de Anthropic, rebate públicamente la teoría de Laurenzo. - 04-10Se corrige el problema dos (v2.1.101).
- 04-16Se publica un prompt del sistema que limita la longitud junto con Opus 4.7 (empieza el problema tres).
- 04-20Se corrige el problema tres; los tres quedan resueltos (v2.1.116).
- 04-23Anthropic publica el análisis post mortem y reinicia los límites de uso de todos los suscriptores; Boris Cherny detalla el mecanismo de caché en Hacker News ese mismo día.
- 04-24Fortune informa de la reacción de los usuarios, cancelaciones, y una declaración de Anthropic que cita la tensión en la infraestructura.
- 05-14InfoQ publica una síntesis que incluye una preocupación reportada en Reddit que el análisis post mortem no aborda.
El argumento
Una explicación, dos relatos atribuido por su nombre, y dejado abierto donde discrepan
El diagnóstico de la propia Anthropic: cada uno de los tres cambios superó su propia revisión por separado — revisión humana, pruebas automatizadas, evaluaciones. El fallo estuvo entre ellos: ningún proceso era responsable de preguntar qué harían juntos varios cambios simultáneos, y cada uno afectó a una franja distinta del tráfico en un calendario distinto, de modo que en conjunto parecieron un único deterioro amplio e inconsistente, no tres causas separadas.
Lo que lo complica: una denuncia independiente y basada en datos llegó al público tres semanas antes que el propio relato de Anthropic, y señaló un cambio distinto como correlato — uno que el relato de las tres causas de Anthropic no menciona, y contra el que la primera respuesta pública de la propia Anthropic ya se había pronunciado.
- 3 de abrilStella Laurenzo presenta una denuncia basada en datos que señala un cambio de mediados de febrero.
- 23 de abrilEl propio análisis post mortem de Anthropic nombra tres cambios distintos, ninguno de febrero.
| Fuente | Qué señala como causa |
|---|---|
| Anthropic, análisis post mortem del 23 de abril | Tres cambios en la capa de producto: un esfuerzo de razonamiento por defecto rebajado, un fallo de caché, un prompt que limita la longitud — sin mención del cómputo ni del ajuste de mediados de febrero. |
| Anthropic, declaración a Fortune | Infraestructura “tensada” por el crecimiento de la demanda, en términos generales — sin vincularlo a ninguno de los tres fallos nombrados. |
| Stella Laurenzo, auditoría en GitHub (3 abr) | El ajuste redact-thinking-2026-02-12, que oculta el razonamiento en la interfaz, correlacionado con un giro medido hacia un comportamiento más superficial, de editar primero. Los dos informes de la auditoría difieren sobre cuándo llegó ese ajuste a Claude Code: TechRadar lo fecha por el propio nombre del ajuste; The Register, en un despliegue de principios de marzo con la v2.1.69. |
| Anthropic, primera respuesta pública (7 abr) | Ese mismo ajuste solo oculta el razonamiento de la interfaz y no lo reduce; atribuye la mejora al pensamiento adaptativo de Opus 4.6. |
Lo que añaden otros
Lo que añaden otros profundidad desde fuera del propio relato de Anthropic
- En Hacker News, Boris Cherny, del equipo de Claude Code, completó el mecanismo que el blog de Anthropic solo resumía: normalmente todos los mensajes de una conversación menos el más reciente aciertan en la caché de prompts, pero tras una hora de inactividad el siguiente mensaje supone un fallo de caché completo, y en un caso extremo una sesión de 900 000 tokens dejada inactiva una hora podría escribir de golpe más de 900 000 tokens en la caché — “un porcentaje significativo de tus límites de uso, sobre todo para los usuarios Pro”. Eliminar el pensamiento antiguo tras la inactividad fue el arreglo que Anthropic probó para ese coste, y su implementación es lo que introdujo el problema dos.
- La primera respuesta pública de Anthropic a la auditoría de AMD, recogida por TechRadar el 7 de abril, discutió su causa en lugar de confirmarla: Boris Cherny dijo que el ajuste de mediados de febrero solo retiene el razonamiento de la interfaz y no lo reduce, y señaló el pensamiento adaptativo de Opus 4.6 como una mejora aparte. El análisis post mortem de Anthropic del 23 de abril no vuelve sobre este intercambio ni nombra el ajuste de mediados de febrero en absoluto.
- Fortune informó de que algunos usuarios describieron sentirse “manipulados” por las comunicaciones de Anthropic en las semanas previas al 23 de abril, que interpretaron como una negación de que existiera problema alguno, y de que algunos dicen haber cancelado sus suscripciones. En una declaración a Fortune, Anthropic citó que la demanda había “tensado” su infraestructura “sobre todo en las horas punta” — un registro de explicación distinto al de los tres fallos concretos del blog, que responde a una pregunta que el propio análisis post mortem no plantea.
- En un memorando interno del que informó primero CNBC y que Fortune cita, el director de ingresos de OpenAI calificó de “error estratégico” que Anthropic no asegurara cómputo suficiente. Es la caracterización de un competidor en un memorando filtrado, no un hallazgo, y el propio análisis post mortem de Anthropic no atribuye ninguno de sus tres fallos nombrados al cómputo en absoluto.
- La cobertura de InfoQ recogió una preocupación de Reddit que el análisis post mortem no aborda: Claude Code puede delegar trabajo al modelo Haiku, más barato, sin que eso sea visible salvo en el registro detallado — un riesgo que InfoQ señaló como el más difícil de detectar en flujos desatendidos, donde una caída de calidad solo aflora varios pasos después, no en el momento en que ocurre.
Conclusión
Qué cambia ahora cinco medidas de seguimiento, según el propio relato de Anthropic
- Que una proporción mayor del personal interno use exactamente la compilación pública de Claude Code, y no una compilación de pruebas aparte.
- Ejecutar una batería amplia de evaluaciones por modelo para cada cambio del prompt del sistema, continuando el análisis de ablación que finalmente detectó el problema tres.
- Crear herramientas que faciliten revisar y auditar los cambios del prompt del sistema, y añadir orientación en
CLAUDE.mdpara que los cambios específicos de un modelo queden restringidos a ese modelo. - Dar a todo cambio que pueda sacrificar inteligencia un periodo de reposo, una batería de evaluaciones más amplia y un despliegue gradual, para detectar antes los problemas.
- Ampliar el contexto de repositorio de su herramienta Code Review — el cambio que permitió a Opus 4.7 detectar la pull request culpable del problema dos, cosa que Opus 4.6 no había logrado — y usar @ClaudeDevs en X y un hilo centralizado en GitHub para explicar las decisiones de producto a medida que se toman.
La lección de fondo, y lo que sigue abierto
El propio relato de Anthropic sobre el fallo es estructural: cada cambio superó su propia revisión, y nada era responsable de comprobar qué harían varios cambios a la vez — que es exactamente lo que ataca la más sustancial de las medidas de seguimiento. Dos cosas que el análisis post mortem no zanja: si el cambio de mediados de febrero que señaló una auditoría externa jugó algún papel real en la caída, y si la delegación silenciosa de Claude Code a un modelo más pequeño supone un riesgo comparable. Ambas cosas están atribuidas a fuentes con nombre y se dejan abiertas aquí, sin fundirlas en las tres causas que nombró Anthropic.