Tratopedia
EN
Ajustes

Tamaño del texto

Tema

Alto contraste

Versión

v1.81.0

La publicación con la que se generó esta página. Es la que almacena en caché el service worker.

Ingeniería de LLM · Modelos de lenguaje · Ingeniería de software · Agentes de IA · Análisis post mortem de ingenieríaBlog de ingeniería de Anthropic, abril de 2026 · registro hasta mayo de 2026

Resuelto en la v2.1.116 · la API en sí no se vio afectada

Tres cambios sin relación entre sí que parecían una sola regresión

Un esfuerzo de razonamiento por defecto rebajado; un fallo de caché que no dejaba de borrar el historial de razonamiento; una regla en el prompt del sistema que limitaba la longitud de la salida. Los tres afectaron a franjas distintas del tráfico en momentos distintos y, juntos, se presentaron como una caída amplia e inconsistente de la calidad. Claude Code, el Agent SDK y Cowork se vieron afectados; la API en sí no. La propia auditoría de datos de un ingeniero de AMD llegó a conclusiones similares tres semanas antes de que Anthropic dijera nada en público.

  • 3problemas distintos, todos corregidos para el 20 de abril
  • 34días para el más duradero de ellos
  • −3%caída en la única evaluación que detectó el tercero
  • v2.1.116la versión en la que se resolvieron los tres
EstadoSucesoDetalle
ConfirmadoTres cambios de producto sin relación entre sí, 4 de marzo – 20 de abrilUn esfuerzo de razonamiento por defecto rebajado, un fallo de caché que borraba el historial de razonamiento, y un prompt del sistema que limitaba la longitud — cada uno afectó a una franja distinta del tráfico en su propio calendario. Los tres se resolvieron en la v2.1.116; los límites de uso se reiniciaron para todos los suscriptores el 23 de abril.
ConfirmadoLa auditoría de datos pública de un ingeniero de AMD, 3 de abrilStella Laurenzo, directora del grupo de IA de AMD, analizó 6,852 sesiones de Claude Code y presentó un informe en GitHub — tres semanas antes que el propio relato de Anthropic.
Confirmado pero no verificable aquíLa propia teoría de la auditoría sobre la causaLos datos de Laurenzo correlacionan la caída con un ajuste de mediados de febrero que oculta el razonamiento en la interfaz. El relato de las tres causas de Anthropic no nombra ese ajuste, y la primera respuesta pública de Anthropic (7 de abril) dijo que no reducía el razonamiento en absoluto.
No confirmadoQue el verdadero motor fuera el racionamiento de cómputo, no las contrapartidas declaradasPlanteado por algunos usuarios y, aparte, por un ejecutivo rival. El análisis post mortem de Anthropic no aborda el cómputo en absoluto, aunque una declaración aparte a Fortune reconoció que la demanda había tensado la infraestructura.

Cronología trece hechos fechados en tres meses

  1. 02Opus 4.6 sale en Claude Code con el esfuerzo de razonamiento por defecto en high.
  2. 02-12El ajuste llamado redact-thinking-2026-02-12 oculta el razonamiento en la interfaz. Una auditoría externa lo señalará luego como posible causa; el propio relato de Anthropic nunca lo hace.
  3. 03-04El esfuerzo de razonamiento por defecto baja a medium (empieza el problema uno).
  4. 03-26Se publica el fallo de caché (empieza el problema dos).
  5. 04-03Stella Laurenzo, directora de IA de AMD, presenta un informe en GitHub que analiza 6,852 sesiones.
  6. 04-06The Register informa sobre el caso.
  7. 04-07Se corrige el problema uno; el valor por defecto vuelve a high (xhigh para Opus 4.7). Boris Cherny, de Anthropic, rebate públicamente la teoría de Laurenzo.
  8. 04-10Se corrige el problema dos (v2.1.101).
  9. 04-16Se publica un prompt del sistema que limita la longitud junto con Opus 4.7 (empieza el problema tres).
  10. 04-20Se corrige el problema tres; los tres quedan resueltos (v2.1.116).
  11. 04-23Anthropic publica el análisis post mortem y reinicia los límites de uso de todos los suscriptores; Boris Cherny detalla el mecanismo de caché en Hacker News ese mismo día.
  12. 04-24Fortune informa de la reacción de los usuarios, cancelaciones, y una declaración de Anthropic que cita la tensión en la infraestructura.
  13. 05-14InfoQ publica una síntesis que incluye una preocupación reportada en Reddit que el análisis post mortem no aborda.

Una explicación, dos relatos atribuido por su nombre, y dejado abierto donde discrepan

El diagnóstico de la propia Anthropic: cada uno de los tres cambios superó su propia revisión por separado — revisión humana, pruebas automatizadas, evaluaciones. El fallo estuvo entre ellos: ningún proceso era responsable de preguntar qué harían juntos varios cambios simultáneos, y cada uno afectó a una franja distinta del tráfico en un calendario distinto, de modo que en conjunto parecieron un único deterioro amplio e inconsistente, no tres causas separadas.
Lo que lo complica: una denuncia independiente y basada en datos llegó al público tres semanas antes que el propio relato de Anthropic, y señaló un cambio distinto como correlato — uno que el relato de las tres causas de Anthropic no menciona, y contra el que la primera respuesta pública de la propia Anthropic ya se había pronunciado.

  • 3 de abrilStella Laurenzo presenta una denuncia basada en datos que señala un cambio de mediados de febrero.
  • 23 de abrilEl propio análisis post mortem de Anthropic nombra tres cambios distintos, ninguno de febrero.
FuenteQué señala como causa
Anthropic, análisis post mortem del 23 de abrilTres cambios en la capa de producto: un esfuerzo de razonamiento por defecto rebajado, un fallo de caché, un prompt que limita la longitud — sin mención del cómputo ni del ajuste de mediados de febrero.
Anthropic, declaración a FortuneInfraestructura “tensada” por el crecimiento de la demanda, en términos generales — sin vincularlo a ninguno de los tres fallos nombrados.
Stella Laurenzo, auditoría en GitHub (3 abr)El ajuste redact-thinking-2026-02-12, que oculta el razonamiento en la interfaz, correlacionado con un giro medido hacia un comportamiento más superficial, de editar primero. Los dos informes de la auditoría difieren sobre cuándo llegó ese ajuste a Claude Code: TechRadar lo fecha por el propio nombre del ajuste; The Register, en un despliegue de principios de marzo con la v2.1.69.
Anthropic, primera respuesta pública (7 abr)Ese mismo ajuste solo oculta el razonamiento de la interfaz y no lo reduce; atribuye la mejora al pensamiento adaptativo de Opus 4.6.

Lo que añaden otros profundidad desde fuera del propio relato de Anthropic

  • En Hacker News, Boris Cherny, del equipo de Claude Code, completó el mecanismo que el blog de Anthropic solo resumía: normalmente todos los mensajes de una conversación menos el más reciente aciertan en la caché de prompts, pero tras una hora de inactividad el siguiente mensaje supone un fallo de caché completo, y en un caso extremo una sesión de 900 000 tokens dejada inactiva una hora podría escribir de golpe más de 900 000 tokens en la caché — “un porcentaje significativo de tus límites de uso, sobre todo para los usuarios Pro”. Eliminar el pensamiento antiguo tras la inactividad fue el arreglo que Anthropic probó para ese coste, y su implementación es lo que introdujo el problema dos.
  • La primera respuesta pública de Anthropic a la auditoría de AMD, recogida por TechRadar el 7 de abril, discutió su causa en lugar de confirmarla: Boris Cherny dijo que el ajuste de mediados de febrero solo retiene el razonamiento de la interfaz y no lo reduce, y señaló el pensamiento adaptativo de Opus 4.6 como una mejora aparte. El análisis post mortem de Anthropic del 23 de abril no vuelve sobre este intercambio ni nombra el ajuste de mediados de febrero en absoluto.
  • Fortune informó de que algunos usuarios describieron sentirse “manipulados” por las comunicaciones de Anthropic en las semanas previas al 23 de abril, que interpretaron como una negación de que existiera problema alguno, y de que algunos dicen haber cancelado sus suscripciones. En una declaración a Fortune, Anthropic citó que la demanda había “tensado” su infraestructura “sobre todo en las horas punta” — un registro de explicación distinto al de los tres fallos concretos del blog, que responde a una pregunta que el propio análisis post mortem no plantea.
  • En un memorando interno del que informó primero CNBC y que Fortune cita, el director de ingresos de OpenAI calificó de “error estratégico” que Anthropic no asegurara cómputo suficiente. Es la caracterización de un competidor en un memorando filtrado, no un hallazgo, y el propio análisis post mortem de Anthropic no atribuye ninguno de sus tres fallos nombrados al cómputo en absoluto.
  • La cobertura de InfoQ recogió una preocupación de Reddit que el análisis post mortem no aborda: Claude Code puede delegar trabajo al modelo Haiku, más barato, sin que eso sea visible salvo en el registro detallado — un riesgo que InfoQ señaló como el más difícil de detectar en flujos desatendidos, donde una caída de calidad solo aflora varios pasos después, no en el momento en que ocurre.

Qué cambia ahora cinco medidas de seguimiento, según el propio relato de Anthropic

  • Que una proporción mayor del personal interno use exactamente la compilación pública de Claude Code, y no una compilación de pruebas aparte.
  • Ejecutar una batería amplia de evaluaciones por modelo para cada cambio del prompt del sistema, continuando el análisis de ablación que finalmente detectó el problema tres.
  • Crear herramientas que faciliten revisar y auditar los cambios del prompt del sistema, y añadir orientación en CLAUDE.md para que los cambios específicos de un modelo queden restringidos a ese modelo.
  • Dar a todo cambio que pueda sacrificar inteligencia un periodo de reposo, una batería de evaluaciones más amplia y un despliegue gradual, para detectar antes los problemas.
  • Ampliar el contexto de repositorio de su herramienta Code Review — el cambio que permitió a Opus 4.7 detectar la pull request culpable del problema dos, cosa que Opus 4.6 no había logrado — y usar @ClaudeDevs en X y un hilo centralizado en GitHub para explicar las decisiones de producto a medida que se toman.

La lección de fondo, y lo que sigue abierto

El propio relato de Anthropic sobre el fallo es estructural: cada cambio superó su propia revisión, y nada era responsable de comprobar qué harían varios cambios a la vez — que es exactamente lo que ataca la más sustancial de las medidas de seguimiento. Dos cosas que el análisis post mortem no zanja: si el cambio de mediados de febrero que señaló una auditoría externa jugó algún papel real en la caída, y si la delegación silenciosa de Claude Code a un modelo más pequeño supone un riesgo comparable. Ambas cosas están atribuidas a fuentes con nombre y se dejan abiertas aquí, sin fundirlas en las tres causas que nombró Anthropic.

Fuentes: Anthropic, “An update on recent Claude Code quality reports”, 23 abr 2026 · Beatrice Nolan, Fortune, 24 abr 2026 · Steef-Jan Wiggers, InfoQ, 14 may 2026 · Brandon Vigliarolo, The Register, 6 abr 2026 · Craig Hale, TechRadar, 7 abr 2026 · Boris Cherny, Hacker News, 23 abr 2026. Las fechas siguen cada fuente tal como se publicó.