Seguridad de la IA · Criptografía · Seguridad informática · Agentes de IA · Informe de investigaciónarXiv:2608.09867, 10 ago 2026 · registro actualizado a septiembre de 2026
Una sola clave, todos los modelos
Rastros de razonamiento de la IA: cifrados, no ocultos
Anthropic, OpenAI y Google envían ahora el razonamiento paso a paso de cada modelo al cliente como un bloque cifrado en lugar de texto plano, para protegerlo de la competencia y evitar que el propio usuario lo lea directamente. Un artículo publicado en agosto de 2026 demuestra que ese cifrado no está atado a la sesión, al usuario ni al modelo que lo produjo: un bloque capturado puede reenviarse a un modelo hermano más pequeño y con menos salvaguardas, que lo descifra y lo repite al pie de la letra.
Qué ocurrió
Diez semanas separan un proyecto de aficionado de un ataque funcional Las cifras principales, antes de la clasificación.
- 315,320bloques de razonamiento decodificados a partir de 6,708 trazas de agente públicas
- 704artefactos de privacidad recuperados solo de sesiones genuinas (no de referencia)
- 64de ellos, hallados únicamente dentro del razonamiento cifrado, nunca en el chat visible
- $720coste estimado para decodificar diez mil trazas de razonamiento con el modelo más barato de un proveedor
Qué está establecido, y con qué firmeza Ordenado por solidez; los grados nunca se mezclan dentro de una fila.
| Solidez | Qué muestra el registro | Fuente |
|---|---|---|
| Confirmado | Los investigadores demostraron el ataque de extracción contra las API de Anthropic, OpenAI y Google: un bloque de razonamiento capturado de un modelo muy protegido se reenvió a un modelo hermano más débil y con menos salvaguardas del mismo proveedor, que lo transcribió al pie de la letra. | Panfilov et al., ago 2026 |
| Confirmado | Al decodificar 315,320 bloques de razonamiento extraídos de 6,708 trazas de agente públicas se recuperaron cientos de credenciales y datos personales solo de sesiones genuinas, incluidas 62 claves de API, 33 contraseñas, 24 tokens de acceso y 7 claves privadas. | Panfilov et al., ago 2026 |
| Confirmado | Los autores del artículo divulgaron el fallo a los proveedores afectados, a Microsoft y a Hugging Face antes de su publicación; todos acusaron recibo. Matthew Green, cuya publicación anterior inspira este trabajo, había informado por separado del comportamiento de reproducción a OpenAI y Anthropic en mayo de 2026. | Panfilov et al.; M. Green |
| Confirmado pero no verificable aquí | El propio artículo afirma que, a agosto de 2026, sus resultados centrales de extracción ya no se reproducen contra las API de los proveedores, tras las mitigaciones que estos aplicaron después de la divulgación. | Panfilov et al., ago 2026 (declaración propia) |
| Confirmado pero no verificable aquí | The Hacker News informa de que la documentación actual de Anthropic vincula un bloque de pensamiento al modelo que lo produjo y aconseja eliminarlo al cambiar de modelo, ya que otros modelos lo ignoran. | The Hacker News, 12 ago 2026 |
| Confirmado pero no verificable aquí | A fecha de su propia publicación, The Hacker News no halló ningún reconocimiento público de Anthropic, OpenAI o Google que nombrara este artículo en concreto. | The Hacker News, 12 ago 2026 |
| No confirmado | No está establecido si los bloques de razonamiento ya publicados en línea antes de las correcciones de los proveedores siguen siendo hoy decodificables, cuestión distinta de si los nuevos intentos de extracción aún funcionan. | The Hacker News, 12 ago 2026 |
| No público | Hasta el periodo de pruebas del propio artículo, ningún proveedor había publicado una descripción detallada del mecanismo criptográfico que protege sus bloques de razonamiento. | Panfilov et al., ago 2026 |
Cronología
De un experimento de fin de semana a un método de extracción escalable Fechado tal como cada fuente se fecha a sí misma.
- 2026Matthew Green, criptógrafo de la Universidad Johns Hopkins, publica un experimento de aficionado en el que descubre que los bloques de razonamiento cifrados de las API de OpenAI, Anthropic y Google pueden reenviarse entre sesiones, entre cuentas y, en el caso de OpenAI, entre modelos, sin una clave de descifrado válida.
- 29 may 2026Green informa del comportamiento de reproducción a OpenAI y Anthropic a través de sus programas de recompensas por errores. Según su propio relato, OpenAI califica el informe de irreproducible y Anthropic dice no ver implicación de seguridad alguna en la reproducción o los canales laterales.
- jul 2026Los autores del artículo realizan su evaluación de las API de Anthropic, OpenAI y Google, desarrollando el método de extracción entre modelos y el rastreo de trazas públicas.
- 10 ago 2026Se envía a arXiv “Stealing Reasoning Traces from Proprietary LLM APIs”, que describe el método de extracción entre modelos y los hallazgos del rastreo de trazas públicas.
- 11 ago 2026Green añade una actualización a su publicación de mayo remitiendo a los lectores al nuevo artículo, describiéndolo como la conversión de su propio hallazgo en “un ataque real y funcional”.
- 12 ago 2026The Hacker News publica su propia cobertura, corroborando las cifras del artículo y añadiendo que el cifrado en sí nunca se rompió: el ataque se basa en que el proveedor acepte y procese bloques intactos.
- ago 2026Según el propio artículo, los tres proveedores aplican mitigaciones tras la divulgación, y sus resultados centrales de extracción dejan de reproducirse.
- sep 2026La documentación actual muestra que los tres proveedores no han convergido en una sola postura: Google sigue describiendo una compatibilidad entre modelos gestionada por el backend, mientras que OpenAI ahora restringe la reutilización del razonamiento a modelos de la misma familia y omite automáticamente el resto.
El argumento
La criptografía nunca fue el punto débil: lo fue el límite que la rodeaba Atribuido, por su nombre, al artículo y al propio relato de Green.
Panfilov y sus colegas describen una decisión arquitectónica, no un cifrado roto: para evitar almacenar cada rastro de razonamiento en sus propios servidores, Anthropic, OpenAI y Google empaquetan cada uno en un bloque cifrado y se lo entregan al cliente para que lo guarde y lo devuelva en el siguiente turno. Sus pruebas indican que cada proveedor autentica y cifra todos esos bloques con una única clave, compartida en todo el proveedor, en lugar de una clave atada a una sesión, un usuario o un modelo concretos. La criptografía en sí no necesitó romperse en ningún momento: el bloque simplemente no lleva ninguna marca de dónde se creó ni a quién pertenece.
La publicación de mayo de Green es el origen de esa observación, y el artículo lo reconoce directamente. Green descubrió que un bloque capturado se reproducía entre sesiones, entre cuentas y, en el caso de OpenAI, entre modelos distintos, y que un bloque reproducido está “semánticamente activo” en lugar de simplemente ignorarse. También demostró, sobre datos que él mismo introdujo, que la duración y el tiempo de un bloque de razonamiento pueden filtrar un bit secreto que al modelo se le había ordenado no revelar nunca directamente. Lo que, por su propio relato, no logró fue convertir ninguno de los dos hallazgos en una forma fiable de extraer un secreto real de la sesión de otra persona. La aportación propia del artículo es el paso que faltaba: encaminar un rastro capturado a través de un modelo hermano más pequeño y con menos salvaguardas del mismo proveedor, que lo descifra y lo transcribe cuando se le pide, sin pedir jamás al modelo más capaz que produjo ese razonamiento que lo revele directamente.
Ese paso de reenvío funciona por una asimetría de seguridad que el artículo nombra directamente: un modelo puntero está muy entrenado para negarse a revelar su propia cadena de pensamiento, pero sus hermanos más baratos y rápidos — construidos por coste y velocidad, no como el producto insignia — no se someten al mismo estándar. El atacante nunca necesita hacer jailbreak al modelo capaz; solo necesita un hermano compatible dispuesto a decodificar lo que se le entrega.
La misma portabilidad que el artículo explota de forma deliberada, un tercero puede explotarla de forma incidental. Los desarrolladores publican habitualmente registros brutos de sesiones de agente por motivos de reproducibilidad, arrastrando consigo sus bloques de razonamiento junto con la transcripción visible; un tercero que pueda leer esos bloques con cualquier modelo compatible recupera todo aquello sobre lo que razonó el modelo, aparezca o no en el texto visible. El artículo plantea esto, y una segunda consecuencia — que una instrucción maliciosa puede plantarse por completo dentro de un bloque de razonamiento y reproducirse después en una tarea sin relación, invisible para quien solo lea la conversación visible —, como la razón por la que la opacidad corta en ambas direcciones: puede ocultar contenido dañino sobre el que un modelo razonó sin decirlo, y con la misma facilidad puede ocultar algo que un usuario o un supervisor necesitaba ver.
El artículo extrae su propia conclusión de esta tensión de diseño: mientras algún modelo tenga que descifrar y actuar sobre el razonamiento previo para continuar una conversación, un bloque de razonamiento cifrado “nunca puede ser más que semioculto”, sea cual sea el aspecto de la criptografía a nivel de transporte: el contenido sigue siendo alcanzable a través de cualquier modelo que posea implícitamente la clave. Ese es el sentido preciso de estar cifrado, pero no oculto: el razonamiento se cifró contra el usuario que quisiera leerlo y contra un rival que lo recolectara en masa; nunca estuvo, ni pudo estar, oculto para un modelo de la misma familia al que se le pidiera con suficiente insistencia que lo repitiera.
Qué añaden otras fuentes
Tres proveedores, tres posturas distintas un mes después Leído directamente en la documentación actual para desarrolladores de cada proveedor.
Google
La compatibilidad se mantiene, y el backend la gestiona
- Su documentación sigue llamando a las firmas de pensamiento “representaciones cifradas del razonamiento interno del modelo”, necesarias para la continuidad entre turnos.
- Al cambiar de modelo dentro de una sesión, la indicación es seguir reenviando los bloques de pensamiento del modelo anterior: “el backend gestiona la compatibilidad”.
OpenAI
Ha aparecido un límite desde la ventana de pruebas del artículo
- Las respuestas sin estado siguen devolviendo un elemento de razonamiento
encrypted_contentpara que el cliente lo guarde y lo reenvíe. - Pero el razonamiento persistido “solo puede reutilizarse dentro de la misma familia de modelos”, y la API ahora omite automáticamente el razonamiento incompatible: más estrecho que el comportamiento de julio de 2026 que midió el artículo, cuando el razonamiento se transmitía entre todas las generaciones anteriores de GPT probadas.
- Las respuestas sin estado siguen devolviendo un elemento de razonamiento
Anthropic
Una afirmación que no aparece en la documentación actual de Anthropic
- The Hacker News informa de que la documentación de Anthropic vincula un bloque de pensamiento a su modelo de origen y aconseja eliminarlo al cambiar, ya que otros modelos lo ignoran.
- La propia documentación pública de Anthropic sobre Extended Thinking, a septiembre de 2026, no contiene ese texto y no usa en absoluto la palabra “signature”.
Qué añaden el registro de divulgación y las propuestas de mitigación De la propia sección de discusión del artículo y de las recomendaciones del propio Green.
La propia lista de soluciones del artículo va de lo drástico a lo incremental: trasladar el almacenamiento del razonamiento de vuelta a los servidores del propio proveedor y entregar al cliente solo un identificador de consulta opaco eliminaría por completo el activo reproducible, a un coste de infraestructura real; sin llegar a tanto, propone atar cada sobre cifrado a un usuario y una conversación concretos, y rechazar un bloque presentado fuera del contexto que lo produjo. La propia recomendación de Green de mayo, dirigida directamente a los proveedores, era más limitada y llegó antes: mejorar la gestión de claves, y dejar de tratar un canal lateral como algo indigno de la atención de un equipo de seguridad solo porque sea lento.
Conclusión
El cifrado protegía el límite equivocado Para quien publique trazas de agente, conserve el estado de sesión, o lea la documentación de un proveedor para planificar en torno a ella.
- Elimina los bloques de razonamiento o pensamiento de cualquier registro de sesión o traza de agente antes de publicarla, siempre que esa sesión haya tocado algo sensible — depurar solo el texto visible deja intacto, dentro del bloque cifrado, todo aquello sobre lo que razonó el modelo.
- No des por seguro entregar a un tercero un bloque opaco e ilegible solo porque no se puede leer sin la clave: lo que resultó capaz de leerlo fue un modelo compatible, no la clave.
- Consulta la guía específica de continuidad del razonamiento de la API del proveedor que uses, en lugar de asumir que una sola política se aplica en todas partes — a septiembre de 2026, los tres proveedores nombrados describen tres posturas distintas.
- En cualquier herramienta que almacene o reenvíe el estado de una conversación en nombre de un usuario, evita conservar los bloques de razonamiento más tiempo del que la propia conversación necesita.
- Cabe esperar que el límite entre modelos siga moviéndose: ya se ha estrechado una vez, para un proveedor, desde la propia ventana de pruebas del artículo, y ninguna descripción del comportamiento de una API debería darse por válida durante mucho tiempo.
Qué sostener con cautela
La afirmación de que los ataques demostrados ya no funcionan se apoya en el propio relato del artículo sobre sus pruebas posteriores, no en una declaración pública de Anthropic, OpenAI o Google. Las cifras de secretos recuperados cuentan secretos bien formados: el artículo clasifica un valor por su forma y dice expresamente que uno declarado revocado, caducado o “solo de prueba” cuenta igualmente, así que no son un recuento de claves comprobadas como operativas. Si los bloques de razonamiento ya extraídos y publicados antes de la corrección siguen siendo descifrables hoy es una cuestión abierta a septiembre de 2026.
La conclusión
Cifrar un bloque de razonamiento impidió que un usuario leyera los pensamientos de su propio modelo, e impidió que un rival los recolectara en masa. Nunca impidió, y estructuralmente no podía impedir, que un modelo compatible al que se le pidiera leerlos los leyera — porque siempre tiene que haber algún modelo que lo haga. Esa brecha entre estar cifrado y estar oculto, no un cifrado roto, es lo que permitió que un rastro capturado viajara.