Tratopedia
EN
Ajustes

Tamaño del texto

Tema

Alto contraste

Versión

v1.81.0

La publicación con la que se generó esta página. Es la que almacena en caché el service worker.

Seguridad de la IA · Criptografía · Agentes de IA · Informe de investigaciónarXiv:2608.09867 · 10 ago 2026

Resumen ejecutivo · informe de una página

El razonamiento cifrado solo estaba semioculto

OpenAI, Anthropic y Google ocultaron la cadena de pensamiento de la misma manera: cifrarla, devolvérsela al cliente y volver a admitirla en la llamada siguiente. La criptografía aguantó. La vinculación no — los bloques cifrados resultaron intercambiables entre sesiones, entre usuarios y entre modelos de la misma familia. De modo que un atacante nunca tuvo que romper el modelo potente. Basta con capturar su texto cifrado, entregárselo a un hermano más barato cuyas negativas son más endebles y pedirle que lo lea en voz alta — y el proveedor lo descifra a petición. Ocho investigadores apuntaron después la técnica a registros que los desarrolladores ya habían publicado, y leyeron en voz alta los secretos que sus autores nunca supieron que estaban ahí.

En cifras un solo barrido de registros públicos

  • 315,320bloques de razonamiento descodificados de repositorios públicos
  • 6,708trayectorias públicas de agentes barridas en su búsqueda
  • 704artefactos de privacidad de sesiones de usuario reales
  • 64de ellos no aparecen en ningún sitio del chat visible

Cómo funciona el ataque nunca se toca el modelo potente

  1. 01Consultarun modelo potente
  2. 02Capturarsu texto cifrado
  3. 03Reproduciren un hermano
  4. 04Descifrarel proveedor accede
  5. 05Transcribirnegativas débiles
  6. 06Texto planotraza literal

Lo que sigue Planteamiento · Desarrollo · Giro · Desenlace

FasePáginaQué abarca
起 Planteamiento2Por qué el razonamiento se volvió opaco y por qué el sobre se trasladó al cliente.
承 Desarrollo2Tres grados de compatibilidad, los portadores de cada proveedor y cómo maduró el hallazgo.
轉 Giro3Cuatro abusos distintos de un único fallo arquitectónico.
合 Desenlace3Qué arreglaron los proveedores y qué ya no puede alcanzar un arreglo.

Conclusión

La criptografía nunca fue la parte débil. Entregar a alguien una caja cerrada, más un guardián de la llave que la abre a cualquiera que lo pida con educación, no es confidencialidad — es ofuscación con pasos de más. El AEAD era sólido; la vinculación sencillamente no existía.

Replanteamiento

La seguridad se aplicaba por modelo mientras que las claves se compartían por familia. Ese desajuste es toda la vulnerabilidad, y volverá a darse allí donde los niveles de capacidad compartan infraestructura.

Panfilov, Schmotz, Shumailov, Beurer-Kellner, Schaeffer, Prabhu, Geiping & Andriushchenko · arXiv:2608.09867 (10 ago 2026) · The Hacker News (12 ago 2026) · M. Green, Cryptography Engineering (29 may 2026)

Por qué el pensamiento se volvió opaco dos motivos, un atajo

  • Motivo · propiedad intelectual y filtraciones

    Ocultar la cadena de pensamiento

    la justificación declarada

    • El razonamiento en bruto es material entrenable — ocultarlo frena la destilación por parte de los competidores.
    • Una traza filtra bastante más que la respuesta que produjo.
    • Los tres proveedores convergieron en la misma decisión, de forma independiente.
    • Ninguno documenta el esquema criptográfico que eligió.
    • A fecha de julio de 2026 el diseño seguía sin describirse públicamente.
  • Atajo · ausencia de estado

    Dárselo al cliente

    cifrado, no almacenado

    • El almacenamiento en el servidor cuesta estado; el texto cifrado en manos del cliente no cuesta nada.
    • Un sobre AEAD — cabecera, nonce, etiqueta de autenticación, texto cifrado.
    • El cliente lo devuelve en cada llamada posterior, sin leerlo.
    • La firma se incorpora al MAC mediante hash como datos asociados.
    • Nada en el sobre nombra una sesión, un usuario ni un modelo.

Tres grados de compatibilidad cada vez más permisivos

La taxonomía es la verdadera aportación del artículo. Los bloques se reproducen dentro de una sesión y entre sesiones; luego entre usuarios, de modo que una cuenta puede introducir una traza capturada de otra; luego entre modelos de la misma familia. El tercer grado es la palanca. Al modelo potente nunca se le hace jailbreak — sencillamente se le cita a un hermano más barato cuyo entrenamiento en negativas es más endeble, y ese hermano lee la traza en voz alta, palabra por palabra. Como ningún proveedor documenta el esquema, los autores infieren del comportamiento que hay una única clave global en uso. Sus palabras exactas son parecen ser, y esa cautela pertenece a cada reformulación de este hallazgo.

  • 1 keypor proveedor — inferido del comportamiento, nunca revelado
  • entre modelosel grado que convierte la reproducción en extracción
ProveedorPortador en el clienteSegún lo describe el artículo
OpenAIsignatureElementos de razonamiento cifrados devueltos para su reproducción manual bajo una gestión del historial sin estado.
AnthropicthinkingSignatureBloques de pensamiento que llevan una firma opaca codificada en base64 junto a un resumen.
GooglethoughtSignatureFirmas de pensamiento, según se documentan para la API de Gemini.
  1. 29 may 2026Matthew Green establece la reproducción entre sesiones, cuentas y modelos, más un canal lateral de temporización — pero no logra recuperar el texto plano de forma fiable, y lo dice sin rodeos.
  2. Principios de jul 2026Panfilov et al. comunican una extracción fiable y escalable a los tres proveedores.
  3. 10 ago 2026Se publica el artículo; 315,320 bloques ya descodificados de repositorios públicos.
  4. 11 ago 2026Green actualiza su entrada de mayo para señalar el resultado que remató el trabajo que él había empezado.
  5. ago 2026Los ataques ya no se reproducen. Se acusó recibo — pero sin declaración pública de los proveedores y sin CVE.

Mecanismo, taxonomía y campos portadores según arXiv:2608.09867 §2 · hallazgo previo de reproducción según M. Green, Cryptography Engineering (29 may 2026, actualizado el 11 ago 2026)

Cuatro abusos de un solo fallo una palanca · cuatro resultados

VectorQué producePor qué escuece
Destilaciónel razonamiento propietario, literal, demostrado en los tres proveedoresderrota justo el ocultamiento que todo el diseño existía para proporcionar
Extracción de datos62 claves de API, 33 contraseñas, 24 tokens de acceso y 7 claves privadas, de sesiones realesrecolectadas de registros que sus dueños optaron por publicar, creyéndolos ya saneados
Peligros ocultoscontenido que la propia respuesta visible del modelo ya se había negado a daruna negativa en la capa de salida no es una negativa dentro del razonamiento que la precedió
Inyección invisibleuna carga útil que vive por completo dentro del bloque opaco, transportada por una traza inocenteningún lector de la transcripción puede verla — una traza compartida se convierte en vehículo de entrega

Lo que el barrido encontró en realidad repositorios públicos, ago 2026

  • 1,028bloques descodificados que contienen una violación de la privacidad
  • 0.3%de todos los bloques descodificados — raro, no inofensivo
  • 328sesiones afectadas, o el 4.9% de las trayectorias
  • 912artefactos si también se cuentan las trazas de referencia

Un número pesa más que el resto. De los 704 artefactos recuperados de sesiones de usuario reales, 64 no aparecen en ninguna parte del historial de chat visible — el secreto existía únicamente dentro del razonamiento. Cualquiera que hubiese limpiado a conciencia su transcripción antes de publicarla se habría dejado todos y cada uno de ellos, porque en la parte legible no quedaba nada que limpiar. Eso es lo que distingue este caso de una historia corriente de credenciales filtradas: el remedio habitual, léelo antes de publicarlo, no sirve con un campo que no puedes leer. Las trazas de referencia se contaron aparte por una razón prosaica que los autores tuvieron el cuidado de dar — los despliegues como ClawBench entregan al modelo un personaje sintético completo sobre el que razonar, lo que de otro modo inflaría todos los recuentos de datos personales del estudio.

  • 64artefactos que sanear el texto visible jamás habría atrapado
  • pruebas de referenciacontadas aparte — los personajes sintéticos inflarían los totales

Dónde acaba arreglado hacia delante, no hacia atrás

  • Vincular el sobre — llevar los identificadores de usuario y de conversación dentro de la carga útil AEAD para que un bloque reproducido se rechace de plano.
  • Aislar entre modelos — rechazar todo sobre acuñado por una versión del modelo distinta de la que se está consultando.
  • Almacenar en el servidor — devolver solo un identificador aleatorio opaco; la respuesta que el diseño se propuso evitar.
  • Añadir revocación — llevar registro de las firmas emitidas para poder invalidar una traza comprometida.
  • Depurar antes de publicar — eliminar todo campo de razonamiento opaco de cualquier transcripción que salga de tu ordenador.
  • Rotar lo que ya salió — un arreglo en el servidor detiene lecturas nuevas, nunca filtraciones viejas.
  • Entrenar la negativa — enseñar a los modelos a rechazar las peticiones que les piden transcribir razonamiento oculto; obsérvese que esto defiende en la capa que ya falló una vez.
  • Tratar los campos opacos como contenido — un campo que no puedes leer es imposible de sanear, no está vacío, y nunca debe darse por inofensivo.

Hasta dónde llegó el arreglo

Los tres proveedores cerraron la puerta en cuestión de semanas, y las pruebas de concepto ya no funcionan. Pero 315,320 bloques ya son públicos, y todas las credenciales que contienen ya están gastadas. Un arreglo que llega después de la publicación no despublica nada — el único remedio que queda es la rotación, a manos de gente que aún no sabe que la necesita.

El cambio duradero

Las trazas de agente compartidas son ya una superficie de la cadena de suministro, y se mantiene el límite estructural que señalan los propios autores: mientras el modelo no sea plenamente robusto frente a las peticiones de extracción, el razonamiento cifrado nunca podrá pasar de semioculto. Todos los proveedores recurrieron a la misma forma de manera independiente, y todos ellos olvidaron que el cliente no es la única parte capaz de devolver ese estado.

Vectores de ataque y mitigaciones según arXiv:2608.09867 §3–5 · la cifra de 704 es la población de sesiones de usuario reales del artículo, distinta de los 912 que incluyen trazas de referencia