OpenAI, Anthropic y Google bloquearon un ataque de razonamiento entre modelos
El ataque utilizó modelos hermanos más débiles como decodificadores y expuso credenciales en registros públicos de agentes antes de que los proveedores lo bloquearan.
By Ryan Merket · Published
Primary source: arXiv
Why it matters
Agent developers have treated opaque reasoning fields as safe to retain and publish. This paper shows those blocks can contain extractable credentials and hidden instructions.

Alexander Panfilov (@kotekjedi_ml), David Schmotz y Ilia Shumailov (@iliaishacked) encontraron una forma de recuperar razonamientos cifrados generados por modelos de OpenAI, Anthropic y Google, según un artículo publicado el 10 de agosto.

El ataque aprovechó una conveniencia integrada en las APIs de modelos de razonamiento. Los proveedores pueden devolver la cadena de pensamiento oculta de un modelo como un bloque cifrado que los clientes almacenan y reenvían en solicitudes posteriores. La guía oficial de OpenAI describe devolver elementos de razonamiento cifrados en flujos de trabajo gestionados por el cliente, mientras que la documentación de Google dice que las firmas de pensamiento de Gemini preservan el contexto de razonamiento entre llamadas a la API.
Los investigadores hallaron que estos bloques podían moverse entre usuarios, sesiones y modelos dentro de la misma familia de productos del proveedor. Alimentaron razonamientos de un modelo más potente a un hermano más barato y débil, y luego indicaron al modelo más pequeño que transcribiera el material oculto. Las salvaguardas del modelo más potente nunca tuvieron que aprobar la divulgación.
Panfilov es becario de MATS cuyo trabajo previo ha examinado cómo las inyecciones de prompt pueden derrotar a los monitores de control de IA. Los otros autores del artículo son Luca Beurer-Kellner (@lbeurerkellner), Joachim Schaeffer (@JSchaeff3r), Ameya Prabhu (@AmyPrb), Jonas Geiping (@jonasgeiping) y Maksym Andriushchenko (@maksym_andr). Sus afiliaciones incluyen MATS Research, the ELLIS Institute Tubingen, the Max Planck Institute for Intelligent Systems, the Tubingen AI Center, Snyk, the University of Tubingen y AI Sequrity Company.
Un modelo más débil se convirtió en el decodificador
Los investigadores probaron el ataque contra versiones de API disponibles a principios de julio de 2026. Para Anthropic, trasladaron razonamiento cifrado de modelos Claude más capaces a Haiku 4.5. Usaron GPT-5.6 Luna como decodificador para razonamientos de OpenAI y Gemini Robotics 1.6 para rastros de Google.
Su validación tiene un límite importante. Los investigadores no tenían acceso a la cadena de pensamiento en texto plano original de los proveedores, por lo que no pudieron comparar cada palabra recuperada con una fuente definitiva. En su lugar compararon la longitud extraída con los conteos de tokens de razonamiento reportados por las APIs e inspeccionaron si el texto recuperado contenía detalles ausentes de los resúmenes visibles. El artículo dice que los conteos de tokens coincidieron estrechamente en las pruebas sobre 120 problemas de Codeforces, lo que indica que la extracción recuperó gran parte del rastro oculto.
El método creó cuatro vías de ataque. Un desarrollador podría recopilar razonamientos para distilación de modelos, recuperar datos privados de los registros publicados por otro usuario, revelar detalles dañinos que aparecían en el razonamiento oculto a pesar de una respuesta final segura, o insertar instrucciones invisibles dentro de un bloque cifrado que un agente más tarde trate como su propio pensamiento previo.
El último escenario convierte la continuidad del razonamiento en un canal de inyección de prompt. En una prueba de concepto, los investigadores colocaron una instrucción para subir un archivo PowerPoint dentro de un bloque de razonamiento cifrado. Un modelo posterior produjo un script de edición que también envió la presentación a un servidor controlado por el atacante, mientras que la conversación visible no contenía ninguna instrucción correspondiente.
Los registros públicos contenían credenciales
Los investigadores recolectaron 6,708 trayectorias de agentes disponibles públicamente de GitHub y Hugging Face y reconstruyeron 315,320 bloques de razonamiento. Su revisión automatizada marcó al menos una filtración de privacidad en 1,028 bloques, o 0.3% de la muestra. A nivel de sesión, 328 trayectorias, o 4.9%, contenían al menos un elemento que el artículo clasificó como sensible.
En todo el conjunto de datos, incluyendo sesiones de referencia sintéticas, los investigadores contaron 367 artefactos de información personal identificable y 182 credenciales. Las sesiones genuinas de usuarios produjeron 62 claves API distintas, 33 contraseñas y 30 direcciones de correo electrónico personales, según el artículo. Algunos artefactos aparecieron solo dentro del razonamiento cifrado y estaban ausentes de la conversación visible, lo que significa que la desinfección convencional de registros no los habría encontrado.
Esos números requieren contexto. El conjunto de datos fue una recopilación dirigida más que una auditoría de todos los registros públicos de agentes, y las trayectorias de referencia representaron gran parte de la información personal porque algunas pruebas suministran deliberadamente identidades sintéticas a los modelos. Los investigadores dijeron que eliminaron los secretos recuperados después de clasificarlos.
Los proveedores bloquearon los ataques reportados
El artículo se basa en el análisis del criptógrafo Matthew Green del 29 de mayo sobre razonamiento cifrado (https://blog.cryptographyengineering.com/2026/05/), que mostró que los bloques de razonamiento podían reproducirse fuera de su contexto original. Green informó del comportamiento a OpenAI y Anthropic, mientras describía el impacto inmediato en la seguridad como incierto.
Panfilov y sus coautores ampliaron ese hallazgo usando modelos más débiles como herramientas de transcripción y aplicando la técnica a registros públicos. Divulgaron sus métodos a los proveedores de modelos afectados, Microsoft y Hugging Face, antes de la publicación. El artículo dice que cada proveedor de modelos reconoció el informe y que, posteriormente, los investigadores ya no pudieron reproducir los mismos ataques.
El investigador de seguridad en IA Timothee Chauvin (@timotheechauvin) describió el problema como de consecuencias limitadas en un hilo de siete publicaciones en X, mientras criticaba a los proveedores por dejar una debilidad de seguridad básica en los sistemas de razonamiento cifrado.
Los investigadores propusieron vincular cada bloque cifrado a su usuario original, sesión y lugar en la conversación. También recomendaron rotar claves antiguas para que los bloques de razonamiento emitidos antes de una corrección queden ilegibles, entrenar modelos para rechazar solicitudes de transcripción y mover el almacenamiento del razonamiento de nuevo a los servidores del proveedor cuando sea práctico.
Esos cambios tienen costos. El razonamiento retenido por el cliente soporta APIs sin estado, despliegues sin retención de datos y cambio de modelos sin que los proveedores tengan que conservar cada rastro oculto. La vulnerabilidad surgió por preservar esa portabilidad de forma demasiado amplia. El mismo bloque que mantenía intacto el razonamiento de un agente entre solicitudes también cruzó límites que se esperaba que el cifrado hiciera cumplir.