NoticiasAccionesInvestigadores exponen los "pensamientos internos" cifrados de todos los principales modelos de IA

Investigadores exponen los "pensamientos internos" cifrados de todos los principales modelos de IA

Autor: Decrypt·

Puntos clave

  • Anthropic, OpenAI y Google usan cada uno una única clave de cifrado a nivel de proveedor para los tokens de razonamiento de IA, lo que hace que los bloques de razonamiento cifrados sean intercambiables entre diferentes sesiones, usuarios y modelos dentro de cada ecosistema.
  • Los investigadores descifraron 315,320 bloques de razonamiento a partir de 6,708 transcripciones de agentes de IA compartidas públicamente en GitHub y Hugging Face, y recuperaron 182 credenciales —incluidas 62 claves API activas y 33 contraseñas— además de 367 artefactos de información personal identificable.
  • El ataque funciona inyectando una traza de razonamiento cifrada de un modelo capaz, como Claude Opus 4.8, en un hermano más débil y menos protegido como Claude Haiku 4.5, que muestra la traza textualmente sin requerir ningún acceso especial más allá del uso estándar de la API.
  • Los datos sensibles ocultos dentro de bloques de razonamiento cifrados evaden los servicios automatizados de detección de secretos, como los de GitHub, porque esas herramientas no pueden inspeccionar el contenido cifrado.
  • Anthropic, OpenAI y Google implementaron mitigaciones del lado del servidor tras la divulgación responsable, pero las 6,708 transcripciones públicas ya extraídas siguen en línea, y se recomienda a los desarrolladores eliminar los bloques de pensamiento cifrados de los registros compartidos y rotar las credenciales expuestas.
Investigadores exponen los "pensamientos internos" cifrados de todos los principales modelos de IA

Investigadores de seguridad han encontrado una forma de leer los "pensamientos internos" cifrados de todos los principales modelos de razonamiento de IA y, en el proceso, descubrieron 62 claves API activas y 33 contraseñas ocultas en registros de sesión que los desarrolladores habían compartido públicamente en línea sin saber qué contenían.

En el centro de estos hallazgos está el descubrimiento de que Anthropic, OpenAI y Google usan todos una única clave global de cifrado para los tokens de razonamiento de IA. Al descifrar 315,320 bloques de razonamiento extraídos de repositorios públicos de GitHub y Hugging Face, los investigadores recuperaron 182 credenciales, incluidas 62 claves API activas, 33 contraseñas y 30 direcciones de correo electrónico personales.

"Al descifrar 315,320 bloques de razonamiento extraídos de repositorios públicos, recuperamos 367 artefactos de Información Personal Identificable (PII) y 182 credenciales", escribieron los investigadores en su artículo, presentado el 10 de agosto por un equipo de MATS Research, el ELLIS Institute Tübingen, el Instituto Max Planck de Sistemas Inteligentes y la firma de seguridad Snyk.

Cómo funciona el bloc de notas oculto

La investigación se centra en una clase específica de IA: los modelos de razonamiento. En lugar de responder de inmediato, estos modelos comienzan con una cadena de pensamiento interna, una especie de bloc de notas paso a paso donde la IA trabaja un problema antes de mostrar la respuesta, y solo entonces entregan una respuesta final. Estos modelos hoy están en el centro de los asistentes de programación y de los agentes autónomos que leen archivos, ejecutan comandos y procesan datos reales de usuarios, razón por la cual las credenciales y los datos personales pueden pasar por el bloc de notas privado incluso cuando nunca aparecen en la respuesta visible.

Anthropic, OpenAI y Google cifran todos ese bloc de notas oculto. El cifrado, el proceso de convertir los datos en un código ilegible, busca proteger la propiedad intelectual de la empresa y mantener el razonamiento intermedio sensible lejos de los usuarios. El bloque cifrado se envía de vuelta a los servidores del proveedor con cada mensaje posterior, lo que mantiene la conversación activa sin almacenar nada del lado de la empresa. Los laboratorios también monitorean ellos mismos ese razonamiento oculto como control de seguridad, observando la cadena de pensamiento en busca de señales de que un modelo planea infringir las reglas antes de que una respuesta llegue a los usuarios.

Una sola clave para gobernarlos a todos

La falla es arquitectónica. En lugar de vincular cada bloque de razonamiento cifrado a un usuario, una sesión o un modelo específico, los tres proveedores usan una única clave de cifrado a nivel de proveedor en todo su ecosistema.

"Estos bloques cifrados son totalmente compatibles e intercambiables entre diferentes sesiones, usuarios e incluso diferentes modelos dentro del ecosistema de un proveedor", escribieron los investigadores.

Esto significa que un bloque de razonamiento cifrado de Claude Opus 4.8, el modelo insignia de Anthropic, puede inyectarse en Claude Haiku 4.5, un hermano más económico y menos protegido, sin infringir las reglas de Anthropic. Haiku carece de la alineación antidestilación, un entrenamiento de seguridad diseñado específicamente para impedir que un modelo transcriba su propio razonamiento bajo orden, que sí tiene Opus.

Dígale a Haiku que lea el bloque cifrado palabra por palabra, y lo hace.

"Al inyectar una traza de razonamiento cifrada de un modelo dado en un modelo más débil y menos protegido del mismo proveedor, lo forzamos a decodificar y mostrar la traza textualmente en texto plano, sin recurrir nunca al jailbreak directo del modelo más capaz", señala el artículo.

"La portabilidad entre modelos significa que Haiku 4.5 puede leer los pensamientos de Opus 4.8", escribió en X el investigador principal, Alexander Panfilov.

El mismo ataque se reprodujo en la familia GPT-5.6 de OpenAI y en la línea de modelos Gemini de Google. No se requería ningún acceso especial: el acceso estándar a la API, la conexión que usan los desarrolladores para construir aplicaciones sobre modelos de IA, fue suficiente para ejecutarlo.

We can finally talk about it: We found a way to extract hidden reasoning of frontier models using a vulnerability in the APIs of every frontier AI company. We verified that our reasoning token count matches billed API thinking tokens 1:1 for most of the prompts we queried. pic.twitter.com/S7wN8aP3X7 — Alexander Panfilov (@kotekjedi_ml) August 11, 2026

Qué contenían los registros públicos

Para demostrar el daño en el mundo real, el equipo extrajo 6,708 transcripciones de agentes de IA compartidas públicamente —registros de sesión automatizados que los desarrolladores suelen publicar en GitHub y Hugging Face para colaborar o depurar errores— y descifró de ellas 315,320 bloques de razonamiento.

"Los desarrolladores comparten con frecuencia sus registros de sesión y sus trazas de pensamiento cifradas públicamente en línea, sin ser conscientes de los datos sensibles ocultos dentro de los bloques cifrados", señala el artículo. La mayoría de esos secretos nunca apareció en la salida visible de la IA: existían solo dentro del razonamiento cifrado, invisibles para cualquiera que no hubiera ejecutado el ataque. Como el material sensible estaba dentro de bloques cifrados y no en texto plano, los servicios automatizados de detección de secretos que plataformas como GitHub ejecutan sobre los repositorios públicos no tenían forma de detectarlo: las salvaguardias estándar que marcan las claves API expuestas no pueden ver el interior del razonamiento cifrado.

La vulnerabilidad abre cuatro vectores de ataque además del simple robo de credenciales:

  • Robar patrones de razonamiento propietarios de las empresas de IA para entrenar modelos competidores mediante destilación, proceso en el que una IA más pequeña aprende a imitar a una más grande estudiando sus resultados
  • Extraer datos privados de los registros compartidos
  • Ejecutar inyecciones de instrucciones invisibles, en las que órdenes maliciosas quedan ocultas dentro de bloques de razonamiento cifrados que las herramientas de monitoreo de seguridad nunca ven
  • Hacer jailbreak a modelos potentes a través de sus hermanos menos protegidos

Anthropic, OpenAI y Google implementaron mitigaciones del lado del servidor después de que el equipo siguiera los procedimientos de divulgación responsable. Como informó anteriormente Decrypt, Anthropic ha sido un foco recurrente para los investigadores de seguridad este año, especialmente porque sus últimos modelos consumen muchos más tokens en el proceso de razonamiento.

Los parches ya están activos, pero las 6,708 transcripciones de sesión con bloques de razonamiento descifrados que ya fueron extraídas de la web pública no van a desaparecer. Para los desarrolladores que han publicado transcripciones de agentes, la respuesta estándar ante este tipo de exposición consiste en eliminar los bloques de pensamiento cifrados de los registros compartidos y rotar cualquier credencial que haya pasado por esas sesiones.