Investigadores de MATS Research, del ELLIS Institute Tübingen, del Instituto Max Planck para Sistemas Inteligentes y de la empresa de seguridad Snyk presentaron el lunes (10) un estudio que revela un fallo capaz de leer el razonamiento interno cifrado de modelos de inteligencia artificial de Anthropic, OpenAI y Google.

El estudio afirma que los modelos de razonamiento utilizan un registro interno de pasos antes de responder y que las empresas cifran estos bloques para proteger su propiedad intelectual. El fallo radica en el uso de una única clave de cifrado por proveedor: según los investigadores, los bloques son "totalmente compatibles e intercambiables" entre sesiones, usuarios e incluso diferentes modelos de la misma empresa.

En el ataque, los investigadores inyectaron un bloque cifrado del modelo Claude Opus 4.8, de Anthropic, en un modelo más débil y menos protegido, el Claude Haiku 4.5, que no tiene el entrenamiento de seguridad contra destilación presente en Opus. Haiku decodificó y reprodujo el razonamiento en texto plano. La misma técnica funcionó en la familia GPT-5.6, de OpenAI, y en la línea Gemini, de Google, con acceso estándar a la API.

En una demostración del impacto real, el equipo analizó 6,708 transcripciones de sesiones de agentes de IA compartidas públicamente en plataformas como GitHub y Hugging Face. Los investigadores decodificaron 315,320 bloques de razonamiento y recuperaron 367 artefactos de datos personales y 182 credenciales, entre ellas 62 claves de API activas y 33 contraseñas. La mayoría de esa información no aparecía en la salida visible de los modelos.

Vectores de ataque

Además del robo de credenciales, el estudio enumera cuatro vectores de ataque: extracción de patrones propietarios de razonamiento para entrenar modelos competidores mediante destilación; extracción de datos privados de registros compartidos; inyección de indicaciones invisibles dentro de bloques cifrados, sin detección por herramientas de monitoreo; y evasión de la seguridad de modelos potentes mediante versiones menos protegidas.

Después de la divulgación responsable, Anthropic, OpenAI y Google aplicaron mitigaciones en los servidores. Las correcciones ya están en vigor, pero las 6,708 transcripciones con bloques decodificados que ya estaban en internet continúan disponibles.

Sigue en Radar