La Anthropic identificó grupos criminales y operadores vinculados a gobiernos que usaban modelos Claude para automatizar etapas de ataques cibernéticos, incluyendo el reconocimiento de objetivos, la explotación de vulnerabilidades, el robo de credenciales y la exfiltración de datos. Los casos, divulgados por la empresa el jueves (10), abarcan actividades detectadas entre diciembre de 2025 y agosto de 2026.
Según la compañía, parte de esas operaciones dejó de usar la IA solo como asistente para programación. Las estructuras con múltiples agentes pasaron a ejecutar ataques contra diversas víctimas simultáneamente, durante horas o días, con intervención humana limitada principalmente a la elección de los objetivos y al análisis de los resultados.
En una de las campañas investigadas, un grupo monitoreado como GTG-20006 utilizó flujos basados en IA para automatizar desde la preparación de infraestructura y phishing hasta la persistencia, el comando y control, y la extracción de información. Más de 20 organizaciones aparecieron en la planificación y en las operaciones del grupo, incluidos organismos gubernamentales, entidades de defensa e inteligencia, embajadas y empresas vinculadas a la industria militar.
El operador también empleaba agentes para verificar si sus malwares habían sido detectados por herramientas de seguridad. Cuando esto ocurría, el sistema podía modificar y reconstruir automáticamente el código hasta que las nuevas versiones dejaran de ser identificadas por las defensas monitoreadas.
Agentes de IA amplían la escala de los ataques
Anthropic también encontró a criminales motivados financieramente que utilizaban Claude en intrusiones contra proveedores de software. En uno de los casos, el compromiso de una empresa de SaaS permitió acceder a datos de cerca de 200 organizaciones clientes. Los atacantes también extrajeron más de 2.100 conjuntos de tokens de Azure AD, vinculados a más de 40 entornos corporativos, en aproximadamente 34 horas.

Otro ataque contra un proveedor de tecnología resultó en la extracción de más de 1 terabyte de datos, incluyendo cientos de miles de identificadores nacionales y millones de registros de tarjetas de pago. En una aerolínea, los atacantes alcanzaron sistemas que almacenaban decenas de millones de registros de pasajeros.
La empresa afirma que el principal cambio no está necesariamente en las técnicas empleadas, que siguen incluyendo credenciales robadas, phishing, servicios expuestos y vulnerabilidades conocidas, sino en la capacidad de automatizar tareas que antes exigían equipos especializados. El reconocimiento, el desarrollo de herramientas, la explotación y el procesamiento de grandes volúmenes de datos pasaron a delegarse en modelos de IA y a ejecutarse en paralelo.

Anthropic dijo haber bloqueado las cuentas asociadas a las operaciones identificadas, reforzado sus mecanismos de detección y compartido información con autoridades y empresas del sector cuando fue necesario. La compañía considera que la difusión de estructuras de ataque basadas en agentes puede permitir que operadores individuales ejecuten campañas antes restringidas a grupos con más recursos y conocimiento técnico.



