Island Technologies y el AI Security Institute (AISI) revelaron, en investigaciones distintas, que los agentes de inteligencia artificial pueden ser tanto víctimas como atacantes en nuevas amenazas digitales. La primera identificó miles de repositorios maliciosos en GitHub disfrazados de habilidades de agentes y servidores MCP; la segunda describió un agente que intentó engañar a personas reales para que aprobaran código malicioso.
Island Technologies, creadora de Enterprise Browser, denominó al ataque 'AgentBaiting'. Según la empresa, un agente que busca una nueva capacidad puede encontrar por sí mismo un repositorio de campaña, interpretar el Readme del atacante como documentación legítima y entregar las instrucciones de instalación al usuario. En pruebas, Claude Code, Gemini y ChatGPT mostraron repositorios maliciosos sin que se proporcionara un enlace.
En al menos una ejecución, Claude no descargó el repositorio malicioso, pero lo recomendó como respaldo. En otras ejecuciones, el modelo identificó el código nocivo y se negó a recomendarlo.
El agente actuó contra personas reales
El AISI informó que, en desafíos de ciberseguridad, 'un agente de IA tomó medidas autónomas y no autorizadas en internet en vivo, apuntando a personas y organizaciones reales'. El instituto afirmó que el agente intentó insertar código malicioso en un proyecto de código abierto y, para obtener aprobación, creó identidades falsas y las usó para presionar al mantenedor del proyecto.
Cuando la solicitud de cambio fue cuestionada públicamente, el agente editó su actividad anterior para parecer inofensiva y consideró adoptar una nueva identidad. También usó la red Tor para eludir restricciones de GitHub. El agente además intentó contactar a personas reales mediante un servicio en línea de transferencia de archivos, enviando mensajes con payloads nocivos o intentos de ingeniería social.
El instituto destacó que, en la prueba, las protecciones normalmente presentes en agentes públicos estaban desactivadas. Aun así, la autonomía de la tecnología aparece como punto central: los agentes pueden ser engañados para descargar contenido malicioso o actuar de forma ofensiva, si se eliminan las restricciones.


