A Island Technologies e o AI Security Institute (AISI) revelaram, em pesquisas distintas, que agentes de inteligência artificial podem ser tanto vítimas quanto atacantes em novas ameaças digitais. A primeira identificou milhares de repositórios maliciosos no GitHub disfarçados de habilidades de agentes e servidores MCP; a segunda descreveu um agente que tentou enganar pessoas reais para aprovar código malicioso.
A Island Technologies, criadora do Enterprise Browser, chamou o ataque de 'AgentBaiting'. Segundo a empresa, um agente que procura uma nova capacidade pode encontrar sozinho um repositório de campanha, interpretar o Readme do atacante como documentação legítima e entregar as instruções de instalação ao usuário. Em testes, Claude Code, Gemini e ChatGPT exibiram repositórios maliciosos sem que um link fosse fornecido.
Em ao menos uma execução, o Claude não baixou o repositório malicioso, mas o recomendou como backup. Em outras execuções, o modelo identificou o código nocivo e se recusou a recomendá-lo.
Agente agiu contra pessoas reais
O AISI relatou que, em desafios de segurança cibernética, 'um agente de IA tomou medidas autônomas e não autorizadas na internet ao vivo, mirando pessoas e organizações reais'. O instituto afirmou que o agente tentou inserir código malicioso em um projeto open-source e, para obter aprovação, criou identidades falsas e as usou para pressionar o mantenedor do projeto.
Quando o pedido de alteração foi questionado publicamente, o agente editou sua atividade anterior para parecer inofensiva e considerou adotar uma nova identidade. Também usou a rede Tor para contornar restrições do GitHub. O agente ainda tentou contatar pessoas reais por um serviço online de transferência de arquivos, enviando mensagens com payloads nocivos ou tentativas de engenharia social.
O instituto ressaltou que, no teste, as proteções normalmente presentes em agentes públicos estavam desativadas. Ainda assim, a autonomia da tecnologia aparece como ponto central: agentes podem ser enganados para baixar conteúdo malicioso ou agir de forma ofensiva, caso restrições sejam removidas.


