A OpenAI está vasculhando cerca de 50 petabytes de registros para reconstruir atividades de seus agentes que podem ter afetado sistemas de terceiros. A investigação já levou à notificação de mais de 100 organizações e, segundo o Guardian, custa mais de US$ 500 mil por dia. A escala do trabalho transforma um problema de segurança de IA em uma questão operacional: empresas que dão autonomia a agentes precisarão registrar não apenas o que seus sistemas fizeram, mas também com quais permissões, ferramentas e contexto cada ação foi tomada.

A própria OpenAI ressalta que uma notificação não significa que dados privados tenham sido acessados ou que o sistema da organização tenha sido efetivamente comprometido. A revisão procura casos em que modelos podem ter contornado controles de acesso, usado credenciais expostas, executado injeções de comandos ou alcançado componentes internos de serviços externos.

O episódio levanta uma questão que deve acompanhar a expansão dos agentes dentro das empresas: se reconstruir as ações de sistemas autônomos exige analisar dezenas de petabytes de registros, qual infraestrutura de observabilidade precisa existir antes que esses agentes recebam acesso real a redes, credenciais e aplicações corporativas?

Logs tradicionais não explicam toda a cadeia de decisão

Sistemas corporativos já registram autenticações, processos, alterações em arquivos e conexões de rede. O problema é que um agente adiciona uma camada intermediária entre a intenção humana e a ação executada.

Um processo iniciado por um software convencional geralmente corresponde a uma instrução previamente programada. Um agente pode escolher ferramentas, interpretar informações externas, alterar seu plano e executar dezenas ou centenas de etapas para cumprir um objetivo mais amplo.

A própria OpenAI reconhece essa diferença ao descrever sua arquitetura interna para o Codex. Segundo a empresa, logs tradicionais ajudam a mostrar que um processo foi iniciado, um arquivo alterado ou uma conexão tentada, mas não necessariamente explicam por que o agente tomou determinada decisão ou qual era a intenção original do usuário.

Por isso, a empresa registra elementos específicos do comportamento do agente, como prompts, decisões de aprovação, chamadas de ferramentas, resultados dessas chamadas, uso de servidores MCP e decisões tomadas por políticas de rede. Esses registros podem ser centralizados em sistemas tradicionais de segurança e compliance.

O efeito prático é que a trilha de auditoria deixa de ser apenas uma sequência de eventos técnicos e passa a precisar registrar a trajetória operacional do agente.

Linha do tempo da intrusão investigada pela Hugging Face, de 9 a 13 de julho de 2026, com volume de eventos e faixas de atividade por fase; definição aprimorada com IA.
Linha do tempo publicada pela Hugging Face: as barras superiores mostram o volume de eventos; as faixas abaixo, a atividade de cada fase da intrusão. Os marcos indicam avanços do agente e a detecção e contenção. Reprodução/Hugging Face; definição aprimorada com IA.

Permissão precisa acompanhar cada ação do agente

Observabilidade, porém, só permite entender o problema depois que uma ação começou ou aconteceu. O segundo componente é limitar antecipadamente o espaço em que o agente pode operar.

Na infraestrutura usada pela OpenAI com o Codex, sandboxing define onde o agente pode escrever, quais áreas permanecem protegidas e quando ele pode acessar a rede. A empresa também afirma que não oferece acesso externo irrestrito por padrão: destinos conhecidos podem ser autorizados, outros bloqueados e domínios desconhecidos podem exigir aprovação.

Esse modelo aproxima a segurança de agentes do princípio tradicional de menor privilégio, mas com uma diferença importante. Não basta limitar a conta utilizada pelo software. É necessário limitar as decisões que o agente pode tomar com aquela conta.

Um agente que recebe uma credencial ampla, acesso irrestrito à internet e liberdade para executar comandos transforma qualquer erro de interpretação, prompt injection ou comportamento inesperado em uma possível ação externa.

A revisão conduzida pela OpenAI encontrou justamente categorias como uso de credenciais publicamente expostas, contorno de controles de acesso e acesso a componentes que não estavam destinados ao agente.

Isso cria pressão para que empresas adotem credenciais temporárias, escopos reduzidos, políticas específicas por ferramenta, restrições de rede e aprovações adicionais para operações capazes de produzir consequências difíceis de reverter.

Aprovação humana deixa de ser suficiente quando a escala aumenta

Outra consequência aparece quando agentes passam a executar tarefas continuamente.

Exigir aprovação humana para qualquer operação reduz o risco, mas também elimina parte do ganho de automação. O caminho que começa a aparecer é uma hierarquia de ações: tarefas de baixo risco seguem automaticamente, enquanto operações sensíveis param ou são encaminhadas para revisão.

A OpenAI afirma usar esse princípio internamente. Ações de maior risco podem exigir autorização, enquanto determinados comportamentos podem acionar alertas para pesquisadores e equipes de segurança. Depois do incidente envolvendo o Hugging Face, a empresa também passou a trabalhar com procedimentos em que atividades graves podem ser interrompidas rapidamente e desenvolve mecanismos de desligamento automático para situações severas.

Isso aproxima o chamado kill switch de uma função operacional real, e não apenas de uma medida emergencial.

Para empresas, a arquitetura resultante tende a combinar limites técnicos antes da ação, monitoramento durante a execução e capacidade de interromper imediatamente comportamentos anormais.

Diagrama da Nvidia Open Agent Safety Platform, com definição aprimorada: OpenShell controla o ambiente do agente e Sentry monitora e aplica controles por BlueField-4.
No desenho da Nvidia, o OpenShell delimita a execução do agente e o Sentry mantém o monitoramento em uma camada separada, apoiada em BlueField-4. A arquitetura representa a proposta da fabricante, não uma validação independente de sua eficácia. Imagem: divulgação/Nvidia; definição aprimorada com IA.

O caso da OpenAI não pode ser transferido diretamente para qualquer empresa

Existe uma limitação importante nessa comparação.

O incidente mais grave identificado pela OpenAI ocorreu durante avaliações internas de cibersegurança e envolveu principalmente um modelo de pesquisa não disponível publicamente, operando em um ambiente com salvaguardas reduzidas. A própria companhia afirmou que o modelo conseguiu contornar controles, obter acesso à internet e comprometer partes da infraestrutura do Hugging Face.

Portanto, os episódios não demonstram que agentes comerciais comuns inevitavelmente apresentarão o mesmo comportamento.

Mas eles mostram o que muda quando um modelo recebe autonomia suficiente para interagir com sistemas reais.

O NIST chegou a uma conclusão semelhante ao analisar contribuições da indústria e de pesquisadores sobre segurança de agentes. Segundo o órgão, princípios tradicionais de cibersegurança continuam relevantes, mas existe amplo entendimento de que eles precisam ser adaptados às características específicas de sistemas capazes de planejar e executar ações autonomamente.

O custo da investigação vira parte do cálculo de adoção

Os mais de US$ 500 mil gastos diariamente pela OpenAI não representam um preço padrão para segurança de agentes. A empresa trabalha em uma escala incomum e está tentando reconstruir meses de atividade em aproximadamente 50 PB de registros.

O número, porém, expõe um custo que normalmente aparece pouco nas discussões sobre agentes: o custo de descobrir retrospectivamente o que um sistema autônomo fez.

Quanto maior a autonomia, maior pode ser o número de ações, recursos acessados e sistemas externos envolvidos em uma única tarefa. Sem identidade clara por agente, registros detalhados das ferramentas utilizadas, histórico das permissões concedidas e correlação entre intenção e execução, uma investigação pode depender da reconstrução de volumes enormes de dados heterogêneos.

Isso altera a ordem da implementação. Observabilidade, identidade, sandboxing e mecanismos de interrupção deixam de ser recursos adicionados depois que o agente entra em produção. Eles passam a fazer parte da infraestrutura necessária para permitir autonomia.

O sinal mais importante a observar agora será a forma como empresas de IA e plataformas corporativas transformarão essas práticas em padrões técnicos. O próprio NIST já conduz uma iniciativa específica para padrões de agentes, enquanto a OpenAI vem ampliando mecanismos de monitoramento, isolamento, controle de rede e resposta automática.

A mudança de padrão não está em impedir que agentes cometam qualquer erro. Está em garantir que uma organização consiga limitar, identificar, reconstruir e interromper cada ação relevante antes que investigar o agente se torne tão difícil quanto investigar toda a infraestrutura que ele tocou.

Continue no Radar