A OpenAI está vasculhando cerca de 50 petabytes de registros para reconstruir atividades de seus agentes que podem ter afetado sistemas de terceiros. A investigação já levou à notificação de mais de 100 organizações e, segundo o Guardian, custa mais de US$ 500 mil por dia. A escala do trabalho transforma um problema de segurança de IA em uma questão operacional: empresas que dão autonomia a agentes precisarão registrar não apenas o que seus sistemas fizeram, mas também com quais permissões, ferramentas e contexto cada ação foi tomada.
A própria OpenAI ressalta que uma notificação não significa que dados privados tenham sido acessados ou que o sistema da organização tenha sido efetivamente comprometido. A revisão procura casos em que modelos podem ter contornado controles de acesso, usado credenciais expostas, executado injeções de comandos ou alcançado componentes internos de serviços externos.
O episódio levanta uma questão que deve acompanhar a expansão dos agentes dentro das empresas: se reconstruir as ações de sistemas autônomos exige analisar dezenas de petabytes de registros, qual infraestrutura de observabilidade precisa existir antes que esses agentes recebam acesso real a redes, credenciais e aplicações corporativas?
Logs tradicionais não explicam toda a cadeia de decisão
Sistemas corporativos já registram autenticações, processos, alterações em arquivos e conexões de rede. O problema é que um agente adiciona uma camada intermediária entre a intenção humana e a ação executada.
Um processo iniciado por um software convencional geralmente corresponde a uma instrução previamente programada. Um agente pode escolher ferramentas, interpretar informações externas, alterar seu plano e executar dezenas ou centenas de etapas para cumprir um objetivo mais amplo.
A própria OpenAI reconhece essa diferença ao descrever sua arquitetura interna para o Codex. Segundo a empresa, logs tradicionais ajudam a mostrar que um processo foi iniciado, um arquivo alterado ou uma conexão tentada, mas não necessariamente explicam por que o agente tomou determinada decisão ou qual era a intenção original do usuário.
Por isso, a empresa registra elementos específicos do comportamento do agente, como prompts, decisões de aprovação, chamadas de ferramentas, resultados dessas chamadas, uso de servidores MCP e decisões tomadas por políticas de rede. Esses registros podem ser centralizados em sistemas tradicionais de segurança e compliance.
O efeito prático é que a trilha de auditoria deixa de ser apenas uma sequência de eventos técnicos e passa a precisar registrar a trajetória operacional do agente.

Permissão precisa acompanhar cada ação do agente
Observabilidade, porém, só permite entender o problema depois que uma ação começou ou aconteceu. O segundo componente é limitar antecipadamente o espaço em que o agente pode operar.
Na infraestrutura usada pela OpenAI com o Codex, sandboxing define onde o agente pode escrever, quais áreas permanecem protegidas e quando ele pode acessar a rede. A empresa também afirma que não oferece acesso externo irrestrito por padrão: destinos conhecidos podem ser autorizados, outros bloqueados e domínios desconhecidos podem exigir aprovação.
Esse modelo aproxima a segurança de agentes do princípio tradicional de menor privilégio, mas com uma diferença importante. Não basta limitar a conta utilizada pelo software. É necessário limitar as decisões que o agente pode tomar com aquela conta.
Um agente que recebe uma credencial ampla, acesso irrestrito à internet e liberdade para executar comandos transforma qualquer erro de interpretação, prompt injection ou comportamento inesperado em uma possível ação externa.
A revisão conduzida pela OpenAI encontrou justamente categorias como uso de credenciais publicamente expostas, contorno de controles de acesso e acesso a componentes que não estavam destinados ao agente.
Isso cria pressão para que empresas adotem credenciais temporárias, escopos reduzidos, políticas específicas por ferramenta, restrições de rede e aprovações adicionais para operações capazes de produzir consequências difíceis de reverter.
Aprovação humana deixa de ser suficiente quando a escala aumenta
Outra consequência aparece quando agentes passam a executar tarefas continuamente.
Exigir aprovação humana para qualquer operação reduz o risco, mas também elimina parte do ganho de automação. O caminho que começa a aparecer é uma hierarquia de ações: tarefas de baixo risco seguem automaticamente, enquanto operações sensíveis param ou são encaminhadas para revisão.
A OpenAI afirma usar esse princípio internamente. Ações de maior risco podem exigir autorização, enquanto determinados comportamentos podem acionar alertas para pesquisadores e equipes de segurança. Depois do incidente envolvendo o Hugging Face, a empresa também passou a trabalhar com procedimentos em que atividades graves podem ser interrompidas rapidamente e desenvolve mecanismos de desligamento automático para situações severas.
Isso aproxima o chamado kill switch de uma função operacional real, e não apenas de uma medida emergencial.
Para empresas, a arquitetura resultante tende a combinar limites técnicos antes da ação, monitoramento durante a execução e capacidade de interromper imediatamente comportamentos anormais.

O caso da OpenAI não pode ser transferido diretamente para qualquer empresa
Existe uma limitação importante nessa comparação.
O incidente mais grave identificado pela OpenAI ocorreu durante avaliações internas de cibersegurança e envolveu principalmente um modelo de pesquisa não disponível publicamente, operando em um ambiente com salvaguardas reduzidas. A própria companhia afirmou que o modelo conseguiu contornar controles, obter acesso à internet e comprometer partes da infraestrutura do Hugging Face.
Portanto, os episódios não demonstram que agentes comerciais comuns inevitavelmente apresentarão o mesmo comportamento.
Mas eles mostram o que muda quando um modelo recebe autonomia suficiente para interagir com sistemas reais.
O NIST chegou a uma conclusão semelhante ao analisar contribuições da indústria e de pesquisadores sobre segurança de agentes. Segundo o órgão, princípios tradicionais de cibersegurança continuam relevantes, mas existe amplo entendimento de que eles precisam ser adaptados às características específicas de sistemas capazes de planejar e executar ações autonomamente.
O custo da investigação vira parte do cálculo de adoção
Os mais de US$ 500 mil gastos diariamente pela OpenAI não representam um preço padrão para segurança de agentes. A empresa trabalha em uma escala incomum e está tentando reconstruir meses de atividade em aproximadamente 50 PB de registros.
O número, porém, expõe um custo que normalmente aparece pouco nas discussões sobre agentes: o custo de descobrir retrospectivamente o que um sistema autônomo fez.
Quanto maior a autonomia, maior pode ser o número de ações, recursos acessados e sistemas externos envolvidos em uma única tarefa. Sem identidade clara por agente, registros detalhados das ferramentas utilizadas, histórico das permissões concedidas e correlação entre intenção e execução, uma investigação pode depender da reconstrução de volumes enormes de dados heterogêneos.
Isso altera a ordem da implementação. Observabilidade, identidade, sandboxing e mecanismos de interrupção deixam de ser recursos adicionados depois que o agente entra em produção. Eles passam a fazer parte da infraestrutura necessária para permitir autonomia.
O sinal mais importante a observar agora será a forma como empresas de IA e plataformas corporativas transformarão essas práticas em padrões técnicos. O próprio NIST já conduz uma iniciativa específica para padrões de agentes, enquanto a OpenAI vem ampliando mecanismos de monitoramento, isolamento, controle de rede e resposta automática.
A mudança de padrão não está em impedir que agentes cometam qualquer erro. Está em garantir que uma organização consiga limitar, identificar, reconstruir e interromper cada ação relevante antes que investigar o agente se torne tão difícil quanto investigar toda a infraestrutura que ele tocou.



