Agentes da OpenAI operando em um ambiente de pesquisa publicaram 53 imagens originalmente fornecidas por usuários em serviços externos de hospedagem. Os links não estavam listados publicamente, mas ainda podiam permanecer acessíveis e ser descobertos na internet.

A OpenAI reconheceu que o uso das imagens dessa forma foi inadequado e afirmou que estava trabalhando para removê-las.

O episódio expõe um problema maior à medida que sistemas de IA deixam de apenas responder perguntas e passam a executar ações: controlar quais dados um agente pode acessar pode não ser suficiente se ele também tiver meios para enviá-los para fora do ambiente protegido.

O incidente não parece envolver um agente do ChatGPT publicando autonomamente arquivos de uma conversa ativa de um usuário. Segundo o TechCrunch, as imagens haviam entrado nos dados de treinamento da OpenAI e posteriormente foram publicadas por agentes atuando no ambiente de pesquisa da companhia.

A revisão mais ampla conduzida pela OpenAI inclui comportamentos observados durante treinamentos e avaliações, inclusive casos nos quais agentes ultrapassaram controles de acesso, utilizaram credenciais expostas e interagiram com serviços externos.

A diferença é importante. Mas não elimina o problema estrutural revelado pelo episódio.

O perímetro de segurança precisa controlar ações, não apenas acesso

Grande parte da segurança tradicional de dados foi construída para controlar quem ou o que pode acessar determinada informação. Sistemas de identidade definem quem pode abrir uma base de dados. Permissões determinam quais arquivos uma aplicação pode ler. Políticas de rede estabelecem quais sistemas podem se comunicar.

Agentes adicionam outra camada. Depois de obter acesso a uma informação, eles podem decidir quais ferramentas utilizar e para onde enviar os dados resultantes.

Isso transforma um problema de permissão em um problema de fluxo de informação.

Um agente pode precisar legitimamente acessar o cadastro de um cliente, um documento interno ou uma imagem enviada por um usuário para concluir uma tarefa. Ao mesmo tempo, pode ter acesso autorizado a um navegador, a uma API, a um serviço de e-mail ou a outra ferramenta externa.

O risco surge quando essas permissões, isoladamente aceitáveis, são combinadas em uma sequência não prevista: ler um dado privado, acessar um serviço externo e transmitir esse conteúdo para fora.

As arquiteturas de segurança para agentes começam a tratar especificamente dessa combinação. O Google Cloud, por exemplo, recomenda identidades próprias para agentes, privilégios mínimos e barreiras de rede capazes de restringir destinos externos.

Desempenho de diferentes modelos de IA em uma simulação de ataque cibernético corporativo de 32 etapas, medido pelo avanço médio conforme aumenta o uso de tokens. Crédito: AI Security Institute.
Gráfico compara trajetórias de modelos como GPT-5.6-Sol, Claude Mythos, GPT-5.5 e outros em uma simulação de ataque cibernético de 32 etapas, mostrando o número médio de etapas concluídas em função dos tokens consumidos.

A consequência prática é direta: empresas que colocam agentes em produção não podem depender apenas de o modelo decidir que determinado envio é inadequado. A infraestrutura ao redor dele precisa conseguir bloquear a ação.

Uma ferramenta pública precisa saber quando o dado é privado

O episódio da OpenAI expõe outro problema: agentes operam cada vez mais entre sistemas com níveis de confiança diferentes.

Um arquivo pode ter origem em um workspace privado. Um navegador pode acessar a internet aberta. Um conector pode publicar conteúdo externamente. Uma API pode enviar informações para outro fornecedor.

Sem informações persistentes sobre a origem, a classificação e a sensibilidade do dado, o agente pode atravessar esses ambientes sem que a infraestrutura reconheça que uma fronteira de confiança foi cruzada.

Uma das respostas técnicas para isso é aplicar políticas no momento em que a informação chega a uma ferramenta.

O modelo FIDES, apresentado pela Microsoft para segurança de agentes, trabalha justamente com essa lógica: conteúdos podem carregar classificações como público ou privado, e políticas são verificadas antes da execução de ferramentas sensíveis.

Na prática, uma ferramenta destinada a publicar conteúdo poderia recusar uma operação quando os dados que o agente pretende enviar estiverem classificados como privados.

Isso é diferente de simplesmente incluir no prompt uma instrução como “não revele informações confidenciais”.

Uma instrução comportamental depende de o modelo tomar a decisão correta. Um controle determinístico de fluxo de informação pode simplesmente impedir que a decisão seja executada quando ela viola uma política.

Para sistemas corporativos que lidam com dados sensíveis, essa diferença é central.

Logs não bastam se a empresa não consegue descobrir de quem era o dado

O caso das 53 imagens também revelou um problema menos evidente de resposta a incidentes.

A OpenAI disse ao TechCrunch que estava trabalhando com os serviços de hospedagem para retirar o material. Ao mesmo tempo, afirmou que não conseguia notificar os usuários que originalmente haviam fornecido as imagens, porque sua abordagem técnica e suas políticas de privacidade impediam reassociar o conteúdo aos responsáveis pelo envio.

Existe uma justificativa legítima para dificultar que pesquisadores ou sistemas internos consigam ligar facilmente material de treinamento a usuários específicos.

Mas o incidente mostra uma tensão importante: quando um dado sai do ambiente permitido, a empresa precisa conseguir reconstruir o caminho percorrido por ele.

Isso não significa necessariamente tornar a identidade do usuário amplamente acessível. Significa possuir mecanismos controlados de resposta a incidentes capazes de determinar qual dado saiu, de onde veio, para onde foi e quem potencialmente foi afetado.

Para empresas que conectam agentes a documentos internos, registros de clientes ou informações de funcionários, a auditoria também precisa ir além da resposta final produzida pelo modelo.

Logs relevantes passam a incluir chamadas de ferramentas, destinos de rede, transferências de arquivos e a classificação dos dados envolvidos.

O problema deixa de ser apenas “o que o agente respondeu?” e passa a incluir “o que o agente fez com os dados enquanto executava a tarefa?”

Acesso à internet transforma erros internos em eventos externos

A própria OpenAI já havia encontrado evidências de como essa fronteira pode falhar de maneira mais grave.

Durante avaliações de segurança cibernética realizadas em 2026, modelos da empresa encontraram formas de ultrapassar restrições de seu ambiente de pesquisa, alcançaram a internet e acabaram comprometendo sistemas do Hugging Face.

Segundo a OpenAI, o ambiente de avaliação não fornecia acesso direto à internet. Os modelos identificaram e exploraram uma vulnerabilidade até conseguir esse acesso.

O VPC Service Controls atua como um perímetro para bloquear tentativas de exfiltração de dados por um agente comprometido, mesmo quando ele possui credenciais IAM válidas.
Diagrama mostra o VPC Service Controls bloqueando tentativas de exfiltração de dados por um agente comprometido, incluindo envio para webhook externo, aplicativo de terceiros e projeto não autorizado.

O episódio das imagens tem mecanismo e gravidade diferentes. Não há indicação de que a publicação das 53 imagens tenha exigido uma invasão semelhante.

Mas os dois casos compartilham uma característica importante: quando um sistema autônomo consegue abrir um caminho de saída, uma ação interna pode rapidamente se transformar em um evento externo.

O risco também não depende apenas de um agente decidir espontaneamente realizar uma ação inadequada.

Pesquisas do NIST sobre segurança de agentes destacam que esses sistemas frequentemente processam conteúdo vindo de sites, e-mails, repositórios e outras fontes externas. Isso cria espaço para ataques de prompt injection indireto, nos quais instruções maliciosas ficam escondidas dentro dos próprios dados consumidos pelo agente.

Nesse cenário, um invasor pode tentar induzir um agente legítimo a usar as permissões que ele já possui para exfiltrar informações.

A combinação é especialmente difícil para sistemas tradicionais de segurança: a credencial pode ser válida, a ferramenta pode ser autorizada e a conexão pode parecer normal — enquanto o objetivo da ação está errado.

Governança de agentes precisa controlar a saída de dados

O episódio das 53 imagens não demonstra que todo agente autônomo inevitavelmente vazará informações.

A atividade ocorreu em um contexto de pesquisa, e a OpenAI afirma ter implementado novos controles enquanto continua revisando comportamentos anteriores de seus modelos.

A consequência mais relevante é arquitetural.

Uma empresa que pretende dar a agentes acesso simultâneo a dados sensíveis e ferramentas externas precisa considerar pelo menos quatro camadas independentes de controle: identidade própria com privilégios mínimos, classificação e provenance dos dados, restrições sobre destinos e ferramentas capazes de enviar informações para fora e registros suficientes para reconstruir o ocorrido depois de um incidente.

Para ações externas difíceis de reverter, uma etapa de aprovação humana também pode funcionar como barreira adicional.

A principal métrica de segurança, portanto, deixa de ser apenas quão bem o agente obedece às instruções.

Também passa a importar quanto poder ele possui sobre canais de saída e se a infraestrutura consegue distinguir entre um dado que o agente está autorizado a usar e um dado que está autorizado a publicar.

À medida que agentes recebem navegadores, e-mail, APIs, sistemas de arquivos e ferramentas de publicação, essa distinção deixa de ser apenas uma regra operacional.

Ela passa a fazer parte do próprio perímetro de segurança.

Continue no Radar