A Palo Alto Networks transformou técnicas tradicionalmente executadas em testes pontuais de segurança em um serviço contínuo. Lançado em 22 de setembro, o Unit 42 Continuous Frontier AI Defense usa modelos da Anthropic, OpenAI e open-weight para procurar vulnerabilidades, tentar combiná-las em caminhos reais de ataque e recomendar correções conforme aplicações e infraestrutura mudam. A proposta coloca pressão sobre uma prática estabelecida da segurança corporativa: contratar pentests em intervalos definidos e aceitar que, entre uma avaliação e outra, o ambiente continuará mudando.

A questão não é se o pentest tradicional desaparece. As próprias características do serviço indicam o contrário. O que começa a mudar é qual parte do trabalho precisa esperar pelo próximo teste humano.

Um ano de testes comprimido em três semanas

A Unit 42 afirma ter desenvolvido a abordagem durante seis meses, com US$ 17 milhões em pesquisa, e validado o método em mais de 100 engagements com clientes. Segundo a companhia, sua implantação interna encontrou em três semanas uma quantidade de exposições equivalente à identificada por aproximadamente um ano de testes tradicionais. O sistema também teria localizado 3,2 vezes mais vulnerabilidades de severidade alta ou crítica por produto e reduzido em 51% o tempo médio necessário para remediação.

Nos ambientes de clientes avaliados, a Palo Alto diz ter encontrado exposições em 100% dos casos, com 37% classificadas como altas ou críticas. Em aplicações de terceiros, dois terços das exposições validadas não estavam associadas a um CVE conhecido.

Esse último dado ajuda a explicar por que a comparação com scanners de vulnerabilidade é limitada. Um CVE descreve uma vulnerabilidade conhecida. Um caminho de ataque pode surgir da combinação de falhas menores, permissões inadequadas, lógica de aplicação e configurações que individualmente não aparecem como uma vulnerabilidade catalogada.

O serviço tenta justamente atravessar essa distância. Depois de um escaneamento inicial do ambiente, agentes continuam executando testes conforme aplicações, APIs, identidades, repositórios de código, nuvem e outros ativos mudam. Especialistas humanos da Unit 42 validam os resultados e as cadeias de ataque antes da remediação.

O problema do pentest periódico é o intervalo entre dois testes

O modelo clássico não surgiu por falta de interesse em testar continuamente. Há uma limitação econômica e operacional.

O guia de testes de segurança do NIST observa que penetration tests podem ser caros e gerar risco para sistemas em produção. Por isso, o órgão considerava que, dependendo da organização, um teste anual poderia ser suficiente, complementado por atividades menos intensivas e scanners executados com maior frequência.

A recomendação é de 2008. Desde então, infraestrutura corporativa tornou-se muito mais dinâmica, com cloud, APIs, software entregue continuamente e dependências externas capazes de modificar a superfície de ataque sem esperar pelo próximo ciclo de auditoria.

O próprio NIST já trata monitoramento contínuo como um componente separado da gestão de risco, destinado a manter visibilidade permanente sobre ativos, vulnerabilidades e eficácia dos controles.

Agentes ofensivos acrescentam uma nova camada a esse conceito: não apenas observar continuamente se uma vulnerabilidade existe, mas tentar descobrir se ela pode realmente ser explorada e combinada com outras falhas.

Se essa abordagem funcionar em escala, a consequência mais relevante será reduzir o período durante o qual uma nova exposição permanece desconhecida simplesmente porque o próximo pentest ainda não começou.

A velocidade do atacante torna esse intervalo mais caro

O incentivo para reduzir essa janela está aumentando.

Dados da Mandiant mostram que exploits continuaram sendo o vetor inicial mais frequente das invasões investigadas em 2025, respondendo por 32% dos casos. O relatório também registrou uma queda do tempo mediano entre o primeiro acesso e a transferência desse acesso para um segundo grupo criminoso, de mais de oito horas em 2022 para apenas 22 segundos em 2025.

A IA acrescenta capacidade de automação a esse cenário. Em 2026, o Google Threat Intelligence Group documentou o primeiro caso confirmado publicamente em que um criminoso usou IA para auxiliar na descoberta e na transformação de uma vulnerabilidade zero-day em um exploit destinado a uma campanha de exploração em massa.

Isso não significa que ataques autônomos de IA já sejam responsáveis pela maioria das invasões. A própria Unit 42 afirma que ainda não observou uma mudança fundamental nas técnicas empregadas pelos atacantes: até agora, a IA aparece principalmente como multiplicador de eficiência para métodos já conhecidos. A Mandiant chegou a conclusão semelhante ao analisar incidentes de 2025, ressaltando que falhas humanas e sistêmicas tradicionais continuam por trás da maior parte das invasões bem-sucedidas.

A mudança, portanto, está primeiro na velocidade e no custo de procurar oportunidades, não necessariamente na criação de uma classe completamente nova de ataques.

Pentest não desaparece, mas pode mudar de função

Automatizar descoberta e exploração também não elimina a necessidade de especialistas.

A própria arquitetura apresentada pela Unit 42 mantém humanos no processo de validação. Há outra limitação reveladora: segundo informações obtidas pela Axios, nos testes da empresa nenhum modelo isolado conseguiu localizar mais de 40% das vulnerabilidades em ambientes complexos. A solução usa vários modelos justamente porque eles apresentam capacidades e pontos cegos diferentes.

Isso aponta para uma divisão de trabalho mais provável do que a simples substituição do pentest.

Agentes podem executar repetidamente tarefas que são escaláveis por software: explorar aplicações, testar configurações, procurar combinações de falhas e refazer ataques depois de alterações no ambiente.

Pentesters humanos continuam relevantes em situações que dependem de contexto, criatividade adversarial, lógica de negócio, engenharia social, julgamento sobre impacto e testes que não podem ser executados permanentemente contra sistemas críticos.

O resultado pode ser uma inversão da lógica atual. Em vez de o pentest periódico ser o principal momento em que uma empresa tenta descobrir como seria atacada, a descoberta técnica passa a ocorrer continuamente e avaliações humanas mais profundas tornam-se uma camada complementar de validação e exploração de cenários específicos.

É esse deslocamento que o lançamento da Palo Alto torna mais importante acompanhar. O indicador decisivo não será quantas vulnerabilidades um agente consegue listar, mas quantos caminhos de ataque válidos ele consegue encontrar sem gerar ruído excessivo e quanto tempo as empresas realmente conseguem economizar entre descoberta e correção.

Se métricas como as reportadas pela Unit 42 forem reproduzidas em ambientes maiores e por outros fornecedores, a discussão sobre pentest tende a deixar de ser apenas “quantas vezes por ano devemos testar?” e passar a ser “quais partes da nossa infraestrutura ainda podem ficar sem ser testadas continuamente?”

Continue no Radar