Palo Alto Networks transformó técnicas tradicionalmente ejecutadas en pruebas puntuales de seguridad en un servicio continuo. Lanzado el 22 de septiembre, el Unit 42 Continuous Frontier AI Defense usa modelos de Anthropic, OpenAI y open-weight para buscar vulnerabilidades, intentar combinarlas en rutas reales de ataque y recomendar correcciones a medida que cambian las aplicaciones y la infraestructura. La propuesta ejerce presión sobre una práctica establecida de la seguridad corporativa: contratar pentests a intervalos definidos y aceptar que, entre una evaluación y otra, el entorno seguirá cambiando.
La cuestión no es si el pentest tradicional desaparece. Las propias características del servicio indican lo contrario. Lo que empieza a cambiar es qué parte del trabajo debe esperar a la próxima prueba humana.
Un año de pruebas comprimido en tres semanas
Unit 42 afirma haber desarrollado el enfoque durante seis meses, con US$ 17 millones en investigación, y haber validado el método en más de 100 colaboraciones con clientes. Según la compañía, su implementación interna encontró en tres semanas una cantidad de exposiciones equivalente a la identificada por aproximadamente un año de pruebas tradicionales. El sistema también habría localizado 3,2 veces más vulnerabilidades de severidad alta o crítica por producto y reducido en 51% el tiempo promedio necesario para la remediación.
En los entornos de clientes evaluados, Palo Alto dice haber encontrado exposiciones en 100% de los casos, con 37% clasificadas como altas o críticas. En aplicaciones de terceros, dos tercios de las exposiciones validadas no estaban asociadas a un CVE conocido.
Ese último dato ayuda a explicar por qué la comparación con escáneres de vulnerabilidades es limitada. Un CVE describe una vulnerabilidad conocida. Una ruta de ataque puede surgir de la combinación de fallos menores, permisos inadecuados, lógica de aplicación y configuraciones que, individualmente, no aparecen como una vulnerabilidad catalogada.
El servicio intenta precisamente cerrar esa distancia. Después de un escaneo inicial del entorno, los agentes siguen ejecutando pruebas a medida que cambian las aplicaciones, las APIs, las identidades, los repositorios de código, la nube y otros activos. Especialistas humanos de Unit 42 validan los resultados y las cadenas de ataque antes de la remediación.
El problema del pentest periódico es el intervalo entre dos pruebas
El modelo clásico no surgió por falta de interés en probar continuamente. Existe una limitación económica y operativa.
La guía de pruebas de seguridad del NIST observa que las pruebas de penetración pueden ser costosas y generar riesgo para los sistemas en producción. Por eso, el organismo consideraba que, dependiendo de la organización, una prueba anual podría ser suficiente, complementada por actividades menos intensivas y escáneres ejecutados con mayor frecuencia.
La recomendación es de 2008. Desde entonces, la infraestructura corporativa se ha vuelto mucho más dinámica, con la nube, APIs, software entregado de forma continua y dependencias externas capaces de modificar la superficie de ataque sin esperar al próximo ciclo de auditoría.
El propio NIST ya trata el monitoreo continuo como un componente separado de la gestión de riesgos, destinado a mantener visibilidad permanente sobre activos, vulnerabilidades y eficacia de los controles.
Los agentes ofensivos añaden una nueva capa a ese concepto: no solo observar continuamente si existe una vulnerabilidad, sino intentar descubrir si realmente puede ser explotada y combinada con otros fallos.
Si ese enfoque funciona a escala, la consecuencia más relevante será reducir el período durante el cual una nueva exposición permanece desconocida simplemente porque el próximo pentest aún no ha comenzado.
La velocidad del atacante hace más costoso ese intervalo
El incentivo para reducir esa ventana está aumentando.
Datos de Mandiant muestran que los exploits siguieron siendo el vector inicial más frecuente de las intrusiones investigadas en 2025, representando el 32% de los casos. El informe también registró una caída del tiempo mediano entre el primer acceso y la transferencia de ese acceso a un segundo grupo criminal, de más de ocho horas en 2022 a solo 22 segundos en 2025.
La IA añade capacidad de automatización a este escenario. En 2026, el Google Threat Intelligence Group documentó el primer caso confirmado públicamente en el que un criminal usó IA para ayudar en el descubrimiento y la transformación de una vulnerabilidad zero-day en un exploit destinado a una campaña de explotación masiva.
Esto no significa que los ataques autónomos de IA ya sean responsables de la mayoría de las intrusiones. La propia Unit 42 afirma que aún no ha observado un cambio fundamental en las técnicas empleadas por los atacantes: hasta ahora, la IA aparece principalmente como un multiplicador de eficiencia para métodos ya conocidos. Mandiant llegó a una conclusión similar al analizar incidentes de 2025, y destacó que los fallos humanos y sistémicos tradicionales siguen detrás de la mayor parte de las intrusiones exitosas.
El cambio, por lo tanto, está primero en la velocidad y en el costo de buscar oportunidades, no necesariamente en la creación de una clase completamente nueva de ataques.
El pentest no desaparece, pero puede cambiar de función
Automatizar el descubrimiento y la explotación tampoco elimina la necesidad de especialistas.
La propia arquitectura presentada por Unit 42 mantiene humanos en el proceso de validación. Hay otra limitación reveladora: según información obtenida por Axios, en las pruebas de la empresa ningún modelo aislado logró localizar más de 40% de las vulnerabilidades en entornos complejos. La solución usa varios modelos precisamente porque presentan capacidades y puntos ciegos diferentes.
Esto apunta a una división del trabajo más probable que la simple sustitución del pentest.
Los agentes pueden ejecutar repetidamente tareas que son escalables por software: explorar aplicaciones, probar configuraciones, buscar combinaciones de fallos y rehacer ataques después de cambios en el entorno.
Los pentesters humanos siguen siendo relevantes en situaciones que dependen del contexto, la creatividad adversarial, la lógica de negocio, la ingeniería social, el juicio sobre el impacto y pruebas que no pueden ejecutarse permanentemente contra sistemas críticos.
El resultado puede ser una inversión de la lógica actual. En lugar de que el pentest periódico sea el principal momento en que una empresa intenta descubrir cómo sería atacada, el descubrimiento técnico pasa a ocurrir de forma continua y las evaluaciones humanas más profundas se convierten en una capa complementaria de validación y exploración de escenarios específicos.
Es ese desplazamiento el que hace más importante seguir el lanzamiento de Palo Alto. El indicador decisivo no será cuántas vulnerabilidades logra enumerar un agente, sino cuántas rutas de ataque válidas logra encontrar sin generar ruido excesivo y cuánto tiempo realmente logran ahorrar las empresas entre el descubrimiento y la corrección.
Si métricas como las reportadas por Unit 42 se reproducen en entornos más grandes y por otros proveedores, la discusión sobre el pentest tiende a dejar de ser solo “¿cuántas veces al año debemos hacer pruebas?” y pasar a ser “¿qué partes de nuestra infraestructura aún pueden quedar sin ser probadas de forma continua?”



