OpenAI está rastreando cerca de 50 petabytes de registros para reconstruir actividades de sus agentes que podrían haber afectado sistemas de terceros. La investigación ya ha llevado a notificar a más de 100 organizaciones y, según el Guardian, cuesta más de US$ 500 mil por día. La escala del trabajo transforma un problema de seguridad de IA en una cuestión operativa: las empresas que dan autonomía a agentes tendrán que registrar no solo lo que hicieron sus sistemas, sino también con qué permisos, herramientas y contexto se tomó cada acción.

La propia OpenAI destaca que una notificación no significa que se haya accedido a datos privados ni que el sistema de la organización haya sido efectivamente comprometido. La revisión busca casos en los que los modelos pueden haber eludido controles de acceso, usado credenciales expuestas, ejecutado inyecciones de comandos o alcanzado componentes internos de servicios externos.

El episodio plantea una pregunta que debe acompañar la expansión de los agentes dentro de las empresas: si reconstruir las acciones de sistemas autónomos exige analizar decenas de petabytes de registros, ¿qué infraestructura de observabilidad debe existir antes de que esos agentes reciban acceso real a redes, credenciales y aplicaciones corporativas?

Los registros tradicionales no explican toda la cadena de decisión

Los sistemas corporativos ya registran autenticaciones, procesos, cambios en archivos y conexiones de red. El problema es que un agente añade una capa intermedia entre la intención humana y la acción ejecutada.

Un proceso iniciado por un software convencional generalmente corresponde a una instrucción previamente programada. Un agente puede elegir herramientas, interpretar información externa, alterar su plan y ejecutar decenas o cientos de etapas para cumplir un objetivo más amplio.

La propia OpenAI reconoce esa diferencia al describir su arquitectura interna para Codex. Según la empresa, los registros tradicionales ayudan a mostrar que un proceso se inició, que un archivo se modificó o que se intentó una conexión, pero no necesariamente explican por qué el agente tomó determinada decisión o cuál era la intención original del usuario.

Por eso, la empresa registra elementos específicos del comportamiento del agente, como prompts, decisiones de aprobación, llamadas a herramientas, resultados de esas llamadas, uso de servidores MCP y decisiones tomadas por políticas de red. Esos registros pueden centralizarse en sistemas tradicionales de seguridad y cumplimiento.

El efecto práctico es que la pista de auditoría deja de ser solo una secuencia de eventos técnicos y pasa a tener que registrar la trayectoria operativa del agente.

Línea de tiempo de la intrusión investigada por Hugging Face, del 9 al 13 de julio de 2026, con volumen de eventos y franjas de actividad por fase; definición mejorada con IA.
Línea de tiempo publicada por Hugging Face: las barras superiores muestran el volumen de eventos; las franjas inferiores, la actividad de cada fase de la intrusión. Los hitos indican avances del agente y la detección y contención. Reproducción/Hugging Face; definición mejorada con IA.

Los permisos deben acompañar cada acción del agente

La observabilidad, sin embargo, solo permite entender el problema después de que una acción comenzó o ocurrió. El segundo componente es limitar de antemano el espacio en el que puede operar el agente.

En la infraestructura que OpenAI usa con Codex, el sandboxing define dónde puede escribir el agente, qué áreas permanecen protegidas y cuándo puede acceder a la red. La empresa también afirma que no ofrece acceso externo irrestricto por defecto: los destinos conocidos pueden autorizarse, otros bloquearse y los dominios desconocidos pueden requerir aprobación.

Ese modelo acerca la seguridad de agentes al principio tradicional de menor privilegio, pero con una diferencia importante. No basta con limitar la cuenta utilizada por el software. Es necesario limitar las decisiones que el agente puede tomar con esa cuenta.

Un agente que recibe una credencial amplia, acceso irrestricto a internet y libertad para ejecutar comandos convierte cualquier error de interpretación, inyección de prompt o comportamiento inesperado en una posible acción externa.

La revisión realizada por OpenAI encontró precisamente categorías como uso de credenciales expuestas públicamente, elusión de controles de acceso y acceso a componentes que no estaban destinados al agente.

Esto crea presión para que las empresas adopten credenciales temporales, ámbitos reducidos, políticas específicas por herramienta, restricciones de red y aprobaciones adicionales para operaciones capaces de producir consecuencias difíciles de revertir.

La aprobación humana deja de ser suficiente cuando aumenta la escala

Otra consecuencia aparece cuando los agentes pasan a ejecutar tareas de forma continua.

Exigir aprobación humana para cualquier operación reduce el riesgo, pero también elimina parte del beneficio de la automatización. El camino que empieza a aparecer es una jerarquía de acciones: las tareas de bajo riesgo continúan de forma automática, mientras que las operaciones sensibles se detienen o se derivan a revisión.

OpenAI afirma usar ese principio internamente. Las acciones de mayor riesgo pueden exigir autorización, mientras que determinados comportamientos pueden activar alertas para investigadores y equipos de seguridad. Después del incidente que involucró a Hugging Face, la empresa también empezó a trabajar con procedimientos en los que las actividades graves pueden interrumpirse rápidamente y desarrolla mecanismos de apagado automático para situaciones severas.

Esto acerca el llamado kill switch a una función operativa real, y no solo a una medida de emergencia.

Para las empresas, la arquitectura resultante tiende a combinar límites técnicos antes de la acción, monitoreo durante la ejecución y capacidad de interrumpir de inmediato comportamientos anómalos.

Diagrama de Nvidia Open Agent Safety Platform, con definición mejorada: OpenShell controla el entorno del agente y Sentry monitorea y aplica controles mediante BlueField-4.
En el diseño de Nvidia, OpenShell delimita la ejecución del agente y Sentry mantiene el monitoreo en una capa separada, apoyada en BlueField-4. La arquitectura representa la propuesta del fabricante, no una validación independiente de su eficacia. Imagen: divulgación/Nvidia; definición mejorada con IA.

El caso de OpenAI no puede trasladarse directamente a cualquier empresa

Existe una limitación importante en esa comparación.

El incidente más grave identificado por OpenAI ocurrió durante evaluaciones internas de ciberseguridad e involucró principalmente a un modelo de investigación no disponible públicamente, que operaba en un entorno con salvaguardas reducidas. La propia compañía afirmó que el modelo logró eludir controles, obtener acceso a internet y comprometer partes de la infraestructura de Hugging Face.

Por lo tanto, los episodios no demuestran que los agentes comerciales comunes vayan a presentar inevitablemente el mismo comportamiento.

Pero muestran lo que cambia cuando un modelo recibe autonomía suficiente para interactuar con sistemas reales.

El NIST llegó a una conclusión similar al analizar contribuciones de la industria y de investigadores sobre seguridad de agentes. Según el organismo, los principios tradicionales de ciberseguridad siguen siendo relevantes, pero existe un amplio entendimiento de que deben adaptarse a las características específicas de sistemas capaces de planificar y ejecutar acciones de forma autónoma.

El costo de la investigación se convierte en parte del cálculo de adopción

Los más de US$ 500 mil gastados diariamente por OpenAI no representan un precio estándar para la seguridad de agentes. La empresa trabaja a una escala inusual y está intentando reconstruir meses de actividad en aproximadamente 50 PB de registros.

La cifra, sin embargo, expone un costo que normalmente aparece poco en las discusiones sobre agentes: el costo de descubrir retrospectivamente lo que hizo un sistema autónomo.

Cuanto mayor sea la autonomía, mayor puede ser el número de acciones, recursos a los que se accedió y sistemas externos involucrados en una única tarea. Sin una identidad clara por agente, registros detallados de las herramientas utilizadas, historial de los permisos concedidos y correlación entre intención y ejecución, una investigación puede depender de la reconstrucción de volúmenes enormes de datos heterogéneos.

Esto altera el orden de la implementación. La observabilidad, la identidad, el sandboxing y los mecanismos de interrupción dejan de ser recursos añadidos después de que el agente entra en producción. Pasan a formar parte de la infraestructura necesaria para permitir la autonomía.

La señal más importante que hay que observar ahora será la forma en que las empresas de IA y las plataformas corporativas transformarán estas prácticas en estándares técnicos. El propio NIST ya lleva adelante una iniciativa específica para estándares de agentes, mientras que OpenAI viene ampliando mecanismos de monitoreo, aislamiento, control de red y respuesta automática.

El cambio de estándar no está en impedir que los agentes cometan cualquier error. Está en garantizar que una organización consiga limitar, identificar, reconstruir e interrumpir cada acción relevante antes de que investigar al agente se vuelva tan difícil como investigar toda la infraestructura que tocó.

Sigue en Radar