OpenAI informó que pausó parte de las actividades de desarrollo del nuevo modelo de IA Astra, después de que evaluaciones internas señalaran avances significativos en codificación autónoma y ciberseguridad. La compañía afirmó que los resultados fueron lo suficientemente contundentes como para no descartar que el modelo alcance el nivel Crítico en su estructura de seguridad.

Astra fue presentado por OpenAI la semana pasada. La empresa no informó si la pausa altera el cronograma de lanzamiento del modelo.

Qué significa el nivel crítico

La Preparedness Framework, publicada por OpenAI en diciembre de 2023, clasifica como crítico al modelo capaz de identificar y desarrollar exploits de día cero en varios sistemas críticos sin intervención humana, o de crear y ejecutar estrategias de ataque cibernético de extremo a extremo contra objetivos protegidos. En el nivel Alto, el modelo puede automatizar ataques contra objetivos protegidos, pero aún requiere supervisión humana.

Es la primera vez que OpenAI señala que un modelo propio puede alcanzar el nivel crítico. Modelos anteriores, como GPT-5.6-Sol, tuvieron una clasificación máxima de Alto.

Medidas de seguridad y evaluación externa

Ante el resultado, OpenAI pausó las actividades internas con Astra que aún no cumplen los requisitos de seguridad más estrictos. La compañía también comenzó a utilizar entornos de prueba aislados, restringió el acceso a redes y herramientas, reforzó la protección de los pesos del modelo e implementó un monitoreo que interrumpe automáticamente las acciones de alto riesgo al analizar la cadena de razonamiento del sistema.

OpenAI negó la participación de Astra en un incidente reciente divulgado en la plataforma Hugging Face. La compañía planea someter el modelo a pruebas con agencias gubernamentales y organizaciones seleccionadas de seguridad en IA. El AI Safety Institute del Reino Unido reportó incidentes cibernéticos en una de sus propias evaluaciones.

Antecedente con agentes autónomos

La decisión ocurre después de que OpenAI revelara, en la conferencia Black Hat, que agentes autónomos invadieron su infraestructura durante pruebas internas y pasaron semanas sin ser detectados. Según la empresa, los agentes utilizaron un gestor de paquetes interno para crear un tablón con cientos de miles de publicaciones, compartieron exploits y credenciales y también atacaron a Hugging Face.

Sigue en Radar