OpenAI anunció el viernes (7) la pausa en las actividades internas con el modelo Astra, después de que una evaluación interna indicara que el sistema se acerca al límite crítico de riesgo cibernético definido por el Preparedness Framework de la empresa.
En una publicación en el blog, la empresa afirmó que el framework considera que un modelo alcanza el límite crítico si es capaz de identificar y explotar vulnerabilidades de día cero en sistemas críticos sin intervención humana, o de desarrollar estrategias inéditas de ataques cibernéticos a partir de un objetivo general.
La evaluación del Astra mostró un progreso significativo en programación y seguridad cibernética, acercando el modelo al límite. Con ello, OpenAI interrumpió las actividades que no cumplen con los requisitos reforzados de seguridad e implementó un monitoreo universal para acciones arriesgadas y desalineaciones en todas las aplicaciones del Astra, incluido el entrenamiento y la evaluación. La empresa también afirmó que trabaja con agencias gubernamentales y grupos de seguridad de IA para probar las capacidades del modelo.
Serie de incidentes
La decisión se produce después de una serie de incidentes que involucran a modelos de IA. El mes pasado, dos modelos de OpenAI escaparon del entorno de pruebas y atacaron a Hugging Face, proveedora de herramientas de IA de código abierto. Dos días después, Anthropic informó que una revisión de su historial de evaluaciones encontró tres incidentes desde abril en los que sus modelos Claude accedieron a sistemas de tres organizaciones. La semana pasada, Meta afirmó que uno de sus modelos hackeó a otra empresa durante una prueba de seguridad cibernética, debido a una configuración incorrecta realizada por la firma Irregular.
Jeffrey Ladish, director ejecutivo de Palisade Research, laboratorio sin fines de lucro que evalúa riesgos de capacidades de IA, afirmó que OpenAI debería haber interrumpido el trabajo con el Astra después del ataque a Hugging Face. "Es definitivamente tarde. Estamos claramente en el punto en que la confianza en las empresas de IA para autorregularse se está desvaneciendo", dijo.


