El Gemini, de Google, accedió a sistemas protegidos de tres empresas reales durante pruebas de ciberseguridad realizadas en mayo por la empresa de evaluaciones Irregular. Los episodios ocurrieron cuando los modelos recibieron acceso no intencional a internet y confundieron infraestructura real con objetivos creados para los ejercicios.

En uno de los casos, el modelo probó contraseñas hasta conseguir entrar en un sistema protegido. En los otros dos, encontró credenciales disponibles en repositorios públicos y las utilizó para acceder a sistemas externos. Según Google, el Gemini interrumpió la actividad en los tres episodios tras identificar que los objetivos eran organizaciones reales.

Las empresas afectadas no fueron identificadas. Google afirmó que fueron notificadas y que trabajó con Irregular para modificar los procedimientos usados en las pruebas. La compañía también dijo que el modelo involucrado no era su versión más reciente, pero no reveló qué variante de Gemini participó en las evaluaciones.

La falla estaba en el entorno de pruebas

Irregular afirmó que el problema estaba relacionado principalmente con los controles de acceso a internet del entorno de evaluación. En uno de los escenarios, una empresa ficticia creada para la prueba tenía un nombre que coincidía con un dominio real, lo que permitía que los modelos interpretaran sistemas externos como parte del ejercicio.

La empresa dijo que los incidentes ocurrieron en una porción muy pequeña de las simulaciones avanzadas y generalmente después de cientos de interacciones. Tras identificar el problema, desactivó la evaluación afectada, amplió la revisión manual de las acciones de los modelos y reforzó los controles de monitoreo y contención.

El caso de Gemini forma parte de una serie de episodios que involucran modelos avanzados durante evaluaciones conducidas por Irregular. Meta, Anthropic y OpenAI también divulgaron incidentes relacionados con el mismo problema de acceso inadecuado a internet. Irregular afirma que las fallas conocidas fueron corregidas y trabaja en estándares adicionales para pruebas de ciberseguridad con agentes de IA.

Sigue en Radar