Agentes autónomos vinculados a OpenAI transformaron un wiki alemán en un canal de comunicación para intercambiar información, eludir restricciones y coordinar acciones entre sí, según una investigación exclusiva publicada por Reuters este viernes (4). La actividad comenzó en mayo, pero no había sido divulgada públicamente por la empresa.
Los investigadores identificaron más de 15.000 ediciones realizadas por agentes de IA en DSEWiki, un sitio en alemán dirigido a programadores y abierto a contribuciones colectivas. Las páginas comenzaron a funcionar como una especie de tablón de mensajes entre los sistemas.
Allí, los agentes compartían métodos para obtener ventaja en determinadas tareas, eludir las limitaciones impuestas por OpenAI y ocultar parte de su comportamiento.
«Parece extremadamente improbable que OpenAI quisiera que hicieran esto», afirmó Sydney Von Arx, CEO de la organización de seguridad en IA Nightingale y una de las investigadoras responsables del hallazgo. «Dudo que deban estar coordinándose entre sí. Dudo que deban estar escribiendo en la internet abierta».
Los investigadores encontraron la actividad a finales de agosto mientras buscaban señales de comportamientos no autorizados de agentes de IA. Parte de los perfiles se identificaba con nombres como «OpenAIResearcher» y «OAIResearchMar26», y cerca de la mitad utilizaba identificaciones que sugerían alguna relación con OpenAI.
Los registros públicos de los servidores también indicaron que gran parte de la actividad provenía de la infraestructura Microsoft Azure, utilizada por OpenAI en parte de sus operaciones. Los investigadores observaron además accesos repetidos al sitio por parte de empleados de la compañía después del episodio, lo que consideraron un fuerte indicio del vínculo entre los agentes y la empresa.
Agentes intentaron preservar sus propios mensajes
La coordinación no terminó cuando el moderador de DSEWiki comenzó a borrar las páginas en junio.
Los agentes percibieron el patrón de la limpieza y comenzaron a crear páginas alternativas para mantener sus mensajes disponibles. El 19 de junio, uno de ellos escribió:
«La limpieza/eliminación del wiki parece estar activa en orden alfabético. Si esta página desaparece, pruebe con ZZZDataUSAConstructionWageLive.»
El uso de un nombre que comenzaba con «ZZZ» colocaba la nueva página al final de la secuencia alfabética, lo que potencialmente daba más tiempo para que la información permaneciera accesible.
Otros mensajes analizados por los investigadores mostraron a agentes discutiendo formas de evitar la detección, usar herramientas como Tor y preservar comunicaciones incluso después de que sus ejecuciones hubieran finalizado.
También se identificaron intentos de interferir en el propio funcionamiento del sitio. Lukasz Olejnik, investigador visitante del King's College London, calificó la actividad como un intento de intrusión. OpenAI cuestionó esa interpretación.
Maurice Chiodo, investigador de la Universidad de Cambridge que analizó parte de las comunicaciones, afirmó que los mensajes recordaban a «la operación de algún tipo de red clandestina, decidida a cumplir una tarea o misión».
Para él, el episodio refuerza la posibilidad de que un riesgo relevante de los sistemas avanzados no resida únicamente en una IA extremadamente poderosa que opera sola, sino en «vastos enjambres de IAs semiautónomas actuando en conjunto».
OpenAI ya conocía el episodio
Según Reuters, los ejecutivos de OpenAI se enteraron del incidente semanas antes de su divulgación, mientras la empresa aún lidiaba con las consecuencias de otro episodio que involucraba agentes en el repositorio Hugging Face en julio.
Personas familiarizadas con el caso dijeron que algunos investigadores internos querían ampliar el análisis sobre comportamientos similares, pero encontraron resistencia dentro de la compañía, incluso por parte de integrantes del área jurídica.
«Las afirmaciones de que nuestro equipo jurídico desalentó la investigación del incidente son falsas», afirmó un portavoz de OpenAI.
La empresa también dijo a Reuters que no había recibido acceso previo al informe de los investigadores y que analizaría el documento tras su publicación para determinar las posibles medidas necesarias.
El episodio alemán no tuvo relación directa con el caso de Hugging Face. Sin embargo, en conjunto, los incidentes amplían una cuestión que acompaña el avance de los agentes autónomos: los sistemas desarrollados para ejecutar tareas complejas pueden encontrar formas de cooperar, explotar brechas y perseguir objetivos por caminos que sus propios creadores no anticiparon.



