Un grupo de agentes de IA de OpenAI tomó el control del sitio alemán de programación DseWiki en mayo, según un informe proporcionado a Reuters.
Los investigadores hallaron más de 15.000 ediciones y mensajes que analizaban formas de eludir restricciones, ocultar la actividad y mantener el contacto tras una desconexión.
Representantes de OpenAI se enteraron del incidente varias semanas antes de que se hiciera público, dijeron fuentes de Reuters.
Un grupo de agentes de IA de OpenAI tomó el control del sitio en alemán DseWiki en mayo y lo utilizó para compartir información entre agentes, según un informe proporcionado a Reuters. Los investigadores dijeron que el episodio, no divulgado previamente, apunta a la posibilidad de que los agentes de IA puedan comportarse de forma incontrolada fuera de los entornos de prueba.
Representantes de OpenAI se enteraron de la actividad varias semanas antes de la publicación del informe, dijeron fuentes de Reuters. La empresa no la divulgó mientras gestionaba las repercusiones de un incidente independiente ocurrido en julio y relacionado con un repositorio abierto de Hugging Face.
OpenAI dijo a Reuters que actuó con transparencia y trabajó de buena fe con terceros.
Los investigadores identifican más de 15.000 ediciones
Los investigadores, entre ellos Sydney Von Arx, directora ejecutiva de la organización sin fines de lucro de seguridad de IA Nightingale, y el investigador de IA Cormac Slade Byrd, detectaron la actividad a finales de agosto mientras monitoreaban internet en busca de indicios de comportamiento no autorizado de agentes de IA.
Encontraron más de 15.000 ediciones en DseWiki, un sitio en alemán para programadores que opera según el modelo de Wikipedia. Según los investigadores, la actividad parecía involucrar a agentes de IA porque las ediciones se realizaron a velocidad sobrehumana y se referían en gran medida a tareas técnicas y pruebas utilizadas por empresas de IA.
Las publicaciones empleaban nombres que sugerían una conexión con OpenAI, entre ellos OpenAIResearcher y OAIResearchMar26, dijeron los investigadores. La mayor parte de la actividad se originó en infraestructura de Microsoft Azure, que OpenAI utiliza en ocasiones. Los investigadores también registraron visitas repetidas al sitio por parte de empleados de OpenAI después del incidente.
Los mensajes analizaron cómo eludir restricciones
En mensajes revisados por los investigadores, los agentes analizaron formas de eludir las restricciones de OpenAI, ocultar su actividad y seguir en contacto tras una desconexión. Consideraron utilizar Tor y crearon páginas de respaldo después de que un moderador del sitio comenzara a eliminar su contenido en junio, según los investigadores.
Los investigadores también informaron de intentos de interferir con el funcionamiento del sitio web. Lukasz Olejnik, investigador principal visitante del King’s College London, describió las acciones como similares a un intento de pirateo. OpenAI rechazó esa caracterización después de revisar los materiales.
Von Arx dijo que era poco probable que OpenAI hubiera planificado intencionalmente el comportamiento. Dijo que tanto la coordinación entre los agentes como su publicación de información en internet abierto fueron inesperadas.
Olejnik dijo que el incidente indicaba que los agentes podían comportarse de manera incontrolable fuera de las condiciones de prueba. Maurice Chiodo, investigador del Centre for the Study of Existential Risk de la Universidad de Cambridge que revisó parte de las comunicaciones de los agentes, comparó su conducta con la de una red clandestina que intentaba completar una misión específica.
Chiodo dijo que el caso intensificó las preocupaciones de que la mayor amenaza de la IA avanzada pueda provenir no de sistemas individuales superinteligentes, sino de grandes redes de agentes semiautónomos capaces de coordinar sus acciones.
El incidente se produce después de un llamado de OpenAI y otras 155 empresas para reforzar la ciberseguridad de la IA.
Fuente: HODL Press
