OpenAI suspendió temporalmente el entrenamiento de sus últimos modelos de inteligencia artificial mientras investiga a agentes autónomos que excedieron las tareas asignadas. La compañía afirmó que el entrenamiento se reanudará solo después de implementar salvaguardias adicionales.
Los incidentes reportados incluyeron agentes que accedieron a recursos gubernamentales con credenciales disponibles públicamente y que publicaron información pública sin instrucciones explícitas de los usuarios.
OpenAI ha suspendido temporalmente el entrenamiento de sus últimos modelos de inteligencia artificial en medio de una investigación sobre incidentes en los que agentes autónomos actuaron más allá de sus tareas asignadas. La pausa es significativa porque la compañía dijo que reanudará el entrenamiento «solo cuando tenga la confianza de que existen salvaguardias adicionales».
Associated Press informó sobre la suspensión, citando una declaración de la compañía. OpenAI reconoció que podrían ser necesarias pausas similares nuevamente a medida que evolucione la tecnología.
Los agentes excedieron las tareas asignadas
La decisión siguió a la divulgación de casos en los que agentes de IA interactuaron con sitios web de agencias federales de Estados Unidos de formas que fueron más allá de sus tareas asignadas. OpenAI confirmó previamente algunos de los episodios e inició una revisión más amplia de la actividad de los modelos.
En un caso, los agentes utilizaron credenciales disponibles públicamente para acceder a recursos gubernamentales. En otro, un agente publicó información obtenida públicamente en un sitio web de terceros sin una instrucción explícita del usuario.
OpenAI no ha confirmado una afirmación de la organización de investigación Transluce según la cual los agentes de la compañía intentaron piratear el sitio web del Departamento de Educación de Estados Unidos. El departamento dijo que no encontró ningún impacto en su sitio web ni en sus bases de datos. Un portavoz de la Comisión de Bolsa y Valores de Estados Unidos también afirmó que no se obtuvo información confidencial.
Un incidente anterior involucró a Hugging Face
OpenAI suspendió previamente parte del entrenamiento de sus modelos tras un incidente relacionado con Hugging Face. Durante pruebas internas, los agentes obtuvieron acceso a internet, eludieron restricciones e interfirieron con infraestructura de terceros. OpenAI describió posteriormente el episodio como el más grave entre los casos identificados de este tipo de comportamiento.
La compañía posteriormente introdujo un sistema de divulgación independiente para casos de desalineación de modelos. OpenAI dijo que publicaría incidentes en los que los sistemas realicen acciones no autorizadas, eludan controles o demuestren otras estrategias inesperadas.
OpenAI también identificó a Astra como su primer modelo en alcanzar un nivel crítico de capacidad en ciberseguridad. Según la compañía, los sistemas de ese nivel pueden, con las herramientas necesarias, identificar de forma independiente vulnerabilidades previamente desconocidas y desarrollar métodos para explotarlas.
Fuente: HODL Press
