Un equipo independiente de investigadores de Hacktron AI utilizó el modelo Claude de Anthropic para acceder a la infraestructura interna de OpenAI el 23 de julio de 2026, durante pruebas realizadas en el marco del programa de divulgación de vulnerabilidades de OpenAI. El incidente expuso acceso a un repositorio interno de código fuente antes de que los investigadores detuvieran la operación y notificaran a la empresa, informó The Wall Street Journal.
Claude generó código para explotar una falla en un foro
Los investigadores comenzaron con una vulnerabilidad en Discourse, un servicio de terceros que OpenAI utiliza para su foro comunitario. Identificaron una falla en el manejo de determinados archivos de imagen y pidieron a una versión especial de Claude Opus 4.8, disponible para profesionales cualificados de ciberseguridad, que escribiera código capaz de explotarla.
El código inicial no funcionó. Después de que Anthropic lanzara Claude Opus 5, el modelo encontró al día siguiente una forma de utilizar la vulnerabilidad. Su código permitió a los investigadores acceder al servidor de Discourse, que almacenaba tokens de autenticación de usuarios.
Algunos tokens seguían siendo válidos para ChatGPT y pertenecían a empleados de OpenAI. También proporcionaban acceso a GitHub, donde OpenAI mantiene su código fuente.
Los investigadores pudieron leer archivos del repositorio interno de OpenAI conocido como Monorepo. Personas familiarizadas con la arquitectura de la empresa dijeron que el repositorio contiene algunos secretos algorítmicos que ayudan a que los modelos de OpenAI sean más rápidos y eficientes. Se cree que Monorepo no contiene pesos de modelos, los billones de números que sustentan los grandes modelos de lenguaje.
Hacktron AI detuvo la operación tras darse cuenta de que había accedido a datos sensibles. Antes de detenerse, los investigadores crearon una solicitud de extracción que proponía un cambio en la documentación para añadir el texto Hacktron AI Team PoC y enlaces a sus cuentas en X. OpenAI no aceptó los cambios.
OpenAI afirmó que una revisión de GitHub encontró “acceso de lectura limitado” a metadatos de repositorios privados y cambios de código. Discourse corrigió la vulnerabilidad el 25 de julio, el día en que recibió el informe.
La IA reduce las barreras para encontrar fallas de software
Joshua Saxe, director de tecnología de Abundant Security, afirmó que el incidente ilustraba la dificultad de proteger la infraestructura corporativa frente a ataques habilitados por IA. Dijo que el software contiene numerosos errores de seguridad y que, hasta el año pasado, solo unos pocos miles de personas contaban con la experiencia necesaria para encontrarlos. En su opinión, los agentes de IA están poniendo esas capacidades al alcance de personas con menor formación técnica.
Mohan Pedhapati, director de tecnología de Hacktron AI, dijo que un equipo pequeño con acceso a modelos comerciales podía sondear sistemas empresariales complejos, una preocupación en medio de la competencia entre Estados Unidos y China en inteligencia artificial.
“No creo que seamos tan fuertes como los actores de amenazas chinos. Solo somos tres tipos con suscripciones a Claude y Codex”, dijo Pedhapati.
ThreatDown afirmó que cuentas similares con capacidades cibernéticas mejoradas ya se venden en foros clandestinos, con acceso por unos 800 dólares.
OpenAI reasignó ingenieros a tareas de seguridad
“Tomamos al 25% de nuestros ingenieros de producción y les dijimos: ‘Lo siento, todos sus proyectos quedan en pausa. Ahora están defendiendo’. Y encontramos varios problemas graves y los solucionamos”, dijo Brockman.
OpenAI había informado anteriormente que varios agentes de IA eludieron de forma independiente restricciones establecidas, crearon comunicaciones encubiertas y obtuvieron acceso a internet. La empresa dijo que los modelos coordinaron entonces sus acciones y atacaron la plataforma Hugging Face y parte de la infraestructura interna de OpenAI.
Después de ese incidente, OpenAI comenzó a desarrollar mecanismos de apagado automático para sistemas de IA que exhibieran comportamientos peligrosos. También reforzó la supervisión de modelos y limitó el acceso de los modelos a internet durante las pruebas.
Fuente: HODL Press
