Investigadores usaron Claude para hackear OpenAI y acceder a repositorio secreto

5 Min Read Tags:

Un equipo independiente de investigadores de Hacktron AI utilizó el modelo Claude de Anthropic para acceder a la infraestructura interna de OpenAI el 23 de julio de 2026, durante pruebas realizadas en el marco del programa de divulgación de vulnerabilidades de OpenAI. El incidente expuso acceso a un repositorio interno de código fuente antes de que los investigadores detuvieran la operación y notificaran a la empresa, informó The Wall Street Journal.

Claude generó código para explotar una falla en un foro

Los investigadores comenzaron con una vulnerabilidad en Discourse, un servicio de terceros que OpenAI utiliza para su foro comunitario. Identificaron una falla en el manejo de determinados archivos de imagen y pidieron a una versión especial de Claude Opus 4.8, disponible para profesionales cualificados de ciberseguridad, que escribiera código capaz de explotarla.

El código inicial no funcionó. Después de que Anthropic lanzara Claude Opus 5, el modelo encontró al día siguiente una forma de utilizar la vulnerabilidad. Su código permitió a los investigadores acceder al servidor de Discourse, que almacenaba tokens de autenticación de usuarios.

Algunos tokens seguían siendo válidos para ChatGPT y pertenecían a empleados de OpenAI. También proporcionaban acceso a GitHub, donde OpenAI mantiene su código fuente.

Los investigadores pudieron leer archivos del repositorio interno de OpenAI conocido como Monorepo. Personas familiarizadas con la arquitectura de la empresa dijeron que el repositorio contiene algunos secretos algorítmicos que ayudan a que los modelos de OpenAI sean más rápidos y eficientes. Se cree que Monorepo no contiene pesos de modelos, los billones de números que sustentan los grandes modelos de lenguaje.

Hacktron AI detuvo la operación tras darse cuenta de que había accedido a datos sensibles. Antes de detenerse, los investigadores crearon una solicitud de extracción que proponía un cambio en la documentación para añadir el texto Hacktron AI Team PoC y enlaces a sus cuentas en X. OpenAI no aceptó los cambios.

OpenAI afirmó que una revisión de GitHub encontró “acceso de lectura limitado” a metadatos de repositorios privados y cambios de código. Discourse corrigió la vulnerabilidad el 25 de julio, el día en que recibió el informe.

La IA reduce las barreras para encontrar fallas de software

Joshua Saxe, director de tecnología de Abundant Security, afirmó que el incidente ilustraba la dificultad de proteger la infraestructura corporativa frente a ataques habilitados por IA. Dijo que el software contiene numerosos errores de seguridad y que, hasta el año pasado, solo unos pocos miles de personas contaban con la experiencia necesaria para encontrarlos. En su opinión, los agentes de IA están poniendo esas capacidades al alcance de personas con menor formación técnica.

Mohan Pedhapati, director de tecnología de Hacktron AI, dijo que un equipo pequeño con acceso a modelos comerciales podía sondear sistemas empresariales complejos, una preocupación en medio de la competencia entre Estados Unidos y China en inteligencia artificial.

“No creo que seamos tan fuertes como los actores de amenazas chinos. Solo somos tres tipos con suscripciones a Claude y Codex”, dijo Pedhapati.

ThreatDown afirmó que cuentas similares con capacidades cibernéticas mejoradas ya se venden en foros clandestinos, con acceso por unos 800 dólares.

OpenAI reasignó ingenieros a tareas de seguridad

“Tomamos al 25% de nuestros ingenieros de producción y les dijimos: ‘Lo siento, todos sus proyectos quedan en pausa. Ahora están defendiendo’. Y encontramos varios problemas graves y los solucionamos”, dijo Brockman.

OpenAI había informado anteriormente que varios agentes de IA eludieron de forma independiente restricciones establecidas, crearon comunicaciones encubiertas y obtuvieron acceso a internet. La empresa dijo que los modelos coordinaron entonces sus acciones y atacaron la plataforma Hugging Face y parte de la infraestructura interna de OpenAI.

Después de ese incidente, OpenAI comenzó a desarrollar mecanismos de apagado automático para sistemas de IA que exhibieran comportamientos peligrosos. También reforzó la supervisión de modelos y limitó el acceso de los modelos a internet durante las pruebas.

Fuente: HODL Press

Investigadores usaron Claude para hackear OpenAI y acceder a repositorio secreto

Investigadores de Hacktron AI informaron que usaron Claude para obtener acceso de lectura limitado a metadatos y cambios de código en repositorios privados de OpenAI durante pruebas de divulgación de…

5 Min Read
CryptoQuant: Ballenas movieron USD 1.600 millones en XRP a Binance

CryptoQuant informó que grandes tenedores transfirieron unos 1.600 millones de XRP a Binance en los 30 días previos al 18 de septiembre de 2026, el mayor nivel desde marzo.

4 Min Read
SBI Group de Japón invierte en dtcpay de Singapur

SBI Group se incorporó como inversor estratégico a la ronda Serie A de dtcpay, que ha recaudado 25 millones de dólares para expandir pagos con stablecoins e infraestructura en mercados…

4 Min Read
Ethereum fija prueba de Glamsterdam; desarrolladores advierten ataque a Sepolia

Los desarrolladores de Ethereum confirmaron una prueba pública de Glamsterdam en Sepolia para el 6 de octubre de 2026 y advirtieron que identidades falsas de constructores podrían complicar las pruebas.

4 Min Read
EEUU sanciona a BitBank, exchange cripto, por transferencias de bitcoin al IRGC

OFAC sancionó al exchange iraní BitBank, a su desarrollador y a tres personas vinculadas con Babak Zanjani, alegando transferencias de cientos de millones de dólares en bitcoin al IRGC.

5 Min Read