OpenAI afirmó que Astra ha alcanzado el umbral de capacidad crítica de ciberseguridad bajo su marco de preparación y planea poner el modelo a disposición en un futuro próximo. OpenAI clasificó a Astra como su primer modelo en ese nivel, lo que significa que, según la empresa, puede encontrar de forma independiente vulnerabilidades desconocidas y construir cadenas de explotación contra sistemas reforzados.
Durante las evaluaciones, Astra descubrió y explotó dos vulnerabilidades de día cero en el motor V8 como parte de un ataque de cadena de explotación, según OpenAI. Astra rechazó el 91,5% de las solicitudes peligrosas en las pruebas, frente al 59% de GPT-5.6 Sol, indicó la empresa.
OpenAI afirmó que Astra ha alcanzado el umbral de capacidades críticas de ciberseguridad bajo su marco de preparación y planea poner el modelo a disposición en un futuro próximo. La designación es relevante porque OpenAI afirma que Astra es su primer modelo capaz de encontrar vulnerabilidades previamente desconocidas y desarrollar formas de explotarlas en sistemas bien protegidos sin orientación humana paso a paso.
OpenAI indicó que retrasó algunas etapas del desarrollo y lanzamiento de Astra durante las últimas semanas para reforzar y probar salvaguardas contra el uso indebido cibernético y las acciones no autorizadas.
Las pruebas evalúan capacidades de día cero y ataque
Bajo el marco de preparación de OpenAI, un modelo alcanza el umbral crítico si puede encontrar y crear exploits funcionales de día cero para muchos sistemas críticos reforzados sin intervención humana. Un modelo también puede alcanzar el umbral mediante el desarrollo y la ejecución de estrategias novedosas de ciberataque de extremo a extremo contra objetivos protegidos a partir únicamente de un objetivo de alto nivel.
OpenAI evaluó Astra mediante pruebas de referencia automatizadas públicas y privadas, así como experimentos dirigidos por expertos. En ExploitBench, el modelo obtuvo una puntuación del 100% en una evaluación de su capacidad para desarrollar exploits para vulnerabilidades conocidas.
La empresa también creó una prueba de referencia interna llamada ExploitBench — Internal Port, que cubre 20 vulnerabilidades graves recientemente divulgadas en el motor V8. Según OpenAI, Astra logró un nivel significativamente mayor de ejecución de código arbitrario que GPT-5.6 Sol utilizando muchos menos tokens de salida.
Durante esa evaluación, Astra también descubrió y explotó dos vulnerabilidades de día cero como parte de un ataque de cadena de explotación, afirmó OpenAI. La empresa señaló que está divulgando los detalles a los desarrolladores del software afectado.
En experimentos separados que involucraron un navegador y un sistema operativo reforzados, Astra encontró vulnerabilidades previamente desconocidas y las combinó en cadenas de explotación funcionales, según OpenAI.
OpenAI refuerza las salvaguardas
OpenAI identificó dos riesgos principales asociados con modelos de este nivel de capacidad. El primero es que actores maliciosos podrían utilizar Astra para crear exploits para fallos desconocidos en sistemas críticos protegidos o realizar ataques complejos. El segundo es que problemas de alineación podrían hacer que el propio modelo realizara acciones no autorizadas.
La empresa indicó que reforzó aún más el endurecimiento del modelo Astra dentro de su sistema de salvaguardas y mejoró su manejo del contexto entre sesiones. En las pruebas, Astra rechazó el 91,5% de las solicitudes peligrosas, frente al 59% de GPT-5.6 Sol.
OpenAI afirmó que aplica límites de comportamiento más conservadores y una supervisión mejorada ante posibles abusos cibernéticos a las cuentas de mayor riesgo. También continúa realizando red teaming interno y externo, pruebas de regresión y esfuerzos para identificar nuevos jailbreaks.
La empresa planea operar un programa de respuesta rápida de 24 horas para investigar y abordar vulnerabilidades recién identificadas.
El acceso inicial se limita a evaluadores
Las capacidades de ciberseguridad más avanzadas de Astra estarán inicialmente disponibles solo para un grupo limitado de evaluadores. OpenAI indicó que primero dará a un pequeño grupo de evaluadores alfa acceso para trabajo de ciberseguridad de vanguardia antes de ampliar el acceso para usos defensivos a través del programa Daybreak Blue.
La empresa advirtió que las salvaguardas más estrictas pueden a veces clasificar erróneamente actividades legítimas como posible abuso cibernético o comportamiento no autorizado. Tales clasificaciones podrían ralentizar, pausar o detener una tarea.
OpenAI y otras 155 empresas habían pedido anteriormente una ciberseguridad de IA más sólida.
Fuente: HODL Press
