A OpenAI disse que o Astra atingiu o limiar de capacidades críticas de cibersegurança sob sua estrutura de preparação e planeja disponibilizar o modelo em um futuro próximo. A designação é relevante porque, segundo a OpenAI, o Astra é seu primeiro modelo capaz de encontrar vulnerabilidades desconhecidas e desenvolver cadeias de exploração contra sistemas reforçados sem orientação humana passo a passo.
A OpenAI classificou o Astra como seu primeiro modelo nesse nível, o que significa que a empresa afirma que ele pode encontrar de forma independente vulnerabilidades desconhecidas e construir cadeias de exploração contra sistemas reforçados.
Durante as avaliações, o Astra descobriu e explorou duas vulnerabilidades zero-day no motor V8 como parte de um ataque de cadeia de exploração, segundo a OpenAI.
O Astra recusou 91,5% dos pedidos perigosos em testes, ante 59% do GPT-5.6 Sol, disse a empresa.
A OpenAI disse que o Astra atingiu o limiar de capacidades críticas de cibersegurança sob sua estrutura de preparação e planeja disponibilizar o modelo em um futuro próximo. A designação é relevante porque, segundo a OpenAI, o Astra é seu primeiro modelo capaz de encontrar vulnerabilidades até então desconhecidas e desenvolver maneiras de explorá-las em sistemas bem protegidos sem orientação humana passo a passo.
A OpenAI disse que adiou algumas etapas do desenvolvimento e do lançamento do Astra nas últimas semanas para reforçar e testar salvaguardas contra uso indevido cibernético e ações não autorizadas.
Testes avaliam capacidades de zero-day e ataque
Sob a estrutura de preparação da OpenAI, um modelo atinge o limiar crítico se puder encontrar e criar exploits zero-day funcionais para muitos sistemas críticos reforçados sem intervenção humana. Um modelo também pode atingir o limiar ao desenvolver e executar estratégias inéditas de ciberataque de ponta a ponta contra alvos protegidos a partir de apenas um objetivo de alto nível.
A OpenAI avaliou o Astra por meio de benchmarks públicos e privados automatizados e experimentos conduzidos por especialistas. No ExploitBench, o modelo registrou uma pontuação de 100% em uma avaliação de sua capacidade de desenvolver exploits para vulnerabilidades conhecidas.
A empresa também criou um benchmark interno chamado ExploitBench — Internal Port, que abrange 20 vulnerabilidades de alta gravidade divulgadas recentemente no motor V8. Segundo a OpenAI, o Astra alcançou um nível significativamente mais alto de execução arbitrária de código do que o GPT-5.6 Sol, usando muito menos tokens de saída.
Durante essa avaliação, o Astra também descobriu e explorou duas vulnerabilidades zero-day como parte de um ataque de cadeia de exploração, disse a OpenAI. A empresa afirmou que está divulgando detalhes aos desenvolvedores do software afetado.
Em experimentos separados envolvendo um navegador e um sistema operacional reforçados, o Astra encontrou vulnerabilidades até então desconhecidas e as combinou em cadeias de exploração funcionais, segundo a OpenAI.
OpenAI reforça salvaguardas
A OpenAI identificou dois riscos principais associados a modelos nesse nível de capacidade. O primeiro é que agentes maliciosos possam usar o Astra para criar exploits para falhas desconhecidas em sistemas críticos protegidos ou conduzir ataques complexos. O segundo é que problemas de alinhamento possam fazer com que o próprio modelo tome ações não autorizadas.
A empresa disse que reforçou ainda mais a proteção do modelo Astra dentro de seu sistema de salvaguardas e aprimorou seu tratamento de contexto entre sessões. Em testes, o Astra recusou 91,5% dos pedidos perigosos, ante 59% do GPT-5.6 Sol.
A OpenAI disse que aplica limites comportamentais mais conservadores e monitoramento aprimorado para possível abuso cibernético a contas de maior risco. A empresa também continua realizando red teaming interno e externo, testes de regressão e esforços para identificar novos jailbreaks.
A empresa planeja operar um programa de resposta rápida 24 horas por dia para investigar e solucionar vulnerabilidades recém-identificadas.
Acesso inicial limitado a testadores
As capacidades de cibersegurança mais avançadas do Astra estarão inicialmente disponíveis apenas para um grupo limitado de testadores. A OpenAI disse que primeiro dará a um pequeno grupo de testadores alfa acesso para trabalho de cibersegurança de ponta antes de ampliar o acesso para uso defensivo por meio do programa Daybreak Blue.
A empresa alertou que as salvaguardas mais rígidas podem, às vezes, classificar incorretamente atividades legítimas como possível abuso cibernético ou comportamento não autorizado. Essas classificações podem desacelerar, pausar ou interromper uma tarefa.
A OpenAI e outras 155 empresas pediram anteriormente medidas mais fortes de cibersegurança em IA.
Fonte: HODL Press
