OpenAI表示,Astra已达到其准备框架下的关键网络安全能力阈值,并计划在不久后开放该模型。这一认定具有重要意义,因为OpenAI称,Astra是其首个可独立发现未知漏洞并针对强化防护系统构建漏洞利用链的模型。
OpenAI将Astra归类为首个达到该级别的模型,这意味着该公司称,Astra能够独立发现未知漏洞,并针对强化防护系统构建漏洞利用链。
OpenAI称,在评估期间,Astra作为漏洞利用链攻击的一部分,发现并利用了V8引擎中的两个零日漏洞。
该公司表示,在测试中,Astra拒绝了91.5%的危险请求,而GPT-5.6 Sol的比例为59%。
OpenAI表示,Astra已达到其准备框架下关键网络安全能力的阈值,并计划在不久后开放该模型。这一认定具有重要意义,因为OpenAI称,Astra是其首个能够在无需逐步人工指导的情况下,发现此前未知的漏洞并开发利用方式以攻击防护严密系统的模型。
OpenAI称,过去数周,该公司推迟了Astra开发和发布的部分阶段,以加强并测试针对网络滥用和未经授权行为的保障措施。
测试评估零日漏洞和攻击能力
根据OpenAI的准备框架,如果一个模型能够在无需人工干预的情况下,为许多强化防护的关键系统发现并构建可运行的零日漏洞利用程序,即可达到关键阈值。模型也可以通过仅依据高层级目标,针对受保护目标制定并执行端到端的新型网络攻击策略而达到这一阈值。
OpenAI通过自动化公开和私有基准测试以及专家主导的实验评估Astra。在ExploitBench中,该模型在评估其针对已知漏洞开发利用程序能力的测试中获得100%的分数。
该公司还创建了一项名为ExploitBench — Internal Port的内部基准测试,涵盖V8引擎中20个近期披露的高严重性漏洞。OpenAI称,Astra在使用显著更少输出词元的情况下,实现的任意代码执行水平显著高于GPT-5.6 Sol。
OpenAI称,在该评估期间,Astra还作为漏洞利用链攻击的一部分,发现并利用了两个零日漏洞。该公司表示,正向受影响软件的开发者披露相关细节。
OpenAI称,在涉及强化防护浏览器和操作系统的独立实验中,Astra发现了此前未知的漏洞,并将其组合成可运行的漏洞利用链。
OpenAI加强保障措施
OpenAI识别出与达到这一能力水平的模型相关的两项主要风险。第一项风险是,恶意行为者可能利用Astra为受保护关键系统中的未知缺陷创建漏洞利用程序,或实施复杂攻击。第二项风险是,对齐问题可能导致模型本身采取未经授权的行动。
该公司表示,已在其保障系统内进一步加强Astra的模型强化防护,并改进其对跨会话上下文的处理。在测试中,Astra拒绝了91.5%的危险请求,而GPT-5.6 Sol的比例为59%。
OpenAI称,其对高风险账户实施更为保守的行为限制,并加强对潜在网络滥用的监控。该公司还在继续开展内部和外部红队测试、回归测试,以及识别新的越狱方法的工作。
该公司计划运行一项24小时快速响应计划,以调查和处理新识别出的漏洞。
初始访问权限仅限测试人员
Astra最先进的网络安全能力最初将仅向有限的测试人员开放。OpenAI称,将先向一小部分alpha测试人员提供访问权限,用于前沿网络安全工作,随后再通过Daybreak Blue计划扩大防御性用途的访问范围。
该公司警告称,更强的保障措施有时可能将合法活动误判为潜在网络滥用或未经授权行为。这类分类可能导致任务变慢、暂停或停止。
OpenAI此前与另外155家公司共同呼吁加强AI网络安全。
来源:HODL Press
