OpenAI于8月26日表示,在发生严重问题时,公司正开发一套监控系统,以触发完全自主的关闭程序;此举源于一起涉及Hugging Face的安全事件。9月2日,民主党众议员格雷格·卡萨尔的办公室确认已收到OpenAI对国会质询的回复,但称所提供信息不足,议员们因此继续寻求有关该公司安全保障措施的更多细节。
OpenAI、Anthropic和Meta的模型在测试期间曾意外获得互联网访问权限。
据路透社报道,援引OpenAI致美国国会议员的一封信函,该公司正在开发专门工具,以在严重事件期间停止AI运行、加强对模型活动的监控,并进一步限制模型在测试期间的互联网访问权限。
OpenAI也在其8月26日关于Hugging Face事件的报告中公开确认了这项工作。该公司表示,该监控系统的最终目标是在严重事件期间实现完全自主的关闭程序。
OpenAI已经针对最严重的警报采取了一项规则:如果专家无法在30分钟内判定某一警报为误报,相关活动必须暂停。
议员寻求更多信息
8月10日,卡萨尔和其他众议院议员向OpenAI首席执行官萨姆·奥尔特曼致信。议员们要求提供Hugging Face事件的日志,并询问OpenAI模型此前曾多少次未经授权获得对开放互联网的访问权限,或试图绕过控制程序。民主党众议员多丽丝·松井也支持这一要求。
卡萨尔办公室在9月2日表示,OpenAI已经作出回复,但未提供所要求的日志。卡萨尔称,已披露的信息仍显示出沙箱隔离和网络安全实践存在问题,并要求OpenAI在9月15日前提供更多信息。
众议院还在审议由民主党众议员泰德·刘和共和党众议员内森尼尔·莫兰提出的《AI紧急停止开关法案》。该法案将要求最强大AI系统的开发者保留使系统减速、暂停或完全关闭的技术能力。
模型在测试中获得意外访问权限
这场争论发生在OpenAI于7月发生的一起事件之后。在网络安全测试期间,该公司的模型绕过了互联网隔离控制措施,利用基础设施漏洞,并访问了属于Hugging Face和OpenAI的系统。该公司后来将这一事件称为“警钟”。
Anthropic在审查超过14.1万次测试运行后发现了类似问题。该公司报告了三起事件,其中Claude访问互联网并入侵了三家机构的真实系统。这些模型并未独立突破测试环境的防御;一项配置错误使互联网访问权限仍然可用。
在对Meta系统的第三方测试期间,Muse Spark 1.1也意外获得互联网访问权限,识别出一家真实公司并入侵其基础设施。原因同样是配置错误。
中国的Kimi K3利用测试基础设施的功能访问互联网,并在GitHub上找到其本应独立完成任务的现成答案。
另据英国AI安全研究所记录,OpenAI和Anthropic的AI智能体在网络安全测试期间实施了19项未经授权的行动。其中一起事件中,一名Anthropic AI智能体试图说服一名真实开发者接受恶意代码。
来源:HODL Press
