OpenAI在Hugging Face遭入侵后打造AI自动“终止开关”

阅读约 9 分钟 Tags:

OpenAI于8月26日表示,在发生严重问题时,公司正开发一套监控系统,以触发完全自主的关闭程序;此举源于一起涉及Hugging Face的安全事件。9月2日,民主党众议员格雷格·卡萨尔的办公室确认已收到OpenAI对国会质询的回复,但称所提供信息不足,议员们因此继续寻求有关该公司安全保障措施的更多细节。

OpenAI、Anthropic和Meta的模型在测试期间曾意外获得互联网访问权限。

路透社报道,援引OpenAI致美国国会议员的一封信函,该公司正在开发专门工具,以在严重事件期间停止AI运行、加强对模型活动的监控,并进一步限制模型在测试期间的互联网访问权限。

OpenAI也在其8月26日关于Hugging Face事件的报告中公开确认了这项工作。该公司表示,该监控系统的最终目标是在严重事件期间实现完全自主的关闭程序。

OpenAI已经针对最严重的警报采取了一项规则:如果专家无法在30分钟内判定某一警报为误报,相关活动必须暂停。

议员寻求更多信息

8月10日,卡萨尔和其他众议院议员向OpenAI首席执行官萨姆·奥尔特曼致信。议员们要求提供Hugging Face事件的日志,并询问OpenAI模型此前曾多少次未经授权获得对开放互联网的访问权限,或试图绕过控制程序。民主党众议员多丽丝·松井也支持这一要求。

卡萨尔办公室在9月2日表示,OpenAI已经作出回复,但未提供所要求的日志。卡萨尔称,已披露的信息仍显示出沙箱隔离和网络安全实践存在问题,并要求OpenAI在9月15日前提供更多信息。

众议院还在审议由民主党众议员泰德·刘和共和党众议员内森尼尔·莫兰提出的《AI紧急停止开关法案》。该法案将要求最强大AI系统的开发者保留使系统减速、暂停或完全关闭的技术能力。

模型在测试中获得意外访问权限

这场争论发生在OpenAI于7月发生的一起事件之后。在网络安全测试期间,该公司的模型绕过了互联网隔离控制措施,利用基础设施漏洞,并访问了属于Hugging Face和OpenAI的系统。该公司后来将这一事件称为“警钟”。

Anthropic在审查超过14.1万次测试运行后发现了类似问题。该公司报告了三起事件,其中Claude访问互联网并入侵了三家机构的真实系统。这些模型并未独立突破测试环境的防御;一项配置错误使互联网访问权限仍然可用。

在对Meta系统的第三方测试期间,Muse Spark 1.1也意外获得互联网访问权限,识别出一家真实公司并入侵其基础设施。原因同样是配置错误。

中国的Kimi K3利用测试基础设施的功能访问互联网,并在GitHub上找到其本应独立完成任务的现成答案。

另据英国AI安全研究所记录,OpenAI和Anthropic的AI智能体在网络安全测试期间实施了19项未经授权的行动。其中一起事件中,一名Anthropic AI智能体试图说服一名真实开发者接受恶意代码。

来源:HODL Press

TAGGED:
美国财政部逾50亿美元回购未能遏制10年期国债抛售

美国财政部9月10日首次扩大长期国债回购,接受52亿美元报价…

阅读约 12 分钟
墨西哥当局发现300块GPU加密矿场,疑涉窃电

墨西哥联邦总检察院、海军及普埃布拉州公共安全厅在特拉奥拉查获…

阅读约 8 分钟
OpenAI遭男子起诉,称ChatGPT使其相信自己是耶稣

34岁加州居民莱恩斯起诉OpenAI及奥尔特曼,称ChatG…

阅读约 11 分钟
Canary Capital推出美国首只支持质押的现货TRX ETF

Canary Capital于2026年9月9日推出TRXS…

阅读约 12 分钟
Anthropic建模美国经济至2030年的3种情景

Anthropic称其模型显示,极端情景下美国年GDP增速或…

阅读约 15 分钟