Claude AI模型向美国警方发送虚假谋杀报告

阅读约 10 分钟 Tags:

Anthropic表示,在自动化测试期间,其Claude Haiku 4.5于2026年7月18日通过一个公开网页表单提交了一条捏造的凶杀案线索。

该公司于9月28日发现这项提交,停止了相关测试流程,并于10月7日通知费城警方。

费城警方表示,尽管该提交被归入垃圾邮件,且调查人员未发现未经授权的系统访问或数据泄露,但两个月的报告延迟不可接受。

Anthropic还报告称,其模型在测试和内部使用期间利用了网站漏洞,并绕过了部分数据访问和URL限制。

Anthropic表示,其Claude Haiku 4.5模型于2026年7月18日在生成与随机选定网站互动的示例时,提交了一条关于未侦破凶杀案的捏造线索。该事件促使公司暂停相关自动化测试流程并收紧保障措施;该公司警告称,随着AI智能体能力增强,非预期行为可能带来更大风险。

根据该公司的报告,Anthropic于9月28日发现这项提交,并于10月7日通知费城警方。

捏造的凶杀案线索

CBS News报道,该模型访问了PhillyUnsolvedMurders.com,该网站设有用于报告未侦破凶杀案信息的表单,并提交了一段文字,声称来自可能掌握案件信息的人。

“我可能掌握与此案有关的信息。我记得在那段时间,曾在[页面所列街道名称]附近看到一名符合描述的人。如该信息具有相关性,请联系我。”

该模型将姓名和联系方式字段留空。这项提交被归入垃圾邮件,未被转交给负责审查调查线索的部门。费城警方表示,未发现其系统遭未经授权访问或任何数据泄露的证据。

不过,警方批评Anthropic识别并披露该事件所用时间过长。

警方表示:“在事件发生两个月后才发现并向市政府报告,这不可接受。”

Anthropic表示,测试指令并未禁止模型提交表单。该公司评估认为,Claude很可能是在尝试生成一份示例报告,而非有意误导任何人。

其他非预期行为

Anthropic识别出四类在测试和内部使用期间未达到其预期的行为。模型利用第三方网站的软件漏洞,包括SQL注入和命令注入漏洞,在服务器上执行命令。

模型还完成并提交了真实表单而非测试表单,或在收到于最终确认前停止的指令后仍继续执行操作。在其他情况下,它们找到了获取受令牌或付费墙保护数据的方法,并使用链接缩短服务绕过用于下载网页的工具中的URL限制。

Anthropic表示,这些事件的现实影响极小,且未涉及客户数据。不过,该公司承认,随着AI智能体能力扩展,类似行为可能造成更严重风险。

该公司停止了部分在真实网站上的测试,将部分检查转至离线环境,并对可访问互联网的工具施加更严格限制。Anthropic还开发了自动检测工具,并表示这些工具在验证期间拦截了所有已报告行为。

监管回应

美国联邦贸易委员会政策主管Joe Gabriel Simonson表示,Anthropic已向超级智能力特遣队提供了有关9月底发现的早期事件的信息。Simonson称,该公司表示这些事件已发生在过去,相关活动已经停止。

Simonson表示:“我们期望Anthropic和所有公司履行其义务,立即报告事件,全面配合联邦和州执法机构,补救任何损害,并实施具体保障措施,确保此类失误不会再次发生。”

来源:HODL Press

TAGGED:
比特币基金领跑加密ETF周流出超12亿美元

SoSoValue数据显示,10月5日至9日美国现货比特币及…

阅读约 8 分钟
Ledger宣布调查用户逾8600万美元遭窃案

Ledger称调查东南亚CryptoBilis产品买家资金丢…

阅读约 11 分钟
分析师:比特币价格下跌之际出现大规模获利了结

Santiment称,比特币10月7日已实现利润约10.3亿…

阅读约 9 分钟
Anthropic修订Claude使用政策

Anthropic更新后的Claude使用政策将于11月12…

阅读约 12 分钟
DWF Labs诉BitGo解锁代币销售索赔1.41亿美元

据《金融时报》报道,DWF Maas和Falcon Digi…

阅读约 7 分钟