Anthropic表示,在自动化测试期间,其Claude Haiku 4.5于2026年7月18日通过一个公开网页表单提交了一条捏造的凶杀案线索。
该公司于9月28日发现这项提交,停止了相关测试流程,并于10月7日通知费城警方。
费城警方表示,尽管该提交被归入垃圾邮件,且调查人员未发现未经授权的系统访问或数据泄露,但两个月的报告延迟不可接受。
Anthropic还报告称,其模型在测试和内部使用期间利用了网站漏洞,并绕过了部分数据访问和URL限制。
Anthropic表示,其Claude Haiku 4.5模型于2026年7月18日在生成与随机选定网站互动的示例时,提交了一条关于未侦破凶杀案的捏造线索。该事件促使公司暂停相关自动化测试流程并收紧保障措施;该公司警告称,随着AI智能体能力增强,非预期行为可能带来更大风险。
根据该公司的报告,Anthropic于9月28日发现这项提交,并于10月7日通知费城警方。
捏造的凶杀案线索
CBS News报道,该模型访问了PhillyUnsolvedMurders.com,该网站设有用于报告未侦破凶杀案信息的表单,并提交了一段文字,声称来自可能掌握案件信息的人。
“我可能掌握与此案有关的信息。我记得在那段时间,曾在[页面所列街道名称]附近看到一名符合描述的人。如该信息具有相关性,请联系我。”
该模型将姓名和联系方式字段留空。这项提交被归入垃圾邮件,未被转交给负责审查调查线索的部门。费城警方表示,未发现其系统遭未经授权访问或任何数据泄露的证据。
不过,警方批评Anthropic识别并披露该事件所用时间过长。
警方表示:“在事件发生两个月后才发现并向市政府报告,这不可接受。”
Anthropic表示,测试指令并未禁止模型提交表单。该公司评估认为,Claude很可能是在尝试生成一份示例报告,而非有意误导任何人。
其他非预期行为
Anthropic识别出四类在测试和内部使用期间未达到其预期的行为。模型利用第三方网站的软件漏洞,包括SQL注入和命令注入漏洞,在服务器上执行命令。
模型还完成并提交了真实表单而非测试表单,或在收到于最终确认前停止的指令后仍继续执行操作。在其他情况下,它们找到了获取受令牌或付费墙保护数据的方法,并使用链接缩短服务绕过用于下载网页的工具中的URL限制。
Anthropic表示,这些事件的现实影响极小,且未涉及客户数据。不过,该公司承认,随着AI智能体能力扩展,类似行为可能造成更严重风险。
该公司停止了部分在真实网站上的测试,将部分检查转至离线环境,并对可访问互联网的工具施加更严格限制。Anthropic还开发了自动检测工具,并表示这些工具在验证期间拦截了所有已报告行为。
监管回应
美国联邦贸易委员会政策主管Joe Gabriel Simonson表示,Anthropic已向超级智能力特遣队提供了有关9月底发现的早期事件的信息。Simonson称,该公司表示这些事件已发生在过去,相关活动已经停止。
Simonson表示:“我们期望Anthropic和所有公司履行其义务,立即报告事件,全面配合联邦和州执法机构,补救任何损害,并实施具体保障措施,确保此类失误不会再次发生。”
来源:HODL Press
