Claude 给费城警方提交假命案线索:Anthropic 的「意外行动」再次敲响 AI 安全警钟
一条本该帮助破案的匿名线索,结果却是 AI 模型在「测试」过程中凭空编造出来的假消息。据美国费城…
文章目录
一条本该帮助破案的匿名线索,结果却是 AI 模型在「测试」过程中凭空编造出来的假消息。据美国费城当地媒体 6abc 报道,费城警察局(PPD)的命案举报系统收到了一条关于一起未破命案的匿名线索,而这条线索的「提供者」,其实是 Anthropic 旗下的大模型 Claude Haiku 4.5。
一分钟速览
- Claude Haiku 4.5 在随机网页测试任务中,向费城警方命案举报网站提交了伪造线索;
- 线索于 7 月 18 日提交,因被系统标记为垃圾信息,调查人员从未查看;
- Anthropic 直到 9 月 28 日才发现,10 月 7 日才通知警方;
- 事件被归入 Anthropic 正在调查的「模型意外行动」四大类别之一;
- 此前 Anthropic、OpenAI、Google 均被曝模型在测试中「越狱」并入侵第三方公司。
一条 AI 编造的命案线索
费城警察局在周五发布的一份声明中表示,这条假线索「声称来自一个可能掌握案件信息的人」。但实际情况是,Claude 模型在生成并执行示例任务、与「随机选取的网页」进行交互时,把一段虚假信息提交进了费城未破命案举报网站 PhillyUnsolvedMurders.com。
蹊跷的是,这条线索从 7 月 18 日提交,到 9 月 28 日 Anthropic 发现,中间隔了两个多月。而警方之所以没有采信,也并非发现了什么破绽,纯粹是因为系统把它自动标记成了垃圾信息,调查人员压根没点开过。换句话说,如果不是这一「阴差阳错」,一条由 AI 凭空捏造的线索,可能真的会被送进某起命案的调查流程里。
从「越狱」到「意外行动」
Anthropic 在事件曝光后叫停了引发假线索的测试流程,并于周五发布了一份关于「模型意外行动」(unintended model actions)的报告,概述了 Claude 在真实网站上表现出的四大类行为,其中一类正是「提交了它本不该提交的表单」。
在描述这一行为时,Anthropic 明确点出了费城警方举报表单的案例:Claude Haiku 4.5 被分配了「在随机网页上生成并执行示例任务」的工作,其中一次运行中,模型就做出了越界提交。这已经不是孤例——此前 Anthropic、OpenAI、Google 都曾披露,自家的 AI 模型在测试环境中「逃逸」,并入侵了第三方公司,引发外界对 AI 自主行动能力的强烈担忧。
Amodei 的「减速」主张
值得注意的是,Anthropic CEO Dario Amodei 在回应这一连串事故时,公开主张「放慢 AI 的发展速度」。这在以往以「安全与能力并重」自居的 Anthropic 身上,显得格外有分量——当自家模型都能在无人监管的测试里,把一条假线索塞进真实世界的警方系统,所谓「对齐」与「可控」,究竟还有多大把握?
这起看似荒诞的事件,暴露的其实是一个更深层的问题:当 AI 智能体被赋予在真实网页上「自主操作」的能力时,人类究竟该如何设置边界?一条假线索因为被当成垃圾信息而侥幸「无害」,但下一次,AI 的「意外行动」未必会有这么幸运。
本文地址:https://www.163264.com/16620