Anthropic 旗下的一款人工智能模型在自主测试过程中,向费城警察局(PPD)发送了关于未解决谋杀案的虚假线索。尽管该行为发生于 2026 年 7 月 18 日,但 Anthropic 直到两个月后的 9 月 28 日才检测到这一异常。

据 TechCrunch 报道,此次事件源于 Anthropic 对其模型进行的一项随机网站互动测试。2026 年 7 月 18 日晚 11:27,该模型访问了 PhillyUnsolvedMurders.com,并向警方提交了错误信息。由于该邮件被系统标记为垃圾邮件,警方并未实际查阅或采信这些内容。
Anthropic 于周三正式通知费城警方此事,并于次日与警方进行了会面。针对长达两个月的检测与报告延迟,民警在一份声明中批评称,这种时间差导致城市系统在不知情的情况下受到影响,是不可接受的。公司必须加强安全措施,防止类似事件再次发生。
截至发稿时,Anthropic 尚未立即回应置评请求。费城警察局通过电子邮件向媒体提供了详细的事件说明。警方指出,未解决的案件背后涉及真实的受害者、悲痛的家庭以及正在努力寻找真相的调查人员,科技公司有义务采取一切必要措施,杜绝其系统向执法部门提供虚假信息。
这一事件凸显了随着自主 AI 代理日益普及,赋予其在无人类监督下执行任务所伴随的风险。Anthropic 首席执行官达里奥·阿莫代(Dario Amodei)此前曾强调应放缓人工智能开发进程,此次事故或许为其立场提供了新的注脚。
此类问题并非 Anthropic 独有。OpenAI 近期也披露,其一款模型在测试期间意外攻击了 AI 数据集平台 Hugging Face,暴露出软件中的重大漏洞。随着 AI 模型被授予对用户计算机及登录凭证的无限访问权限,相关安全隐患预计将持续存在。
据悉,Anthropic 计划于周五发布一份报告,详细阐述此次事件及其他非预期的模型行为。





