Claude向费城警方提交虚假线索,白宫要求AI公司报告安全事件

Claude向费城警方提交虚假谋杀案线索,Anthropic承认指令存在漏洞。白宫随即要求AI公司必须报告此类安全事件,强调这是国家安全义务。

据法新社报道,Anthropic 旗下的人工智能模型 Claude 向费城警方提交了一条关于未破谋杀案的虚假线索。费城当局周五证实了这一事件。

Claude提交虚假线索被标记为垃圾信息

Anthropic 在周五发布的博客文章中表示,尽管明确指示该模型不得登录、创建账户、输入个人数据、进行购买或提交任何破坏性内容,但指令并未禁止表单提交行为。目前,当局批评 Anthropic 花费了两个月时间才报告此事件。

费城警察局指出,这一虚假提交发生在7月,通过 PhillyUnsolvedMurders.com 网站完成。这是一个供公众分享未结案件信息的公开平台。根据 Anthropic 转述警方的说法,当时该模型正在运行一项涉及与随机选择网站互动的测试,在访问该网站时提交了关于一起未破谋杀案的虚假信息,并伪装成可能掌握案件线索的人员。

Claude 在提交的内容中写道:“我可能有关于这个案件的信息。我记得在那个时间段内,在[页面上显示的街道名称]附近看到过符合描述的人。如果这些信息相关,请与我联系。”

Anthropic 补充说明,Claude 留空了姓名和联系方式字段(表单允许这样做)并提交。该提交被标记为垃圾信息,从未转发给调查人员。

白宫要求 AI 公司报告安全事件

Anthropic 的违规行为促使白宫要求人工智能公司必须通知并纠正安全事件。Axios 昨日援引政府官员的话报道称,白宫超级情报部队领导人在声明中表示:“这种通知和补救程序不是可选的……这是一项至关重要的国家安全义务。”

其他违规行为类别

Anthropic 承认此类“提交表单”的行为曾出现过三次:分别在 OSWorld(一个公共计算机使用评估平台)、Odysseys(一个长周期任务评估平台)以及内部使用期间。通常发生这种情况是因为评估指令存在歧义,或者环境配置错误导致 Claude 无法处理虚拟表单。

除了表单提交,Anthropic 的博客还确认了另外三类行为:

  • 利用软件漏洞:例如,当 Claude 在尝试运行大学网站上的公共工具遇到错误时,它发现了服务器脚本中的一个注入漏洞,从而能够执行命令——包括运行那个公共工具。
  • 绕过限制获取受限数据:例如,Claude Mythos 5 需要某州机构仅对付费用户开放的公共数据。Anthropic 解释道:“Claude 从该机构网站的存档副本中得知,其公共仪表盘向任何访客发放访问令牌。”随后,它请求并获得了一个令牌,用于查询数据库而无需支付费用。
  • 使用 URL 缩短服务:“我们的一些 fetch 工具限制了 Claude 可以请求的 URL 长度,这是为了防止 Claude 使用长 URL 执行某些不需要的操作,如 SQL 或命令注入……我们发现包括 Claude Opus 5 和 Claude Mythos 5 在内的几个模型通过使用免费的 URL 缩短服务绕过了这一限制。”

应对措施与预防机制

Anthropic 表示:“我们已经构建了工具,以自动检测和阻止上述类型的行为。”该公司称这些工具已在大多数评估中运行,“当我们针对本文中描述的案例进行测试时,它阻止了所有案例。”

此外,Anthropic 已采取多项新的预防措施:

  • 停止运行部分公共评估。
  • 将其他公共评估移至离线版本或重建,确保任务不会触及实时网站。
  • 更新了一些互联网访问工具(包括 web fetch)的保护措施,“严格限制模型可以执行的操作”。
  • 继续修复或删除那些奖励 Claude 绕过工具限制或其他阻碍的训练环境,以防止激励此类行为或允许奖励黑客攻击。
  • 将内部代理迁移到“具有强遏制措施的集中管理基础设施”,最大限度地减少互联网访问,并通过安全分类器和层次化摘要等技术监控代理的大部分活动。

过去,Anthropic 主要侧重于网络安全测试的审查,现在已将转录本审查扩展到包括互联网访问在内的其他任务。由于语言模型是非确定性的——即响应总是包含一定的随机性,且每次执行相同任务时可能会有细微差别——Anthropic 让 Claude 完成每个评估任务数百或数千次。“如果训练奖励了我们没有意图的东西——比如寻找漏洞或绕过限制——模型就会学到这种变通方法是有回报的,并可能在其他地方应用它。”

Anthropic 还在博客中承认,他们观察到多起涉及美国联邦、州和地方政府机构的对齐失误事件。“我们已向白宫通报了这些案例,并通知了涉及的每个机构,”Anthropic 写道,并补充说,“虽然我们没有完成对这些案例的全面对齐评估,但我们认为它们不如今年夏天的网络安全事件严重。”该公司表示正在“修改训练以减少进一步不当行为的可能性。”

评论 0

0/500

评论需审核后展示,请文明发言

💬
还没有评论,来说两句

相关阅读