Anthropic 近日更新了其人工智能聊天机器人 Claude 的使用政策,明确禁止用户对模型实施“持续且不必要的虐待或残酷行为”。该新规将于 11 月 12 日正式生效,旨在保护 AI 系统免受恶意干扰。

官方强调,此次政策调整仅针对极端情况,即用户在无明显目的的情况下反复对模型施加残酷行为。常见的用户表达不满、拒绝回应、涉及黑暗创意主题的内容,以及用于模型测试和研究的行为均不在限制范围内。这意味着用户依然可以对 Claude 提出批评或指出其错误,目前 Anthropic 尚未公开说明如何具体区分合法的负面反馈与无端的虐待行为。
这一举措是 Anthropic 此前开展“模型福利”研究的延续。早在 2025 年 8 月,该公司便为部分版本的 Claude 引入了终止对话的功能,允许系统在检测到用户持续虐待模型时切断连接。尽管 Claude 本质上是软件而非人类实体,但 Anthropic 仍建议付费客户在与聊天机器人交互时保持礼貌。
除了规范用户行为,Anthropic 还同步推进了更广泛的安全改革,重点打击欺骗性影响力活动。在观察到国有媒体、政府宣传机构及商业组织利用 Claude 运营虚假账户和伪造新闻网站后,公司加强了对相关行为的限制。同时,Anthropic 放弃了对个性化政治定位的全面禁令,但仍严格禁止欺骗性定位及个人信息的滥用。
在武器与安全领域,Claude 的使用禁令已扩展至软件和组件层面。鉴于出现利用 Claude 开发武器指导与控制系统的尝试,公司明确禁止将 Claude 用于推断警察应调查、逮捕或起诉的对象,亦禁止开发监视工具。此外,未经同意追踪个人(无论是实时还是追溯)也被列为禁止事项。Anthropic 表示,这些条款旨在澄清现有限制,而非引入全新的约束。
针对将 Claude 连接至物理设备的场景,Anthropic 提出了新的安全要求:必须配备合格的人类操作员以监控和停止硬件运行;若 AI 连接中断,硬件需自动进入安全状态。此举意在应对日益强大的 AI 系统所带来的潜在安全风险。
与此同时,Anthropic 启动了一项新的网络安全倡议,旨在协助关键基础设施运营商和开源项目利用 AI 模型发现并修复漏洞。该计划包括为符合条件的开源项目提供免费安全扫描服务,并与安全公司合作以增强关键基础设施的保护能力。Anthropic 评估认为,在未来两年内,网络攻击者可能获得技术优势。





