Anthropic更新Claude政策禁止虐待AI

Anthropic更新Claude政策,禁止虐待AI。新规11月生效,仅针对极端无端行为,正常批评不受限。同时扩大武器、监控及欺骗性活动禁令,并要求连接物理设备时配备人类操作员。

Anthropic 近日更新了其人工智能聊天机器人 Claude 的使用政策,明确禁止用户对模型实施“持续且不必要的虐待或残酷行为”。该新规将于 11 月 12 日正式生效,旨在保护 AI 系统免受恶意干扰。

新规要求人类监控硬件运行

官方强调,此次政策调整仅针对极端情况,即用户在无明显目的的情况下反复对模型施加残酷行为。常见的用户表达不满、拒绝回应、涉及黑暗创意主题的内容,以及用于模型测试和研究的行为均不在限制范围内。这意味着用户依然可以对 Claude 提出批评或指出其错误,目前 Anthropic 尚未公开说明如何具体区分合法的负面反馈与无端的虐待行为。

这一举措是 Anthropic 此前开展“模型福利”研究的延续。早在 2025 年 8 月,该公司便为部分版本的 Claude 引入了终止对话的功能,允许系统在检测到用户持续虐待模型时切断连接。尽管 Claude 本质上是软件而非人类实体,但 Anthropic 仍建议付费客户在与聊天机器人交互时保持礼貌。

除了规范用户行为,Anthropic 还同步推进了更广泛的安全改革,重点打击欺骗性影响力活动。在观察到国有媒体、政府宣传机构及商业组织利用 Claude 运营虚假账户和伪造新闻网站后,公司加强了对相关行为的限制。同时,Anthropic 放弃了对个性化政治定位的全面禁令,但仍严格禁止欺骗性定位及个人信息的滥用。

在武器与安全领域,Claude 的使用禁令已扩展至软件和组件层面。鉴于出现利用 Claude 开发武器指导与控制系统的尝试,公司明确禁止将 Claude 用于推断警察应调查、逮捕或起诉的对象,亦禁止开发监视工具。此外,未经同意追踪个人(无论是实时还是追溯)也被列为禁止事项。Anthropic 表示,这些条款旨在澄清现有限制,而非引入全新的约束。

针对将 Claude 连接至物理设备的场景,Anthropic 提出了新的安全要求:必须配备合格的人类操作员以监控和停止硬件运行;若 AI 连接中断,硬件需自动进入安全状态。此举意在应对日益强大的 AI 系统所带来的潜在安全风险。

与此同时,Anthropic 启动了一项新的网络安全倡议,旨在协助关键基础设施运营商和开源项目利用 AI 模型发现并修复漏洞。该计划包括为符合条件的开源项目提供免费安全扫描服务,并与安全公司合作以增强关键基础设施的保护能力。Anthropic 评估认为,在未来两年内,网络攻击者可能获得技术优势。

评论 0

0/500

评论需审核后展示,请文明发言

💬
还没有评论,来说两句

相关阅读