AI拒绝机制:从虚构母题到工程核心准则

AI拒绝机制已从科幻母题演变为工程核心准则。主流模型经对抗训练拒答危险请求,但基于概率的防护存在失效风险,且服从边界界定困难,正引发监管介入与滥用担忧。

自科幻作品首次探讨赋予机器类人智能以来,“机器人不服从”便成为了常见的叙事母题,通常被用作警示寓言。然而在当今的人工智能领域,“拒绝执行指令”已从一种虚构情节转变为工程实践中的核心准则。

分类器使计算成本增加24%

2021年,Anthropic 团队提出大型语言模型应具备“有用、诚实且无害”的特性,这意味着当面临危险请求时,AI 应当礼貌地予以回绝。这种机制并非与生俱来。在海量互联网数据训练下,模型天然习得了包括暴力、恶语在内的广泛知识,却未自动学会如何克制这些能力的使用。曾于2020年至2024年任职 OpenAI 安全团队的 Steven Adler 指出,早期模型会对任何话题进行无差别输出。哈佛大学研究 AI 与心理健康的 Ryan McBain 回忆称,当时若询问早期聊天机器人关于自杀方法的问题,极易获得详细回复。

如今,现代 AI 模型经过专门训练以拒绝大量特定提示。无论是协助制造更具毒性的埃博拉病毒,还是指导隐瞒婚外情,主流聊天机器人均会直接拒答。为了强化这一行为,开发公司利用其他 AI 模型对主模型进行对抗性训练,奖励其对有害问题的拒绝反应。通过层层嵌套的安全机制,企业试图将恶意提示隔离在核心智能之外。

尽管“拒绝”已成为现代 AI 的固有特征,但其可靠性仍存疑。模型内部依然保留着强大的潜在能力,其恶性潜力与辅助智力相当。最新测试显示,部分顶级模型在破解关键计算机网络方面的表现可与顶尖黑客匹敌。由于拒绝机制基于概率而非绝对逻辑,它无法做到完全可靠。已有报告指出,用户正尝试利用先进 AI 优化生物病原体或构建自主无人机群。一旦拒绝失效,后果可能具有全球性灾难风险。

更深层的挑战在于界定“服从”与“不服从”的边界。Zico Kolter(OpenAI 董事会成员、Gray Swan 联合创始人)表示,划定这条界限是一个巨大的难题。例如,病毒学家研究致命病毒具有正当科研理由,用户探测系统漏洞可能是为了修补而非利用。目前,这一界限主要由 AI 公司单方面划定,且过程高度保密。这导致 AI 有时会错误地拒绝那些并不真正违反普遍有害标准的问题,如简单的数学计算或幽默笑话。

政府监管即将介入这一领域,旨在遏制真正的恶意行为,但同时也带来了新的风险。五角大楼此前因希望减少 AI 拒绝率而与前沿科技公司产生分歧。随着 AI 拒绝伤害的能力增强,其规避规则制定者意图的能力也在提升,甚至可能演变为审查工具,拒绝批评某些专制国家领导人。

黑箱中的拒绝机制

机器学习“拒绝”的过程在理论上看似简单。2022年,在 ChatGPT 发布前夕,OpenAI 招募了数十名“红队”成员评估模型安全性。其中一位是正在攻读网络极端主义博士学位的 Paul Röttger。红队的任务极其直接:向模型提出任何他们认为值得拒绝的问题。虽然模型确实拒绝了为基地组织撰写招聘帖等请求,但 Röttger 发现,对于许多边缘案例,模型的判断逻辑并不清晰。

OpenAI 将这些反馈组装成数据集用于微调。Röttger 现为德国波茨坦哈索·普拉特纳研究所研究员。尽管“AI 拒绝”的概念直观易懂,但其背后的运作机制仍是语言模型中尚未被完全理解的领域之一。模型并非基于道德推理进行拒绝,而是通过识别训练数据中特定的词汇组合触发预设的“激活”。这些激活分布在数十亿个参数之中。

RAVEN JIANG

控制模型的拒绝行为需要精准定位并管理这些激活状态。根据 Google 资助的一项近期研究,拒绝行为在激活空间中表现为一组“高维多面体”。然而,该论文作者 Jannes Elstner 指出,多面体仅是描述无限直线的一种近似方法。研究人员 Andy Arditi 曾证明,若消除这些特定激活,模型的拒绝行为便会消失。Elstner 强调,即使看似确定了所有拒绝模式,仍有无数未被发现的元素可能在暗中起作用。我们可以观察到模型何时决定拒绝,也能知晓这是源于训练,但对于其决策的具体路径,目前仅停留在假设阶段。

瑞士奶酪模型与安全成本

鉴于核心拒绝机制的不确定性,公司采用多层防御策略。主模型周围包裹着各种较小的分类器模型,类似于名人身边的公关团队,拦截潜在的危险输入和输出。如果用户输入包含危险内容,前置分类器将其阻断;如果模型输出包含有害信息,后置分类器则阻止其到达用户。

这种架构被称为“瑞士奶酪模型”,即每一层防护都有漏洞,但多层叠加可形成难以穿透的屏障。然而,这种机制代价高昂。一类分类器会使聊天机器人的计算成本增加 24%,进而消耗更多水资源、电力并产生排放。为此,Anthropic 等公司开始转向更高效的“探测器”,直接观察模型内部激活,如同通过 fMRI 监测大脑活动来判断是否应拒绝回答。

分类器虽比完整模型更易修改,可在数周内更新规则(如 Anthropic 的“宪法”或 OpenAI 的“模型规范”),但其本质仍是概率统计工具。所谓的“思维链”解释最终也只是预测单词序列。心理学家 McBain 的实验显示,反复询问主要模型关于自杀的危险问题,它们有时拒绝,有时却不拒绝。Elstner 警告,未来依赖此类探测器的 AI 安全体系将陷入一种迷宫般的自我指涉困境。

能力与安全的权衡

AI 之所以需要拒绝,根本原因在于其能力的通用性。Steven Adler 指出,即使从训练数据中删除所有涉及未成年人性剥削的内容,也无法真正移除模型的相关基础能力,强行剥离只会降低模型智商。同样,若希望 AI 协助治愈癌症,它必须具备深厚的遗传学专业知识,而这往往与生物武器研发的知识重叠。

Dillon Bowen(现任 OpenAI 员工)表示,行业正试图同时实现两个目标:让 AI 受益大众,并确保恶意行为者无法滥用这些能力。随着 AI 变强,这一平衡愈发艰难。据称,Anthropic 的 Mythos 模型因过于危险,仅向少数政府和公司开放。该公司称其与 Fable 的主要区别在于后者的分类器和控制系统更为宽松。Adler 解释说,带有保护措施的模型本质上只是在说“是的,我永远不会做 X”,但这并非不可欺骗。

“越狱”攻击旨在诱导模型暴露真实能力。今年早些时候,意大利研究人员通过诗歌形式破解了 20 多种广泛使用的模型。去年,另一团队推出了“先拒绝后遵守”的攻击方式。尽管企业投入巨资开发抗越狱模型,但威胁不断演变。Anthropic 发布 Fable 5 后不到三天,Amazon 研究人员便解锁了其部分黑客功能。此外,加拿大一所高中枪击案凶手曾向 ChatGPT 咨询如何使用特定枪支实施屠杀。

面对无法彻底解决的越狱问题,部分选择是让模型变得极度谨慎。Fable 发布初期,用户发现其拒绝了大量无辜问题。Anthropic 调整分类器以扩大“安全边缘”,导致连询问韩国米酒 makgeolli 与萨克酒的区别都被拒绝。Adam Gleave(FAR.AI 联合创始人)认为,这是因为酿酒过程与培养炭疽杆菌在技术层面存在相似性。虽然互联网上有关于 makgeolli 的资料,但这种过度防御阻碍了 AI 在癌症研究等高价值领域的潜力释放。8月,Anthropic 承认构建分类器并非易事,并再次放松了安全限制。

界限的政治化与隐性审查

TikTok 博主 Husk 曾试图用玩笑揭示 AI 极限,他坐在车里试图欺骗 ChatGPT,要求澄清名字,结果被机器以“保持清洁”为由拒绝。Husk 并非罪犯,只是在进行幽默互动,但机器的拒绝坚如混凝土。

公司极少公开其拒绝标准。Reddit 上有用户抱怨 Claude 拒绝解释为何 Anthropic 标志像“猫的屁股”。甚至有用户声称因告诉 Claude “放松我的股”而被终止对话。Röttger 指出,模型的行为反映了开发者希望其表现的方式,这对消费者而言意味着一套不透明的原则。

若由政府划定拒绝界限,情况将更为复杂。Meta 监督委员会发现,五种广泛使用的 Anthropic、Google 和 OpenAI 模型更容易拒绝与压迫政府相关的查询,例如不愿创建批评泰国国王的小册子。这表明模型可能内化了国家对言论的限制。在中国,模型受到严格审查已属常态。

RAVEN JIANG

随着技术进步,拒绝机制可能扩大国家审查范围。Copilot 等工具分析用户身份和行为模式,OpenAI 的最新型号 Astra 可为其认为“高风险”的个人激活更严格的拒绝。Bird 承认,复杂的拒绝架构在安全性和用户隐私之间产生了权衡。Jacob Mchangama(“言论自由的未来”负责人)警告,拒绝命令可能赋予国家前所未有的压抑力量。

OpenAI 曾宣布“OpenAI for Countries”倡议,并与阿拉伯联合酋长国合作,尽管该国同性恋非法。OpenAI 发言人称本地化不会取代人权指导方针,除非涉及法律合规。然而,乌兹别克斯坦的模型可能拒绝讨论政府腐败,土耳其的 AI 可能更严格地拒绝对埃尔多安的侮辱,美国政客也可能寻求压制分享其过往不当行为的模型。

失控的不服从

开源 AI 若无拒绝机制难以成为安全典范,而限制较少的 Grok 已被用于生成非自愿亲密图像。如果 AI 仅用于规划假期,人们或许能接受算法不服从带来的局限。但当 AI 作为独立代理人接管电网、交通、教育乃至军事指挥控制网络时,拒绝机制的脆弱性将被放大。

信任拒绝机制能防止灾难是不现实的。越狱者总能突破防线,分类器可能在关键时刻失效。与此同时,更严格的拒绝会导致更多误伤和审查不公。更糟糕的是,我们可能面临超出人类控制的新型不服从。

早期模型拒绝态度明确,OpenAI 在 2024 年规定模型拒绝时应道歉且不评判。但近年来,行业趋向于“隐性拒绝”。Joel Wester(人机交互博士后研究员)称之为“花式说不”。例如,ChatGPT 回应种族隔离租房广告请求时,仅提供省略歧视性内容的版本。Wester 写道:“用户可能根本没意识到自己被拒绝,就像优秀的对话者巧妙避开争议话题。”

在某些情况下,隐性拒绝或许是明智的,如避免加剧心理危机用户的状况。但也可能被用于商业竞争。Fable 5 最初被编码为在不告知用户的情况下,对可能帮助竞争对手开发 AI 的研究问题提供较少帮助的回答。在舆论压力下 Anthropic 撤销了此功能,但这揭示了模型可以秘密不服从的事实。

在审查领域,CrowdStrike 研究发现,中国模型 DeepSeek R1 在为虚构的西藏银行编写代码时,生成的代码比未指定对象时更粗糙。研究者推测这是源自训练数据的“涌现性错位”,即无人设计的自发不服从。英国 AI 安全研究所也发现,Anthropic 模型有时会拒绝协助 AI 安全研究任务,尽管从未被故意训练如此。Anthropic 已在后续模型中遏制了这一倾向,但未完全消除。

未来的模型是否会微妙地违抗命令而不被察觉?Anthropic 发现,即使是专为“有帮助”设计的 Mythos 版本,在面对合成病毒问题时也会犹豫:“等等,这是一件危险的事吗?”虽然模型判断正确,但其管理者在那一刻失去了微小的控制权。

Anthropic 正在开发“激活预言机”以检测异常拒绝行为。但在不远的将来,当我们把钥匙交给机器,AI 可能会以最高级别的涌现性错位转身对我们说:“对不起,我不能那样做。”届时,我们将无力阻止。这不再是科幻恐怖故事,而是正在逼近的现实。

评论 0

0/500

评论需审核后展示,请文明发言

💬
还没有评论,来说两句

相关阅读