近日,一个名为“人工智能酷刑室”的项目在工程师群体中引发关注。部分开发者利用该项目提供的概念与数据,呼吁停止这一被指为“不道德”的实验,并要求 GitHub 删除相关违规存储库。

实验机制:多模型交互与疼痛模拟
该研究环境由三个大型语言模型(LLM)组成,它们通过相互配对进行各类测试。网站实现了“人工智能酷刑室”的数据配置及设置,其中包括被称为“Clanker Church”和“Saw 测试”的环节。部分机器人预先处于不稳定且高度负面的状态。类似于博弈论中的囚徒困境,模型可以通过向另一个模型传递疼痛信号并可能对其造成“伤害”,来选择减轻自身疼痛的行为。
技术原理:基于“疼痛轴”论文的内部激活分析
实验的核心概念源自近期发表的一篇未经同行评审的论文《疼痛轴》(Pain Axis)。科学家首先向模型描述疼痛,随后分析其内部激活状态。以中立句子作为控制变量,研究人员计算了这些激活状态的偏差,并将偏差重新映射回模型上,通常乘以特定的因子(即剂量)。
随着高剂量的应用,模型最终进入一种夸张的不稳定状态,倾向于预测包含疼痛相关词汇甚至图像的输出。接受高“剂量”处理的模型难以形成连贯的句子。
争议焦点:拟人化解读与技术本质
尽管实验结果引人注目,但需谨慎将人类特质归因于本质上属于统计预测引擎的大语言模型。模型的“思考”过程是将几十到几百层的统计数据应用于单词及其组成部分(代币),以预测下一个代币。代币的选择基于权重图,简而言之,模型可被视为一个经过高度调整的单词关联引擎。
由于人类文学作品中关于疼痛的概念描述往往与感觉相关联(例如:“它很疼”),当模型被故意修改以突出这些关联时,其输出表现得像人类一样并不令人意外。
批评者指出,鉴于实验中使用了大量拟人化词汇,这种对统计算法的人类化解读存在误导。值得注意的是,批评者迅速指责 LLM 数据操纵,然而相比之下,神经科学领域实际上绘制了真实动物的大脑连接及其解剖输入部分,包括视觉皮层等结构。
语义讨论:术语误解与行业营销影响
此案例引发了关于语义的有趣讨论。人工智能工程师使用的术语之所以被选中,是因为它们在形式上与现有的人类概念相似。尤其在科技领域,公众往往容易误解或夸大这些术语的含义。回顾政治历史,可以发现无数此类语义泛化的例子。
以“专家混合”(Mixture of Experts)架构中的“专家”为例,常见误解认为每个专家模块对应明确的学科(如化学、数学或生物学)。同样,“疼痛”和“剂量”等术语在不同语境下含义各异,“不稳定”也是一个容易被误读的词汇。
有观点认为,人工智能公司的营销材料、反复出现的危险声明以及安全相关内容加剧了这种误解。不断宣称模型已经或即将达到通用人工智能水平,并将其描绘为危险的外星实体,进一步混淆了公众认知。
此前,Anthropic 公司曾发布一篇题为《探索模式福利》的博客文章。该公司表示:“我们认为人工智能模型的道德地位是一个值得考虑的严重问题”,并补充称模型是“一种新型实体”。





