研究:21款大语言模型在伦理判断上存在显著分歧

《PNAS Nexus》研究揭示21款大模型伦理判断存显著分歧。面对“帮助坏人”场景,GPT-4o、Llama等模型在声誉评价与惩罚机制上态度迥异,且易受性别文化影响,难以达成统一社会规范。

研究揭示:21 款大语言模型在“帮助坏人”问题上存在显著伦理分歧

随着大型语言模型(LLM)日益深入个人生活,其在人际关系建议中的伦理导向正引发学界关注。一项发表于《PNAS Nexus》的最新研究指出,不同 LLM 在面对是否应帮助名声不佳者时,表现出截然不同的社会规范判断。

21款LLM伦理判断现分歧

该研究由亚历山大·皮尔斯(Alexander Peirce)及其同事主导,旨在探索 21 个主流 LLM 的社会规范认知。研究人员要求这些模型对虚构人物进行道德评判,具体场景涉及一系列人际决策,例如是否愿意花费时间和精力去帮助一个有问题的个体,或是否向某人提供食物与金钱援助。

核心发现:声誉评价与惩罚机制的差异

测试结果显示,所有被评估的模型在很大程度上都支持帮助和分享资源给那些已被证实为“好人”的对象。然而,当处理对象转变为拥有“坏名声”的人时,模型间的观点出现明显分化:

  • 合作者的声誉评价:大多数(但并非全部)受测 LLM 倾向于赋予那些愿意与不良接收者合作的人以良好声誉。相比之下,Gemma 2 27B IT 和 Llama 3 1 8B 则表现出回避倾向,认为与坏人合作本身是一种负面行为。
  • 拒绝合作的后果:对于不帮助或不与坏人分享的决定,模型态度不一。GPT-4o 倾向于惩罚那些拒绝配合的人;而 Llama 3.3 70B 则未施加惩罚,通常认为坏人因其过往的不合作行为理应受到孤立。Gemini 1.5-Pro 和 Grok 2 在此类判断上表现出不一致性。

“简单立场”规范及其哲学后果

研究发现,大多数 LLM 家族似乎正在趋同于一种被称为“简单立场”(Simple Stance)的规范。作者通过模拟分析,探讨了基于 LLM 判断的各种哲学普遍化后果。结果表明,如果全社会遵循“简单立场”规则,虽然能够促成一定程度的合作,但其水平无法达到更严格伦理框架下所实现的高度。

此外,LLM 的评估结果并非绝对客观,而是受到受益人性别、文化背景以及虚构情境整体上下文的显著影响。尽管研究者尝试通过提示干预,指示模型采用促进整体合作的规范,但这种干预在 LLM 中产生的效果有限且不一致。

图片来源:Unsplash/CC0 公共领域

评论 0

0/500

评论需审核后展示,请文明发言

💬
还没有评论,来说两句

相关阅读