研究:21款大语言模型在伦理判断上存在显著分歧 《PNAS Nexus》研究揭示21款大模型伦理判断存显著分歧。面对“帮助坏人”场景,GPT-4o、Llama等模型在声誉评价与惩罚机制上态度迥异,且易受性别文化影响,难以达成统一社会规范。 人工智能 2026-09-29 12:40 8 阅读