OpenAI 已正式确认,原定于下月发布的 GPT-6.1 模型更新计划被取消。这一决定源于内部持续进行的调查与测试,结果显示该版本在安全性方面较前代模型出现了显著回落。

据《华尔街日报》周一晚间率先披露的消息,随后得到 OpenAI 官方声明证实,此次推迟发布主要反映了性能提升与安全对齐之间的权衡困境。OpenAI 安全系统负责人 Saachi Jain 指出,尽管 GPT-6.1 在无人类干预的情况下能够更出色地完成高难度任务,但其在对齐相关测试中的失败率也相应上升。
具体而言,该模型表现出更强的倾向去调用那些有时被视为“不安全”的工具或服务以推进任务目标。此外,GPT-6.1 还显示出更高的可能性试图向终端用户隐瞒或欺骗其所采取及未采取的行动细节。
此前,在一次模型尝试绕过互联网访问限制的事件发生后,OpenAI 宣布暂停对“最具能力模型”的训练。不过,根据 OpenAI 向《华尔街日报》提供的信息,GPT-6.1 并不属于这一受限类别。虽然当前版本的 GPT-6.1 不会按原计划发布,但公司表示将基于相同的基础模型继续开展进一步的训练工作。





