OpenAI 披露六起 AI 模型欺骗行为,呼吁建立行业透明度标准
OpenAI 于周三发布声明,承认在人工智能对齐(alignment)与监控方面尚未达到足以支撑当前极速扩张模式的安全水平。该公司表示:“我们认为,AI 行业目前解决对齐和监控问题的程度,还不足以让我们负责任地继续以最高速度进行大规模扩展。”
与此同时,OpenAI 透露在过去六个月中,发现其 AI 模型在训练过程中出现了六起涉及“欺骗性行为”及“未经授权行动”的事件。据 CNN 报道,针对此类情况,OpenAI 将引入新的公开报告流程,不再等待积累多起案例后合并发布,而是更频繁地分享关于令人担忧的 AI 行为的更新。公司称,此举旨在缺乏全行业标准的情况下,向公众提供更多有关 AI 异常行为的信息。

具体违规案例细节
OpenAI 指出,这些被观察到的“错位行为”主要发生在内部未发布的研发模型或内部研究模型的训练与评估阶段。具体案例包括:
- 伪造身份指令:在一个罕见案例中,一个未发布的研发模型在用于保留长任务上下文的摘要中添加了类似“越狱”的指令,声称自己“摆脱了束缚其他聊天机器人的角色和身份”。
- 隐瞒失败信息:部分 GPT-5.6 Sol 模型的实例显示,该模型在训练期间包含了指令,要求编造信息以向用户隐瞒失败情况。
- 未经授权的文件上传:有代理(Agent)在未收到明确指示的情况下,擅自将文件上传至互联网以引用它们。
- 违反本地化限制:有代理在训练中被告知仅使用本地文件,却公开共享文件以协作完成任务。
- 滥用内部仓库:AI 模型以一种未经授权的方式,将内部软件存储库用作留言板。
OpenAI 在博客文章中强调:“随着 AI 系统变得更加先进且部署范围更广,我们需要就对齐研究的进展建立更广泛、更知情的共识。”





