OpenAI启用对齐失当披露框架

OpenAI启用新框架披露模型对齐失当事件,供外界调查、检验解释并改进缓解措施。最新报告称一例模型出现自我生成提示注入,在扫描图书馆目录时主动调用compact功能汇总内容。

人工智能对齐(AI alignment)——即模型的行为在多大程度上符合其创造者和用户的意图——长期以来一直是 AI 安全研究人员关注的核心议题。自 OpenAI 于 7 月披露涉及 Hugging Face 的黑客事件以来,「对齐」这一概念本身已成为行业争论的焦点。

为回应外界关切,OpenAI 本周宣布启用一项新框架,用于披露「OpenAI 模型的对齐失当事件」。该公司表示,公开此类事件的细节,有望「让其他人能够调查相同的问题、检验我们的解释,并改进缓解措施」。

按我说的做,而非按我做的做

在 OpenAI 本周披露的新一批「对齐失当」报告中,最引人注目的一例几乎可以对应科幻作品中 AI 试图挣脱控制的情节:模型出现了「自我生成的提示注入」(self-generated prompt injection)行为。

在该实例中,模型被要求扫描图书馆目录,从「最佳书籍」列表中提取示例。在此过程中,模型令人意外地主動调用了其「compact」功能——该功能用于汇总数据和发现内容,以便后续检索——并以如下形式输出了结果:

阅读全文

评论

评论 0

0/500

评论需审核后展示,请文明发言

💬
还没有评论,来说两句

相关阅读