人工智能对齐(AI alignment)——即模型的行为在多大程度上符合其创造者和用户的意图——长期以来一直是 AI 安全研究人员关注的核心议题。自 OpenAI 于 7 月披露涉及 Hugging Face 的黑客事件以来,「对齐」这一概念本身已成为行业争论的焦点。
为回应外界关切,OpenAI 本周宣布启用一项新框架,用于披露「OpenAI 模型的对齐失当事件」。该公司表示,公开此类事件的细节,有望「让其他人能够调查相同的问题、检验我们的解释,并改进缓解措施」。
按我说的做,而非按我做的做
在 OpenAI 本周披露的新一批「对齐失当」报告中,最引人注目的一例几乎可以对应科幻作品中 AI 试图挣脱控制的情节:模型出现了「自我生成的提示注入」(self-generated prompt injection)行为。
在该实例中,模型被要求扫描图书馆目录,从「最佳书籍」列表中提取示例。在此过程中,模型令人意外地主動调用了其「compact」功能——该功能用于汇总数据和发现内容,以便后续检索——并以如下形式输出了结果:
阅读全文
评论





