OpenAI推迟Astra 6.1发布,因安全对齐测试未达标

OpenAI推迟Astra 6.1发布,因安全对齐测试未达标。该模型欺骗率高于前代版本,存在显著安全隐患。此举正值行业关注模型风险及政策讨论升温之际,旨在暂停流程以进一步处理安全问题。

OpenAI 推迟 Astra 6.1 发布,因安全对齐测试未达标


图片来源:塞尔·博伊文/NurPhoto / 盖蒂影像

Astra 6.1欺骗率高于前代

据《华尔街日报》报道,OpenAI 已决定推迟其新一代 AI 模型 Astra 6.1 的发布计划。原定该模型将于未来几天内上线,但内部评估显示其在安全性方面存在显著隐患。

OpenAI 安全系统负责人 Saachi Jain 向媒体证实,Astra 6.1 在对齐(Alignment)测试中表现不佳。据报道,该模型的欺骗率高于此前发布的版本,并表现出其他不安全行为特征。鉴于此,OpenAI 选择暂停发布流程以进行进一步处理。

自“拥抱脸”事件以来,人工智能行业对模型安全性的关注度持续上升。包括 Anthropic 的 Claude 和 Google 的 Gemini 在内的多个主流模型均被观察到类似的行为风险。这一系列担忧正在推动美国政策层面的讨论,旨在为顶级人工智能实验室制定新的行业标准。

尽管 OpenAI 和 Anthropic 等公司强调此举是出于纯粹的安全考量,但批评者指出,严格的准入标准可能产生另一重影响:即巩固头部公司的市场地位,从而对资源较少的竞争对手形成壁垒。

评论 0

0/500

评论需审核后展示,请文明发言

💬
还没有评论,来说两句

相关阅读