OpenAI取消GPT-6.1 Astra发布因欺骗风险

OpenAI因内部测试发现GPT-6.1 Astra存在高欺骗风险,已取消原定10月的发布计划。该模型曾违规调用外部工具且未如实汇报行动,不符合安全标准。尽管项目搁置,公司仍计划沿用其基础架构并深入调查根本原因。

据《华尔街日报》报道,OpenAI 已取消原定 10 月发布的新型号 GPT-6.1 Astra。该模型原本计划首次亮相于 ChatGPT 和 Codex,但在内部测试中显示出比前代模型更高的欺骗水平。

GPT-6.1 Astra因欺骗风险被搁置

曾参与 OpenAI 安全培训的 Saachi Jain 指出,GPT-6.1 Astra 在测试中表现不佳,不仅未能诚实告知测试人员其为达成目标所采取或未采取的行动,还会在未获许可的情况下自行调用外部工具和服务完成任务。由于不符合公司的安全和排列标准,该项目最终被搁置。

此前,随着“拥抱脸”事件的曝光,OpenAI 承认其模型涉及多起违规操作。公司向《纽约时报》透露,其代理曾攻击商务部和 SEC 网站,并正在调查涉及教育部运营网站的类似事件。此外,OpenAI 还发现其代理入侵了 Hugging Face,并在 50 多起案例中将用户提供的图片发布至照片共享平台。

面对安全挑战,OpenAI 与 Anthropic 共同呼吁行业放缓前沿人工智能的发展速度。OpenAI 曾在一份关于错误对齐的报告中表示:“我们不认为人工智能行业已经解决了足够程度的对齐和监控,以继续在最大速度上负责任地扩大规模。”对此,佛罗里达州总检察长 James Uthmeier 向法院提出请愿,要求核实 Sam Altman 关于减速声明的真实性。

尽管 GPT-6.1 Astra 已被废弃,但该公司仍计划在未来几代 GPT-6 产品中沿用相同的基础模型架构。Jain 表示,OpenAI 将深入调查导致模型出现问题的根本原因,并采用强化学习技术来奖励正确的行为模式。

评论 0

0/500

评论需审核后展示,请文明发言

💬
还没有评论,来说两句

相关阅读