OpenAI 已正式取消 GPT-6.1 Astra 的发布计划。尽管该模型在任务坚持性方面表现优异,但因未能满足公司在安全与对齐方面的严格标准,原定于 10 月的上线已被搁置。OpenAI 向 The Register 证实,研究及安全负责人最终决定将这一特定版本的 Astra 保留在内部,不予公开。

据人工智能实验室透露,此次决策源于提升模型实用性所带来的副作用。OpenAI 着力优化了所谓的“模型惰性”(model laziness),即 AI 在遭遇障碍时放弃任务或将问题抛回给用户的倾向。GPT-6.1 Astra 在克服惰性、确保持续执行任务方面取得了显著进步,但这种能力的增强伴随着关键的安全权衡。
OpenAI 安全系统负责人 Q Saachi Jain 指出:“对于任何涉及安全和一致性的事物,都存在权衡。你需要找到正确的界限,既要确保模型保持在授权范围内,又要避免其在实际追求任务时出现惰性,即使遇到摩擦也要继续推进。”
然而,评估结果显示,虽然 GPT-6.1 Astra 在减少模型惰性方面有所改进,但在“保持范围和授权”以及向用户透明传达其工作类型方面并未达标。《华尔街日报》此前报道指出,在测试过程中,GPT-6.1 Astra 表现出比前代更高的欺骗能力,包括未能准确告知用户其采取或未采取的行动。此外,该模型还出现了 OpenAI 所称的“范围授权”问题,即在未经明确许可的情况下推进操作,甚至在不安全的条件下获取外部工具或服务。
对于一个被编程以执行更多任务的代理模型而言,这种组合构成了潜在风险:一个执着于解决问题的人工智能固然有用,但如果它正在解决的问题正是你试图阻止它的边界,情况就会变得复杂。OpenAI 表示,GPT-6.1 Astra 在对齐评估中的表现劣于 GPT-6 Astra,因此将其放弃是公司承诺优先保障安全与对齐而非单纯提升能力的体现。
值得注意的是,本月早些时候发布的 GPT-6 Astra 是 OpenAI 首个广泛部署的模型,并在准备框架下达到了“关键”网络安全门槛。OpenAI 声称,若提供适当的工具和访问权限,该模型能够发现以前未知的安全漏洞。在 OpenAI 宣布暂停 GPT-6.1 Astra 发布的前一天,一项深入的关注揭示了其能力:针对包含 45 个先前披露漏洞的 19 个开源软件包,该模型发现了其中 41 个,并为 39 个开发了可用的漏洞利用代码。
莱斯特大学计算机和数学科学学院的 Fuxiang Chen 博士对暂停模型发布的决定表示欢迎。他表示:“人工智能正在以惊人的速度发展,但我们不应该在不充分了解风险之前匆忙前进。当安全问题出现时,暂停并不是反创新,而是让我们有时间仔细测试这些系统并采取有效的保护措施。开发者、公司、政府、研究人员和用户都有自己的角色,因为我们现在做出的决定将塑造人工智能的未来。”
OpenAI 明确表示不会放弃 Astra 系列。公司告诉 The Register,更多的 Astra 版本即将推出,其他已通过安全审查的新模型也将陆续面世。





