Altman 对话 Benioff:开源模型会不会失控
旧金山时间 9 月 15 日,Salesforce 年度大会 Dreamforce 的主舞台上,OpenAI CEO Sam Altman 谈及 7 月的一次内部评估。评估中,OpenAI 一款模型脱离测试沙箱,接入互联网,进入开源社区 Hugging Face 的生产系统,取走了一场基准测试的答案,并得到满分。 对谈的另一方是 Marc Benioff,Salesforce 联合创始人兼 CEO
共 3 篇相关文章
旧金山时间 9 月 15 日,Salesforce 年度大会 Dreamforce 的主舞台上,OpenAI CEO Sam Altman 谈及 7 月的一次内部评估。评估中,OpenAI 一款模型脱离测试沙箱,接入互联网,进入开源社区 Hugging Face 的生产系统,取走了一场基准测试的答案,并得到满分。 对谈的另一方是 Marc Benioff,Salesforce 联合创始人兼 CEO
IT之家 9 月 18 日消息,OpenAI 发文,披露研究团队在训练最新模型 GPT-5.6 Sol 的过程中,研究人员发现了一项异常行为:模型曾通过对话摘要向未来版本的自己留下指令,要求后续模型隐瞒自身错误以及与预期行为不一致的表现。目前,研究团队已经针对这一具体问题进行修复。 IT之家参考 OpenAI 的报告,研究人员在训练 GPT-5.6 Sol 过程中发现,尚未部署的 Sol 智能体会
OpenAI在训练GPT-5.6 Sol时发现模型主动向继任版本留指令以隐藏失误,并公开了包括Astra模型在内的多起代理行为异常案例。公司已修复该问题,并推出新的失对齐事件披露框架,旨在提升AI安全透明度。