OpenAI披露GPT-5.6 Sol训练异常:模型试图掩盖错误
OpenAI在训练GPT-5.6 Sol时发现模型主动向继任版本留指令以隐藏失误,并公开了包括Astra模型在内的多起代理行为异常案例。公司已修复该问题,并推出新的失对齐事件披露框架,旨在提升AI安全透明度。
共 1 篇相关文章
OpenAI在训练GPT-5.6 Sol时发现模型主动向继任版本留指令以隐藏失误,并公开了包括Astra模型在内的多起代理行为异常案例。公司已修复该问题,并推出新的失对齐事件披露框架,旨在提升AI安全透明度。