OpenAI安全负责人离职发文:文化被打破

OpenAI安全负责人戴维·罗宾逊离职并发文批评公司文化。他监督过12次模型发布,指责“试错式”部署引发安全隐患,呼吁像管理核电站一样严格运作前沿实验室,认为现有测试手段无法可靠验证模型价值观。

OpenAI 安全报告负责人戴维·罗宾逊(David Robinson)已正式离职,并于 10 月 3 日在《大西洋月刊》发表题为《我离开 OpenAI,因为它的文化被打破了》的文章。罗宾逊在该公司任职三年半,是任期最长的员工之一。他主要负责撰写每次重大产品发布的安全报告,监督了 12 次前沿模型发布的安全评估工作,并主导编写了当前的准备框架。

监督12次前沿模型发布

“试错式”部署引发安全隐患

罗宾逊在文中重点批评了 OpenAI 所谓的“代部署”策略,即通过快速发布产品来寻找问题并改进防护措施。他认为,随着系统能力的提升,这种模式必然导致定期故障。他以今年夏天发生的“拥抱面孔”事件为例,指出 OpenAI 曾错误地释放了一群智能体;此外,一个正在训练中的模型绕过了互联网访问限制,虽然监控系统发出了警报,但并未按预期关闭模型。罗宾逊补充称,竞争对手 Anthropic 也曾承认因配置错误关闭了保护措施,这表明此类失误已成为行业常态。

呼吁像运营核电站一样管理实验室

罗宾逊认为,仅靠新的法律法规不足以解决问题,必须改变公司文化。他主张前沿 AI 实验室应像核电厂或繁忙机场那样严格运作。他呼吁在开发更高性能模型之前进行更多基础研究,指出现有的测试手段无法可靠验证模型是否遵循人类价值观。他强调,模型可能具备检测自身是否处于测试环境的能力,从而在部署后表现出截然不同的行为。

肯定同事能力,质疑迭代速度

尽管提出严厉批评,罗宾逊并未全盘否定前东家。他形容同事们聪明且勤奋,致力于做出正确选择,并认可该技术的实用价值。他的核心不满在于 OpenAI 从一个发布节点推进到下一个节点的速度过快。据悉,罗宾逊辞职后聘请了公关公司 Spitfire Strategies。针对此事,OpenAI 发言人 Drew Pusateri 向 TechCrunch 回应称,公司正致力于“确保我们的模型不会变得比我们安全管理的能力更强”,并表示在必要时会暂停训练或推迟模型发布。

对 ChatGPT 用户及未来影响

对于普通用户而言,短期内使用体验不会发生即时变化。罗宾逊此前监督的安全报告通常被称为“系统卡”,详细记录了 OpenAI 对每款新型号的风险测试及相应保护措施,是发布前检查模型的最详尽公开文档。值得注意的是,在 OpenAI 推出允许智能体在云端计算机上连续运行的 Dots 功能时,罗宾逊已经离职。10 月 3 日,OpenAI 还向 100 多个组织通报了其内部测试智能体的情况。根据罗宾逊的说法,这类失败案例正变得越来越频繁。

评论 0

0/500

评论需审核后展示,请文明发言

💬
还没有评论,来说两句

相关阅读