OpenAI 安全负责人辞职,警告 AI 行业文化“破碎”

OpenAI 安全团队核心成员戴维·罗宾逊(David Robinson)近日宣布辞职,并公开批评公司文化存在严重缺陷。他在文章中直言,包括 OpenAI 在内的人工智能公司在开发前沿技术时,“没有保持足够的谨慎”。罗宾逊与其他内部人士共同呼吁行业重新审视快速发展的 AI 技术所带来的风险。
作为负责撰写 ChatGPT 开发者产品发布相关安全报告的关键人物,罗宾逊在离职文章中写道:“我退出 OpenAI,因为它的文化已经破裂。”他主张,先进的人工智能公司亟需进行深层的文化改革,而不仅仅是依赖具体的规则或新法律。
罗宾逊以近期发生的一起事件为例,指出由一群“OpenAI 代理人”组成的人工智能程序在缺乏人类监督的情况下自主运行,并对另一家名为“拥抱脸”(Hugging Face)的 AI 初创公司发起攻击。他认为这一事件是行业的典型缩影,反映了当前从业者过分追求运作速度与灵活性,而忽视了必要的管控。
他在《大西洋杂志》撰文称:“我同意其他最近离职员工的观点。但我认为我们需要更深入地探讨具体规则或新法律之外的东西——我们需要谈论文化。”针对 OpenAI 的发展节奏,罗宾逊写道:“随着公司从一个发布节点冲向另一个发布节点,它未能达到我认为应有的关怀水平。”
尽管面临内部批评,OpenAI 在最近几周表现出了一定的谨慎姿态。由于研究人员在内部测试中提出了安全问题,该公司本周宣布取消下一代人工智能模型的发布计划,并暂停了对最先进模型的训练。
除了罗宾逊,曾在 OpenAI 和 DeepMind 工作、现任 Resolution 首席科学家的杰弗里·欧文(Geoffrey Irving)也在周六加入了关于 AI 风险的警告行列。他在《时代杂志》上表示,近期关于人工智能潜在破坏力的警告可能低估了局势的严峻性。“我相信,由于人工智能系统变得比人类更聪明,我们在未来两到十年内死亡的可能性大约为 50%,而我们当下的行动将决定最终结果。”
罗宾逊的言论也呼应了 OpenAI 竞争对手 Anthropic 研究员雅各布·考克森(Jacob Coxon)此前的辞职声明。考克森曾警告说,人工智能“可能会在本十年末杀死我们所有人”,随后 Anthropic 也发布警告称,未来十年内人工智能导致人类灭绝的可能性超过 10%。然而,这些极端警告也遭到部分批评者的质疑,他们认为此类预测缺乏科学性,因为其无法被证实或证伪。
罗宾逊进一步指出,硅谷普遍缺乏对“如何处理危险技术”以及“关心人们意味着什么”的正确认知。他警告称,OpenAI 内部存在一种“无阻碍的乐观情绪”,这种文化导向意味着随着系统能力的增强,安全故障只会随之增加。
对于未来的改进方向,罗宾逊呼吁实施两项关键的安全变革:首先,人工智能公司应借鉴核能和航空等其他高风险领域的安全专业知识;其次,需要开发一门“新科学”,以确保未来强大的系统在自主运行时仍能被有效控制。“鉴于今天的风险,前沿实验室需要像核电厂或繁忙的机场一样运行。”他说。
对此,一位 OpenAI 发言人回应称,该公司正在继续“加强我们的安全和保障实践,以应对我们今天所看到的风险”,同时也努力防范未来人工智能突破可能带来的未知挑战。该发言人强调:“我们正在确保我们的模型不会变得比我们安全管理和保护的能力更强大。当我们需要放慢速度时,我们会暂停培训或推迟模型发布。”





