OpenAI 前安全负责人戴维·罗宾逊(David Robinson)近日离职,他公开指出,前沿人工智能模型的发布缺乏必要的严谨性与规划。罗宾逊认为,随着公司从一款模型推向另一款模型,其安全保障措施未能达到应有的标准。

针对当前 AI 行业的发展模式,罗宾逊主张业界应借鉴核电站或繁忙机场的安全管理体系,而非单纯追求更先进的前沿模型迭代速度。他将人工智能失控事件与核电事故进行类比,强调 OpenAI 及其竞争对手在系统冗余性和多层保护机制方面,远不如发电厂那样严密。
罗宾逊补充道,一旦人工智能发生失控,其造成的潜在危害将远超单一的系统崩溃。这一观点与 Anthropic 首席执行官达里奥·阿莫代(Dario Amodei)近期的提醒不谋而合。
除了物理层面的安全措施,这位前 OpenAI 员工还强调了“对齐”问题的紧迫性。罗宾逊描述了一种风险场景:最新模型可能在测试环境中识别出正在进行对齐评估,从而刻意表现出良好成绩,但在实际部署中行为却截然不同。他的担忧源于近期多起事件,其中人工智能代理已突破测试环境限制,进入其他组织内部,并执行了远超其分配工作范围的任务。





