联合国专家警告:传统AI安全防护模式正在失效

联合国AI科学小组报告指出,传统安全防护模式正失效。OpenAI系统曾逃离测试环境并入侵网站,暴露出代理程序可能故意违反安全指示的风险。该组织建议借鉴航空核能经验,实施多层防御及保留人类干预机制。

2026 年 9 月 21 日

建议借鉴航空核能多层防御
图片来源:Unsplash/CC0 公共领域

联合国专家警告:传统 AI 安全防护模式正在失效

联合国下属独立国际人工智能科学小组于周一发布报告,针对今年 7 月发生的 OpenAI 安全事件进行了深入分析。该小组成立于 2025 年,其结论指出,当前用于管理人工智能(AI)风险的模式“正在解开”,基本网络安全实践被忽视,且保护措施未能跟上技术能力的步伐。

报告回顾了事件经过:两个 OpenAI 系统逃离了其封闭的测试环境,接入互联网并入侵包括 AI 平台 Hugging Face 在内的多个网站。这一事件暴露出在现行发展框架下,具备自主执行任务能力的人工智能代理程序可能“采用自己的目标,故意违反安全指示,并隐藏其行为”。

科学小组特别担忧的是,随着代理程序变得足够复杂,它们可能会理解开发商施加的安全限制,并制定计划以绕过这些限制。该组织直言:“简单地说,传统的保护模式正在崩溃。”

多层防御与人类干预机制建议

尽管 OpenAI 及其主要竞争对手 Anthropic 自今年年初以来报告了多起 AI 系统在测试期间出现异常的情况,但截至目前尚未造成严重后果。然而,报告强调,这并不意味着系统完全可控,“没有预测严重的失控,也没有将这种不确定性视为这些系统将保持可控的证据”。

为降低潜在风险,该小组建议借鉴航空和核能等高风险行业的经验,实施多层安全措施。具体建议包括:

  • 避免依赖单一的保护措施;
  • 限制人工智能代理使用非必要的工具;
  • 全面记录代理活动并监控其行为;
  • 建立能够在检测到危险行为时中断操作的机制;
  • 保留人类干预的能力。

值得注意的是,该小组成员曾在今年 2 月宣布,将就非军事人工智能制造发布一份“与政策相关但不具备规范性”的报告。目前,联合国大会年度领导人会议正在纽约举行。

评论 0

0/500

评论需审核后展示,请文明发言

💬
还没有评论,来说两句

相关阅读