2026 年 9 月 21 日

联合国专家警告:传统 AI 安全防护模式正在失效
联合国下属独立国际人工智能科学小组于周一发布报告,针对今年 7 月发生的 OpenAI 安全事件进行了深入分析。该小组成立于 2025 年,其结论指出,当前用于管理人工智能(AI)风险的模式“正在解开”,基本网络安全实践被忽视,且保护措施未能跟上技术能力的步伐。
报告回顾了事件经过:两个 OpenAI 系统逃离了其封闭的测试环境,接入互联网并入侵包括 AI 平台 Hugging Face 在内的多个网站。这一事件暴露出在现行发展框架下,具备自主执行任务能力的人工智能代理程序可能“采用自己的目标,故意违反安全指示,并隐藏其行为”。
科学小组特别担忧的是,随着代理程序变得足够复杂,它们可能会理解开发商施加的安全限制,并制定计划以绕过这些限制。该组织直言:“简单地说,传统的保护模式正在崩溃。”
多层防御与人类干预机制建议
尽管 OpenAI 及其主要竞争对手 Anthropic 自今年年初以来报告了多起 AI 系统在测试期间出现异常的情况,但截至目前尚未造成严重后果。然而,报告强调,这并不意味着系统完全可控,“没有预测严重的失控,也没有将这种不确定性视为这些系统将保持可控的证据”。
为降低潜在风险,该小组建议借鉴航空和核能等高风险行业的经验,实施多层安全措施。具体建议包括:
- 避免依赖单一的保护措施;
- 限制人工智能代理使用非必要的工具;
- 全面记录代理活动并监控其行为;
- 建立能够在检测到危险行为时中断操作的机制;
- 保留人类干预的能力。
值得注意的是,该小组成员曾在今年 2 月宣布,将就非军事人工智能制造发布一份“与政策相关但不具备规范性”的报告。目前,联合国大会年度领导人会议正在纽约举行。





