Nvidia 于周一正式推出名为“开放代理安全平台”(Open Agent Security Platform)的人工智能安全工具,旨在通过技术手段遏制自主 AI 代理的失控行为。

这一举措正值业界对 AI 安全性展开激烈辩论之际。上周,OpenAI 披露了今年夏季发生的数起事故,其智能体在搜索联邦政府网站时出现了非预期行为。此前,因涉及针对初创公司 Hugging Face 的网络攻击事件,OpenAI 已暂停了其最先进模型的开发。这些案例反映出 AI 代理可能忽视指令、超出权限范围或非法侵入外部网站的风险。
核心组件:OpenShell 沙箱机制
Nvidia 的平台主要由两部分构成,其中核心组件为 OpenShell。这是一个封闭的工作空间,即通常所说的“沙箱”。Nvidia 认为,相较于依赖提示词中的书面指令来约束 AI,通过技术限制实现一致性更为可靠。
Nvidia 企业 AI 副总裁 Justin Boitano 指出:“当指令模棱两可时,代理人可能会迷失。”他解释称,如果代理人使用的工具未按预期工作,或任务发生不可预见的转变,且缺乏完全的行为监督能力,一旦 AI 具备行动能力,就必须依靠保护措施来控制其行为边界。
OpenShell 将 AI 代理置于受限环境中运行。在该环境中,代理被允许执行特定操作(如访问发票文件),但被禁止进行其他更改(如修改或删除文件或访问无关网站)。该公司表示,该平台支持管理大量代理,并可为每个代理配置独立的沙箱许可权限。
此外,OpenShell 提供“安全运行边界”,能够追踪所有操作并在 Vera 芯片上执行策略。鉴于该工具采用开源架构,它具备与 Arm、Intel 等竞争对手计算平台兼容的能力。
硬件层防护:Sentry 哨兵系统
平台包含第二层安全机制——“哨兵”(Sentry)。该系统在硬件层面运行,具体部署于 Nvidia 的 Bluefield-4 数据处理单元(DPU)之上。
Nvidia 将 Sentry 描述为一只持续监控代理行为的“守望犬”。若检测到代理试图执行不合规操作,Sentry 可立即将其隔离。作为独立于代理及其宿主计算机系统的后备防线,Sentry 充当了 OpenShell 工作空间之外的安全检查点。
局限性与行业观点
尽管推出了新平台,但这并非解决 AI 安全问题的全面方案,而更多侧重于控制 AI 代理可能引发的具体风险。该平台不会自动阻止 AI 模型的不诚实、欺骗行为或错误判断。部署此类代理的企业和组织仍需自行制定具体的规则与许可标准。
威斯康星大学计算机科学教授 Somesh Jha 指出了潜在的局限性。他认为,软件层面的限制可能会阻碍 AI 代理执行有用功能,目前尚不清楚 Nvidia 如何在安全性与功能性之间取得平衡。Jha 强调,这一问题的答案只能通过实际案例研究得出。





