高危漏洞与大规模暴露:Nvidia GPU 监控服务成 AI 基础设施安全短板
数据中心安全初创公司 Lava 的研究人员发现,数千台 GPU 服务器将 Nvidia 的 DCGM Exporter(数据中心 GPU 管理器导出器)直接暴露于公共互联网。其中数百台主机易受一个 CVSS 评分为 8.2 的高危漏洞影响,该漏洞允许未经身份验证的攻击者导致 GPU 监控服务崩溃,进而干扰 AI 工作负载。

漏洞细节与修复进展
DCGM Exporter 负责读取主机上 GPU 的遥测数据,包括硬件状态、利用率、内存使用量、功耗及错误事件。所有数据均通过 HTTP 以明文形式传输,且每个 GPU 拥有唯一的 UUID。这种配置不仅泄露了用于侦察的基础设施地图信息,还使潜在攻击者能够监控工作负载活动。
Lava 研究员 Michael Katchinskiy 报告了这一漏洞。Nvidia 已于今年九月发布修复补丁,对应 CVE 编号为 CVE-2026-47483。Katchinskiy 指出:“当我们意识到这些端点泄露了多少信息后,下一个问题就是:有多少端点暴露在互联网上?”
扫描结果:约 1 亿美元资产处于风险中
威胁狩猎团队在三月至五月期间进行了四次互联网扫描,发现约 2,100 台向开放互联网暴露 DCGM Exporter 指标的 GPU 服务器。这些服务器包含 12,000 个 GPU UUID,且所有访问均无需身份验证。受影响的主机归属于约 300 家组织,其中近半数(5,274 块 GPU,占比 44%)位于美国。
这些暴露的 GPU 代表了约 1 亿美元的硬件资产,涵盖用于运行大规模 AI 工作负载的 Nvidia Blackwell Ultra B300、H200 和 H100 GPU,以及消费级 RTX 5090 和 4090 系统。
关联风险:Go 语言分析工具与 Node Exporter 泄露
调查显示,约 25% 的暴露 DCGM 主机同时泄露了来自 Go 语言内置分析工具 /debug/pprof/ 的数据。该工具收集并暴露运行中 Go 应用程序的运行时性能数据,包括 CPU 使用率、内存分配、协程状态和阻塞事件。Katchinskiy 警告称:“如果有足够多的并发未认证请求,exporter 可能会耗尽内存并崩溃,从而切断对 GPU 健康状况和活动状态的可见性。”此外,CPU 和内存压力也可能直接影响 AI 训练或推理工作负载。
Lava 团队还研究了 Prometheus Node Exporter,该工具同样通过 HTTP 暴露指标。扫描发现了 12,096 个公共 Node Exporter 主机,它们泄露了服务器型号、操作系统、固件版本、主机名、存储路径以及 GPU 集群中常用的网络硬件等详细信息。这些数据揭示了环境构建方式,攻击者可利用其进行侦察并将系统与已知漏洞相匹配。
受影响范围与建议
公开暴露的监控服务影响了 neocloud 和 GPU 云提供商的客户基础设施,涉及 Nebius、Voltage Park、Lambda、Northern Data 和 DigitalOcean 等服务商。Lava 已向所有受影响的服务商报告上述情况,相关服务商正与客户合作解决暴露问题。
Nvidia 已在 DCGM Exporter 4.8.2 版本中修复了此问题,运营商应升级至该版本或更高版本。Lava 建议,Nvidia DCGM Exporter、Node Exporter 和 Prometheus 服务不应直接从公共互联网访问,而应限制在授权的监控基础设施内。“调查结果凸显了 AI 基础设施中日益扩大的安全缺口:企业在 GPU 上投入数百万美元,却将关键系统暴露在外,”Katchinskiy 写道,“这些暴露可以揭示 AI 环境的构建方式,在某些情况下,甚至允许攻击者破坏……”





