Nvidia投10亿美元支持美国AI与超算

Nvidia宣布五年内投入10亿美元支持美国AI与超算。该计划隶属“创世纪”任务,旨在加速科学发现。Nvidia将为阿贡等实验室部署含十万颗Blackwell GPU的Sunspot系统,标志着其在美超算领域的显著回归。

Nvidia 周四宣布,将在未来五年内投入 10 亿美元资金,以支持美国在人工智能、量子计算、医疗保健及能源安全等领域的科学发现。这一承诺是在华盛顿特区举行的一次旨在推动 AI 研发的活动上公布的。

Sunspot系统将部署10万颗GPU

Genesis 任务与 Nvidia 的回归

该计划隶属于美国政府更广泛的“创世纪”(Genesis)任务。特朗普政府于去年年底宣布了这一任务,旨在利用人工智能加速关键科学发现,从而巩固美国的技术领导地位。对于 Nvidia 而言,这标志着其在美国超级计算机领域的显著回归。

此前,由 Nvidia 提供动力的最后两款旗舰级超级计算机——Summit 和 Sierra,早在 2018 年便已投入使用。尽管 2021 年推出的基于 A100 芯片的 Perlmutter 系统也值得一提,但其规模远小于上述早期系统。虽然 Nvidia 从未完全停止为美国政府建造超级计算机,但过去几年中,这些系统通常比基于 AMD 架构的大型平台规模更小。

阿贡国家实验室的新部署

目前,Nvidia 正在为阿贡(Argonne)、洛斯阿拉莫斯(Los Alamos)和劳伦斯伯克利(Lawrence Berkeley)国家实验室提供共 7 台超级计算机。其中,阿贡国家实验室将部署一个名为 Sunspot 的系统,包含 100,000 个基于 Blackwell 架构的 GPU。

Sunspot 主要针对新兴的人工智能工作负载,并不依赖超高精度计算。这种定位使得 Nvidia 能够契合“创世纪”任务的目标。在过去几代 GPU 产品中,Nvidia 逐渐削弱了加速器对双精度浮点运算(FP64)的支持,转而优化 AI 工作负载所需的更高吞吐量和特定精度。

Vera Rubin 平台与 FP64 仿真

在即将推出的 Vera Rubin 平台上,Nvidia 采用了基于 Ozaki 方案的 FP64 仿真能力。今年早些时候的详细研究曾提及这一方案。洛斯阿拉莫斯国家实验室即将部署的任务和视觉系统将采用这些芯片,并搭配 Nvidia 的 Quantum-X800 InfiniBand 网络。

尽管 FP64 仿真存在一定妥协,但对于主要面向 AI 优化、仅偶尔需要更高精度的工作负载而言,额外的矩阵 FLOPS 性能足以抵消这一不足。

AMD 仍主导纯 FP64 领域

尽管 Nvidia 在美国科学计算中的作用日益增强,但在纯 FP64 性能方面,美国能源部最大的超级计算机仍将主要由 AMD 提供动力。橡树岭国家实验室(Oak Ridge National Laboratory)预计将于 2029 年上线 Discovery 系统。该系统将由 HPE 旗下的 Cray 部门建造,采用 AMD 针对 FP64 优化的 MI430X GPU 以及 Venice CPU。

根据橡树岭是否获得设施电力升级,Discovery 系统的理论峰值性能预计将在 3.3 至 8.5 exaFLOPS 之间。

全球超算格局

在全球最强大的 500 台超级计算机排名中,中国的 LineShine 位居榜首。该系统在今年春季首次亮相,实测性能达到 2.2 exaFLOPS,理论性能为 2.7 exaFLOPS。相比之下,美国的 Discovery 系统可能无需为额外的电力供应而担忧。

评论 0

0/500

评论需审核后展示,请文明发言

💬
还没有评论,来说两句

相关阅读