AI算力逼近物理极限:散热、互联与电网成三大瓶颈

AI算力扩张正撞上物理极限,散热、互联与电网成三大瓶颈。现代GPU机架功耗常超100千瓦,远超传统风冷上限,迫使行业转向浸没式冷却等新技术以突破热墙。

人工智能算力的爆发式增长正逼近物理基础设施的极限,其中电网容量、散热效率及互联带宽成为制约数据中心扩张的三大瓶颈。传统的空气与液体冷却方案已难以应对高密度算力集群的需求,而GPU互连技术也面临数据传输速率与功耗的双重挑战。

双相浸没冷却可降低40%能耗

当前,AI数据中心不仅要在计算能力上超越GPU互连的数据传输上限,还需解决负载剧烈波动导致的电网功率因数校正(PFC)系统压力,以及机架功率密度过载引发的散热难题。以下将深入探讨阻碍AI发展的“热墙”、“互联限制”及“电网危机”,并分析行业如何通过技术创新突破这些物理壁垒。

热墙:机架级散热挑战

标准服务器机架产生的热量巨大,高性能GPU集群更是如此。现代GPU机架的单柜功耗往往超过50至100千瓦,这使得传统的风冷和液冷方法显得力不从心。

常规冷却系统通常维持集群在65至85摄氏度运行,一旦温度升至90至100摄氏度,性能降频机制便会启动以防止GPU永久损坏。由于GPU机架吸收大量电能并转化为热能,散热成为关键问题。传统风冷系统的设计上限通常在30至40千瓦/机架,而AI集群轻松突破这一数值,100千瓦以上已成常态。若仅靠风冷处理100千瓦以上的机架,需要极端高速的气流,这不仅消耗巨额电力,还会恶化数据中心的电源使用效率(PUE)。对于大型AI集群而言,单纯依靠风冷实现“飓风级”气流是不切实际的。

液冷技术依赖流体力学,通过冷板微通道迫使流体流经芯片进行散热。然而,驱动流体通过微通道所需的泵送功率日益成为运营商的限制因素。为缓解这一问题,部分操作转向将冷板直接安装于处理器下方或上方,以优化冷却效果并降低能耗。

(图片来源:Microsoft)

浸没式冷却也是提升GPU集群散热效率的重要手段。该技术利用液体蒸发或固-液相变的潜热来吸收高密度机架的热峰。专用介电流体直接接触高温GPU后沸腾成蒸汽,蒸汽上升至冷凝器遇冷液化,滴回池中循环往复。这种双相浸没冷却技术可降低高达40%的冷却能耗。

此外,闭环液冷系统逐渐受到关注。在这种系统中,循环液体冷却GPU,几乎无蒸发损失,无需频繁补充冷却液。例如,作为全球前三大数据中心运营商之一的微软,已在其新建数据中心部署闭环系统。该系统一次性注入水,随后在密封管道中循环吸收服务器热量,转移至空气冷却散热器降温后再循环,无需新鲜水源补给。尽管此类系统初期成本高昂且大规模推广尚需时日,但它展示了企业应对散热瓶颈的创新路径。

互联与板级限制

GPU集群依赖电铜或光学互连来共享数据、内存和工作负载。长期以来,电铜互连是行业标准,但高负载GPU工作流已将其推向物理极限。

电信号在传输距离超过2米时强度显著衰减,每当带宽需求翻倍,可用传输距离便减半,而庞大的GPU集群使得通信距离比以往更长。密集的铜互连还会产生电磁干扰,扰乱其他信号,迫使系统采用复杂的平衡措施,进而增加功耗。此外,GPU电路板上的铜板因电阻存在电源损耗问题,电流越大,发热越严重,对冷却能量的需求也随之增加。

鉴于此,数据中心所有者不得不转向光学互连,将数据转换为光脉冲传输。光纤电缆比铜缆更细,能在密集发热的GPU机架间创造更多空气流通路径。业界甚至正在从可插拔光纤向硅光子学或共封装光学(CPO)演进。目前,光学互连的成本远高于电铜,在某些GPU配置中成本高出7倍,但由于后者已达物理极限,短期内只能承受这一溢价。随着更多公司采用光学互连并投资规模化生产,成本有望逐步降低。

电网与变电站危机

电网连接是AI数据中心面临的最主要挑战之一。现有电网设计无法适应AI数据中心的快速增长,仅2021年至2025年间,全球新增容量达30吉瓦。激增的需求扩大了电网组件供应链的压力,引发了工程层面的严峻挑战。

例如,用于保障GPU集群安全供电的高压变压器出现供应短缺。截至2020年,变压器的等待时间已从6至12个月延长至目前的2至4年,远超昂贵的大型GPU集群所能承受的停机等待时长。

AI数据中心的大量负载使电网现有的功率因数校正系统不堪重负。GPU集群可在几秒内改变电力需求:前一秒低推理负载从电网获取稳定电力,下一秒高峰负载则索取过量电力。这种剧烈波动会产生复杂波形,导致变压器过热并影响电网稳定性,迫使电网运营商投入巨资建设缓解系统。

随着AI集群规模迈向千兆瓦级,开关设备的压力接近其容忍极限。服务这些巨型集群需要更大容量的变压器以降低电阻。若发生短路,磁场会对开关杆施加巨大力量,可能导致其弯曲或脱离机械支撑,引发结构性故障。无论是电网运营商还是独立数据中心电力网络,都无法容忍此类风险。

为应对电力瓶颈,业界探索了多种解决方案。首先,固态变压器(SST)应运而生。与传统基于磁场的变压器不同,SST利用高频电力电子和半导体技术降低电压。

(图片来源:多坎电力)

高频电子特性使SST能够主动调节电压和谐波,从而减少波动。其效率可达97%至99%,优于传统变压器的95%至97%。更重要的是,SST体积更小、重量更轻,便于物流和快速部署。

然而,SST也面临自身挑战。内部高频组件和供电芯片昂贵,通常是低频替代品的五倍以上。它们需要多个功率转换阶段(交流-直流和直流-交流/直流-直流),转换过程中的微小损耗使得达到峰值效率变得困难。内部组件产热快、老化迅速,维护要求高于传统变压器。

成本仍是主要障碍,SST的建造和维护费用远高于磁性变压器。但随着大规模生产投资的增加,成本有望随时间下降,促进AI GPU集群更快采用该技术。世界第二大变压器制造商西门子最近与德国科技公司Reinhausen合作,计划量产用于AI数据中心的模块化固态变压器,这仅是行业努力的一个缩影。

由于SST尚未能立即规模化应用,且传统变压器短缺导致排队时间漫长,AI数据中心所有者被迫采取自建措施。一些企业建立了自闭式发电和变电站系统为GPU集群供电。埃隆·马斯克领导的xAI公司增加了59台便携式天然气轮机,总容量超过400兆瓦。

部分数据中心所有者也在探索小型模块化反应堆(SMR),这是一种在现场通过核裂变产生电力的紧凑型反应堆,但目前仍处于概念阶段。SMR面临诸多限制,特别是与燃气轮机或可再生能源相比,其成本极高。

尽管如此,许多处于早期或晚期建设阶段乃至已建成的数据中心,仍在长时间排队等待电网连接。例如,在北弗吉尼亚州——全球最大的数据中心集群所在地(拥有570个设施且数量持续增加),新设施接入电网的等待时间长达14年。

总部位于美国的电网运营商在升级方面投入巨资(仅2025年就达2080亿美元,并在2025年至2030年期间计划投资1.1万亿美元,据爱迪生电气 Institute 数据),但仍难以满足不断增长的数据中心需求。解决电网瓶颈不仅需要更多投资,还需要新技术来降低数据中心的能源消耗。

下一代计算部署的现实

综上所述,电网、散热和GPU互联瓶颈正将下一代AI计算部署推向极限。这些严重的物理和技术挑战需要创新方法来应对,而行业内已涌现出多种解决方案。

在电网方面,运营商转向固态变压器以实现主动电压调节和波形控制,保持电力系统稳定;部分GPU集群运营商在等待本地电网连接时构建自有发电系统。

针对散热瓶颈,GPU集群运营商利用直接安装在GPU上的冷板而非传统方式,以更低能耗维持冷却。相变机制同样发挥作用,液体蒸汽从GPU机架吸收热量并将其带走,再凝结回液体循环使用,可减少高达40%的能源需求。

微软通过实施闭环液冷系统尝试重新定义散热标准,使用冷却剂在密封管道网络中持续循环,最小化补充量。然而,由于GPU需求持续增长,闭环冷却系统比开环系统更难扩展,且在电机和散热器风扇同时运行时噪音更大。环境噪音不仅是技术限制,也是实际考量。闭环系统成本更高,但随着采用率提升,成本有望下降。

在电路板层面的互联限制上,公司正从电铜转向光纤电缆,因为后者在长距离数据传输中更快、更可靠,尽管成本更高。GPU制造商正致力于将光学电路直接嵌入芯片中。

尽管面临重重挑战,AI数据中心仍在快速增长,仅北美地区就有66吉瓦的新容量正在建设中。展望未来,该领域动态频发,企业克服电力、热力和互联瓶颈的各种尝试令人瞩目。

评论 0

0/500

评论需审核后展示,请文明发言

💬
还没有评论,来说两句

相关阅读