AI训练突破单中心限制,转向跨地域分布式集群

Google、微软等巨头正将AI训练转向跨地域分布式集群。因单中心难以满足万级GPU协同及未来4-16GW电力需求,网络同步延迟成为关键瓶颈,互联架构旨在突破物理边界限制。

大规模人工智能模型的训练已突破单一数据中心的物理边界,转向跨地域的分布式集群架构。Google 确认其 Gemini 模型在多个地点的集群中进行同步训练;Microsoft 将威斯康星州和格鲁吉亚州的人工智能数据中心互联,构建起一台分布式人工智能超级计算机;AWS 通过广泛的领域连接其人工智能计算集群,支持 Anthropic 构建 Claude 模型;Meta 则建立了高容量数据中心互连以支撑模型培训需求。此外,近期宣布的跨云训练与私有互连方案显示,Azure 可能在今年晚些时候跟进这一趋势。

网络延迟直接转化为计算延迟

这种地理范围的扩展主要源于单个数据中心或校园集群在应对新一代模型巨大的计算和功率需求时面临的瓶颈。据思科估计,当前的训练模型可能需要数以万计的 GPU 集群协同工作。Epoch AI 的研究人员预测,到 2030 年,最大规模的单次训练运行将消耗 4-16GW 的电力。分布式计算使得超大规模云服务提供商和数据中心运营商能够在拥有更充足电力供应、更多可用空间以及较少规划约束的地点进行基础设施建设。

在大语言模型(LLM)的核心,是一个包含数十亿个数值参数或权重的神经网络。训练过程涉及将一批数据输入模型以生成预测,系统随后测量误差并计算权重应如何调整,更新权重后重复该过程。在现代模型规模下,这项工作分布在数千个 GPU 及其他加速器上,如 AWS Trainium 和 Google TPU。虽然不同的 GPU 可以处理独立的数据批次或模型的不同部分,但它们无法完全独立运作:在进入下一阶段的训练前,必须在特定时刻交换结果并完成同步。

网络在加速器之间传输的主要不是用于训练的文本或图像数据,而是大量的数值信息,如梯度和中间结果。数以千计的加速器需要同时交换并结合这些数据。思科 One 架构团队的 Ramesh Sivakolundu 解释道:“如果你观察任何培训工作,它基本上是计算和同步的重复。”即计算权重,将这些权重与集群中的每个 GPU 同步,然后重新开始计算。几千个加速器可能在完成一个计算阶段的同时开始通信,这可能导致“内置”问题,即大量发送者汇聚于同一目的地,流量速度超过下一链路处理能力。

核心挑战在于同步机制。在同步训练工作中,一组 GPU 不能忽略较慢的组而独立继续;只有当整个网络的交换完成后,参与的 GPU 才能进入下一阶段。因此,网络延迟直接转化为计算延迟。“你不希望网络成为培训过程中的瓶颈,”Sivakolundu 表示。虽然并非每次网络拥堵或数据包丢失都会导致训练完全停止,但延迟或丢包可能需要重新传输,延长集体通信操作时间,迫使其他加速器等待。更严重的故障甚至可能导致训练回滚至保存的检查点。

关于不同类型的互连,思科产品管理总监 Itamar Gold 指出:“在单个数据中心内,你可以假设已经建立了一个完整的网络,将 GPU 架与你计划的带宽连接起来。”他的观点强调,通过跨越地域协调的人工智能基础设施,对网络提出了新的要求。

评论 0

0/500

评论需审核后展示,请文明发言

💬
还没有评论,来说两句

相关阅读