华为发布 Ascend 960 SuperPoD 路线图:超 1.5 万 NPU 互联,剑指英伟达
- Ascend 960 系列通过扩大规模、增加内存带宽及升级互连技术提升算力
- UnifiedBus 架构连接数千处理器,旨在降低 AI 系统内部通信瓶颈
- Atlas 960 路线图最高支持 15,488 个处理器,互连带宽达 34PB/s
华为正加速扩展其 Ascend(昇腾)平台,推出更大规模的计算系统以支持参数量高达 10 万亿的 AI 模型。面对硬件限制,华为采取“以量换质”策略,通过 UnifiedBus 互连架构连接处理器、内存和存储,降低通信开销,从而在集群层面弥补单芯片性能与英伟达产品的差距。

Atlas 960 SuperPoD:算力与规格全面升级
根据华为公布的 Atlas 960 SuperPoD 路线图,该系统最大配置可包含 15,488 个 Ascend 960 处理器,较此前 8,192 个处理器的配置几乎翻倍。
在性能指标上,华为宣称该系统可提供 30 EFLOPS 的 FP8 算力和 60 EFLOPS 的 FP4 算力,内存容量达到 4,460 TB。其互连带宽提升至 34PB/s,预计训练性能可达每秒 1590 万 tokens。
华为副董事长兼轮值董事长徐直军表示:“我们正在以一年一代的节奏发展 Ascend 芯片系列。”公司计划于 2027 年第一季度推出 Ascend 960DT,同年第三季度推出 960PR。这两款产品将比原定计划提前发布,且性能改进已超出最初预期。此外,华为还预告将于 2028 年和 2029 年分别推出 Ascend 970 和 980 芯片,届时不仅计算规格将继续翻倍,整体性能也将有显著提升。
UnifiedBus 与 Hi-ONE 光技术:构建高效互联底座
UnifiedBus 是华为专为大型 AI 计算系统设计的互连架构,用于连接处理器、内存及其他组件。在 Atlas 960E 变体中,该架构成功连接了 4,096 个 NPU,使其能够在 SuperPoD 环境中访问共享内存。
为进一步提升传输效率并降低能耗,华为将 UnifiedBus 与 Hi-ONE 光学技术相结合,采用近封装光学(NPO)方案,将光学组件直接放置在处理器附近。这种设计减少了对传统外部光连接的依赖,使数据能在数千个处理器间高速传输。
数据显示,Atlas 960E 使用约 5,500 个 Hi-ONE 单元即可替代传统方案中的约 48,000 个 800G 光模块,这一改变可在处理器互连系统中节省超过 550 千瓦的功耗。
在计算能力方面,Atlas 960E 提供 8 EFLOPS 的 FP8 性能,支持多达 10 万亿参数的模型训练。该架构具备极强的扩展性,可连接至包含 512,000 个 NPU 的超级集群,最终支持百万级处理器配置。





