华为近日宣布,其下一代 Ascend 900 系列人工智能加速器将优先满足中国国内市场需求,暂不面向国际市场全面推广。这一决策主要源于产能限制与国内需求的强劲增长。尽管即将推出的 Ascend 960 系列神经处理单元(NPU)在部分指标上可与 AMD 和 Nvidia 的现有 AI GPU 竞争,但鉴于全球范围内对该类非主流硬件的需求不确定性,华为选择聚焦本土。

产能受限与供应策略
据路透社报道,华为轮值董事长埃里克·徐(Eric Xu)在华为连接会议期间指出:“由于我们没有足够的产能来满足中国的需求。”他补充称,华为仅向“一些需求特别强的国家”提供有限产品,但未透露具体细节。
昇腾 NPU 性能路线图
华为本周发布了最新的人工智能加速器路线图,展示了 Ascend 960、970 和 980 NPU 相较于现有的 Ascend 910C 和 Ascend 950 系列在训练和推理性能上的显著提升。根据规划:
- Ascend 960DT 和 960PR:计划于 2027 年发布,FP8 训练性能提升至 2 PFLOPS,FP4 推理性能分别提升至 4 PFLOPS 和 8 PFLOPS。
- Ascend 970 和 980:预计在未来几年内推出,FP4 性能将分别提升至 14 PFLOPS 和 28 PFLOPS。
NPU |
FP8 性能 | FP4 性能 | 内存 |
存储带宽 | 互连带宽 | 目标发布时间 |
| Nvidia H200 | 4 PFLOPS | - | 141 GB HBM3E | 4.8 TB/s | 900 GB/s | 2023 Q4 |
| Nvidia B300 | 10 PFLOPS | 15/20 S/D PFLOPS | 279 GB HBM3E | 8 TB/s |
1.8 TB/s | 2025 Q4 |
| Ascend 950PR | 1 PFLOPS | 2 PFLOPS | 128 GB HiBL 1.0 | 1.6 TB/s | 2 TB/s |
2026 Q1 |
| Ascend 950DT | 1 PFLOPS | 2 PFLOPS | 144 GB HiZQ 2.0 | 4.0 TB/s | 2 TB/s |
2026 Q4 |
| Nvidia R200 | 17.5 PFLOPS | 35/50 T/I PFLOPS | 288 GB HBM4 | 19.2 TB/s | 3 TB/s |
2026 Q4 |
| Ascend 960DT | 2 PFLOPS | 4 PFLOPS | 288 GB |
9.6 TB/s | 2.2 TB/s | 2027 Q1 |
| Ascend 960PR | 2 PFLOPS | 8 PFLOPS | 192 GB |
2.4 TB/s | 2.2 TB/s | 2027 Q3 |
| Ascend 970 | 3.6 PFLOPS | 14 PFLOPS | 288 GB |
14.4 TB/s | 4.4 TB/s | 2028 |
| Ascend 980 | 7.2 PFLOPS* | 28 PFLOPS* | 384 GB |
38.4 TB/s* | 8 TB/s |
2029 |
*初步数据;S/D - 稀疏和密集;T/I - 训练和推断
系统级扩展与能效挑战
尽管新一代昇腾 NPU 相比前代产品在推理性能上有显著提速,但在原始算力方面仍大幅落后于英伟达上一代及当前一代加速器。例如,预计 2027 年发布的 Ascend 960DT FP8 训练性能为 2 PFLOPS,而英伟达 2023 年发布的 H200 已达 4 PFLOPS。Ascend 960PR 预计提供 8 FP4 PFLOPS 的训练算力,远低于英伟达 B300 的 15–20 NVFP4 PFLOPS。即便是目标定于 2029 年的 Ascend 980,其预计算力(7.2 FP8 PFLOPS 和 28 FP4 PFLOPS)也低于今年有望发布的英伟达 R200(17.5 FP8 PFLOPS 和 35/50 FP4 PFLOPS)。
这种巨大的单芯片性能差距迫使华为依赖大规模的系统级扩展而非单芯片性能来与英伟达竞争。然而,系统级扩展伴随着巨大的功耗,这使得华为下一代 Atlas SuperPoDs 和 SuperClusters 在能够获取 AMD 或英伟达硬件的市场中竞争力减弱。
华为目前处于一种矛盾的境地。一方面,其近封装光学(NPO)等集成技术释放了较旧工艺节点的产能,可用于 AI 平台的其他组件;另一方面,中芯国际(SMIC)在 7nm 和 6nm 级别节点上的量产能力限制,依然制约着华为 AI 硬件的供应,导致其难以完全满足需求。
值得注意的是,华为拥有多达 15,488 颗 Ascend 960 NPU 的 Atlas SuperPoD 集群可提供高达 30 FP8 EFLOPS 和 120 FP4 EFLOPS 的性能,远超英伟达 NVL72 集群(72-GPU 规模)的能力。但由于其每瓦性能预计将显著低于英伟达架构,此类硬件在中国以外的市场需求可能十分有限。因此,现阶段对华为而言,更合理的策略可能是通过云服务向学术和研究客户提供硬件访问权限,以推广其 CANN 软件栈,而非强行推进全球硬件销售。





