DeepSeek 与华为近日联合发布了一套开源编程工具,旨在支持华为 Ascend AI 芯片的开发工作。此举意在降低对 Nvidia 软硬件生态系统的依赖。据路透社 9 月 30 日报道,该工具集包含用于人工智能计算及芯片间通信的开源库,并升级了对高级编程语言 TileLang 的支持。

DeepSeek 指出,这套由华为提供全面技术支持的工具,核心目标是在简化编程流程的同时,帮助开发者充分挖掘硬件性能。双方还针对由 128 个 Ascend 950 芯片组成的超级节点系统进行了计算与通信优化。这一优化解决了在多个加速器上运行大型 AI 负载时的两大关键需求:确保单芯片内的高效计算,以及实现芯片间数据的快速传输以维持处理器的高占用率。
此次发布的库主要包括 DeepGEMM-Ascend 和 DeepEP-Ascend,两者均在 Ascend 950 硬件上完成开发与测试。其中,DeepGEMM-Ascend 负责处理矩阵乘法及 DeepSeek 模型中的其他计算任务,支持 BF16、FP8 和 FP4 操作。该库沿用了 DeepSeek 现有 DeepGEMM 库的编程接口,使得开发者在迁移至 Ascend 平台时能够保留熟悉的 API。DeepEP-Ascend 则专注于训练和推理过程中的通信管理,包括混合专家模型(MoE)中的数据路由及输出整合。
TileLang 作为一种更高级别的编程层,为编写优化内核提供了便利。DeepSeek 将其描述为一种比 Nvidia CUDA 更简单的编程模型,旨在提升开发效率并简化代码逻辑。尽管 TileLang 此前已支持 Nvidia 及其他硬件,并为华为 Ascend 处理器提供了早期适配器,但 9 月 30 日的更新正式加入了对 Ascend 950 的支持,涵盖代码生成、自动调度和同步功能。
上述工具均构建在华为现有的 CANN 软件平台之上,该平台为 Ascend 上的 AI 工作负载提供基础架构支持。长期以来,Nvidia 凭借成熟的 CUDA 编程环境和针对其 GPU 优化的库,构建了强大的软件生态系统,这也是其在 AI 计算领域的主要优势所在。虽然 DeepSeek 的新工具为开发者优化华为硬件上的工作负载提供了新途径,但 TileLang 的多平台兼容性意味着该语言对 Nvidia GPU 用户依然具有实用价值。
此次发布距离华为推出下一代人工智能处理器及超级节点系统仅两周时间。华为方面表示,预计其 AI 系统将在 2027 年广泛应用于模型训练。目前,两家公司已在 DeepSeek 的 V4 模型上进行合作,该模型于 4 月以预览形式发布,并支持华为 Ascend 芯片。华为确认,其 Ascend 950 超级节点完全支持 V4 型号,且相关芯片已被用于较轻量的 V4-Flash 型号的部分训练工作。





