DeepSeek 近日宣布推出一套针对华为 Ascend(昇腾)加速器的基础设施组件,并同步开源了两个全新代码库。这一举措被视为中国科技企业在深化合作背景下,试图构建独立于 Nvidia CUDA 生态之外的软件栈的重要尝试。

新增核心组件:矩阵乘法与通信库
此次发布的核心是两个全新的 GitHub 存储库:
- DeepGEMM-Ascend:用于处理矩阵乘法运算。
- DeepEP-Ascend:专为混合专家模型(MoE)设计,负责全对全通信任务。
除了上述新项目外,公告中还提及了 TileKernels、DeepSelect 和 FlashMLA 等组件。根据 FourWeekMBA 对 GitHub 创建日期的核查,这些并非全新项目,而是现有工具针对 Ascend 平台进行的更新适配。
技术局限性与硬件要求
目前发布的软件存在明确的硬件限制。DeepGEMM-Ascend 要求运行在 Ascend 950 系列芯片上,并依赖 CANN 9.20 版本;而 DeepEP-Ascend 则需要具备 UBMEM 连接的 Ascend 950 芯片。这意味着这些工具主要面向华为内部工程师及少数拥有特定硬件配置的中国人工智能实验室,而非广泛的大众开发者。
值得注意的是,路透社报道指出两家中国公司正在深化合作关系。然而,对于仍在大量使用 Nvidia 工具的工程师而言,这些新发布的开源组件是否具有实际影响力仍存疑。
关于 TileLang 的定位澄清
据博社分析,TileLang 既非新品,也非 DeepSeek 独有产品。它早在 2025 年 1 月就已开源,其 Huawei Ascend 适配器则于 2025 年 9 月 29 日在外部存储库 tilelang-ascend 中发布。虽然 TileLang 支持 Nvidia 的 CUDA 后端,但也同时支持华为 Ascend 作为生态系统后端。因此,TileLang 更应被视为一个共享抽象层,而非专门针对 Nvidia 的竞争武器。
降低切换成本:API 兼容性策略
在 Nvidia 芯片出口受限的背景下,华为 Ascend 承担着替代重任。DeepSeek 的策略重点在于降低开发者的迁移成本,而非单纯追求性能超越。
具体表现为:
- DeepGEMM-Ascend 保持了与其 CUDA 对应版本相同的 Python 包名和 API 形状。
- DeepEP-Ascend 将其公共缓冲区接口与 Nvidia 版本保持一致。
这种设计旨在让大多数开发人员能够以最小的代码修改量从 Nvidia 生态过渡到华为生态。
社区反响与挑战
尽管战略意图明确,但目前的社区数据表明普及之路依然艰难。截至发稿时,DeepGEMM-Ascend 仅获得 515 颗 GitHub Star 和 39 个 Fork,相比之下,原版 DeepGEMM 拥有 8,522 颗星和 1,359 个 Fork。DeepEP-Ascend 的情况类似,远落后于拥有超过 10,200 颗星的 DeepEP。
此外,华为面临的历史声誉问题也不容忽视。《金融时报》曾报道,部分研究人员反映 CANN 使得 Ascend 芯片难以使用且稳定性不足。Epoch AI 的报告也指出,华为不得不向百度、讯飞等主要客户派遣工程团队,协助移植 CUDA 训练代码以维持部署运行。
DeepSeek 发布生产内核级别的开源工具,在一定程度上回应了外界对 Ascend 生态易用性的质疑。然而,这些工具目前仅在概念验证硬件套件上运行基准测试,且被明确指出并非公开发行版本,其实际落地效果仍有待观察。





