
在 128 颗昇腾 950 组成的超节点上把每颗芯片的算力榨干同时让芯片之间的数据传得足够快——这两个决定大模型能否真正跑起来的关键环节DeepSeek 和华为现在把优化代码全部公开了。据路透社 9 月 30 日报道DeepSeek 发布了一批与华为联合开发、面向昇腾 AI 芯片的开源编程工具开发过程中华为提供了全程支持。这批工具既包括 AI 计算库和芯片间通信库也包含高层编程语言 TileLang 对昇腾的原生支持。计算与通信两块最难啃的骨头在多加速器上跑大模型本质上要同时满足两个条件每颗芯片高效完成计算以及芯片之间的数据搬运快到足以让处理器不空转。这次发布的两个库恰好一一对应而且都在昇腾 950 硬件上完成开发与测试。DeepGEMM-Ascend 负责矩阵乘法等 DeepSeek 模型中的核心计算支持 BF16、FP8、FP4 三种精度格式。它沿用了 DeepSeek 既有 DeepGEMM 库的同一套编程接口开发者迁移到昇腾时不必重学 API。DeepEP-Ascend 负责训练和推理过程中的通信包括把数据路由到混合专家MoE模型的不同专家再将其输出汇总回来。简单说前者解决“算得快”后者解决“传得动”。TileLang 补上昇腾 950 原生支持TileLang 提供的是编写优化算子所需的高层编程层。DeepSeek 形容它相比英伟达 CUDA 提供了“更简单的编程模型”目标直指开发效率和代码简化。这门语言此前已支持英伟达等硬件也早有面向昇腾处理器的适配器9 月 30 日的更新补上了对昇腾 950 的原生支持涵盖代码生成、自动调度与同步。值得注意的是TileLang 的多平台特性并未被放弃——它依然对英伟达 GPU 可用。换句话说这套工具是给开发者多开一条路而不是把原有的门焊死。软件栈才是芯片能不能卖出去的关键芯片的算力参数再亮眼如果开发者写不出高效算子、跑不通分布式训练硬件就只是参数表上的数字。围绕 CUDA 建立的库、编译器与十几年调优经验正是英伟达最难被复制的部分。DeepSeek 这次把自家模型生产中真正用到的计算库和通信库开源等于把一套经过验证的参考实现直接交到开发者手里。这批工具建立在华为既有的 CANN 软件平台之上后者是昇腾运行 AI 负载的底层基础设施。更关键的是接口习惯。DeepGEMM-Ascend 与既有 DeepGEMM 共用一套 APITileLang 又同时对英伟达 GPU 可用——开发者可以在同一套代码习惯里切换硬件后端迁移成本被压到最低。发布距华为新芯仅两周时间点同样值得琢磨这次开源距离华为发布新一代 AI 处理器和超节点系统只有两周。华为表示预计其 AI 系统将在 2027 年被广泛用于模型训练。换句话说华为把“大规模上训练”的时间表押在了 2027 年而 DeepSeek 现在的开源动作正是为那个时间点提前铺路。两家公司的合作也不是从零开始。DeepSeek 的 V4 模型 4 月已以预览形式发布支持华为昇腾芯片华为称其昇腾 950 超节点完全支持 V4 模型V4-Flash 轻量版的部分训练同样用上了昇腾芯片。对国内开发者而言这次开源的实际价值在于迁往昇腾不必从零摸索接口熟悉、优化代码可查高层语言又保留了跨平台的选择权。