
一、六件套清单对应有实证但只到接口层2026 年 9 月 30 日DeepSeek 通过官方公众号宣布开源面向华为昇腾算力平台的基础设施组件官方称所有组件与此前面向英伟达平台的组件一一对应。完整清单是六件套TileLang昇腾后端、TileKernels、DeepGEMM-Ascend、DeepEP-Ascend、FlashMLA、DeepSelect——负责 MoE 跨设备通信的 DeepEP 就是分布式通信库的对应物别漏了它。一一对应在仓库层面有实证但只到接口层TileKernels 里每个算子都是*_kernel.py共享*_cuda.py*_asc.py三件套运行时自动选后端DeepEP-Ascend 的公共接口与英伟达版对齐训练和推理共用同一套 APIFlashMLA 在同一仓库内构建期自动探测平台。但API 对齐之下有一处错位。简单说接口能对上数据在内存里的摆法不一样。打个比方插头形状一样插上去能通电但电压和零火线顺序不同直接插可能烧板子。具体到工程DeepGEMM 低精度计算的缩放因子K 维的 UE8M0 在昇腾上要成对打包进 int16、按 MN-major 存储。调用代码可以原样复用但权重数据的物理排布必须重新适配。清单对应的是接口契约不是内存现实——平移是真的但平移的是接口不是数据。二、真正的故事不是迁移是套利这次开源最深的一层逻辑被 DOIT 点破DeepSeek没有把 CUDA 当成要攻克的堡垒而是把它当成要架空的地基。注意不正面攻克不等于不拆——架空 CUDA 这个默认地基之后墙的承重会松动。拆开看这是一个标准的生态套利第一步TileLang 先在英伟达平台上被充分验证——V4 系列训练绝大多数算子基于 TileLang 实现生态、文档、用户心智都在 CUDA 世界积累第二步以新增后端的方式落到昇腾上开发者留在原地只是硬件选项多了一个。时间上有一个值得咂摸的间隔V4 于 2026 年 4 月发布时即宣布在昇腾 NPU 上完成了细粒度专家并行方案的初步验证EP 加速 1.50–1.73 倍但 DeepSeek 同时声明训练仍使用合规渠道获得的英伟达 GPU从 4 月方案验证到 9 月全栈开源隔了整整五个月。有理由推测——但暂无公开证据佐证——这五个月不是打磨性能的充裕期而是底层工程固件、CANN 版本、编译器后端与华为深度耦合的磨合期这也解释了为什么华为对这次开源的贡献被表述为毫无保留。套利有另一面绑定。TileLang 的昇腾后端不是翻译层它针对 Cube 矩阵单元与 Vector 单元实现专用编译转换、调度与同步。假设 960 代际调整了 Cube 单元的累加器布局代码生成模板大概要改——小时级但累加器布局直接决定流水线 stage 的切分和同步原语的使用调度器大概率要重写——周级甚至月级。中立不是一次架构决策而是跟随华为每一代硬件持续投入的工程状态。模型能力被折算成了抽象层的标准制定权DeepSeek 在做的事是把用哪个后端从一道长期学习成本极高的选择题变成编译期的一个选项——代价是与昇腾硬件代际的同步绑定。三、99.8% 成了宣传口径里的常客一个被精心挑选的峰值DeepGEMM-Ascend 官方 README 的完整性能表如下测试条件是昇腾 950DT、CANN 9.20、冷 L2 缓存、单一形状 4096×7168×16384类型算力硬件上限利用率BF16×BF16431 TFLOPS43299.8%FP8×FP886186599.5%FP8×FP486186599.5%FP4×FP41701173098.3%只有 BF16 那一格是 99.8%但这个数字被反复引用成了宣传口径里的常客。它的适用边界有三条限定昇腾 950 单一芯片代际其他代际支持尚未确立、限定 CANN 9.20 单一软件版本、限定单一测试形状。另一个组件的条件更苛刻DeepEP-Ascend 报出的 373–375 GB/s dispatch 带宽基于的是手动配置的 PoC HDK 与未公开固件商用 HDK 要到 10 月中旬才发布——这组带宽数字暂不纳入比较。此外DeepGEMM 的 API 兼容性声明本身也标注着未经独立测试。FlashMLA 的数字反而更可信prefill 410 TFLOPS峰值 95%、decode 360 TFLOPS83%——decode 掉到 83% 说明访存瓶颈真实存在这个不完美比 99.8% 更像真的。一句话99.8% 证明的是软件榨取单芯片的效率不证明昇腾 950 比英伟达最新芯片强——横向对等的公开基准目前仍不存在。四、主战场不在单卡在机柜之间MoE 每个解码步都要做一次专家并行的 all-to-all 通信通信带宽直接决定加速器利用率。这是 DeepEP 成为六件套战略核心的原因也是 128 卡超节点必须与通信库联合设计的原因。硬件侧的底牌是双方联合定义的 SuperPoD Flex128 卡一级 scale-up 网络 3.2 Tbps二级 scale-out 至 256K 卡配套 ASC-COMM 通信算子库与大 EP 低延迟推理、长上下文 KV 池化等 CANN 社区 recipe。华为同时宣布 960DT 训练芯片提前至 2027 年一季度。给这套机柜叙事一个普通读者能理解的参照系券商测算达到同等算力相比英伟达方案华为方案需要约 3.2 倍的芯片数量和约 2.3 倍的系统功耗采购侧的锚点是中国移动 2026–2027 年超节点集采——6208 张加速卡、折合 776 套设备最高投标报价约 20.7 亿元。另起地基的真实代价是用规模、功耗和资本开支换生态自主。行业竞争的计量单位正在从单卡变成机柜机柜级互联的技术胜负手是通信库而通信库的复用障碍是另一回事——DeepEP-Ascend 尚未附许可证。五、生态博弈英伟达生态的墙没有被正面推倒但默认选项地位已被侵蚀先把英伟达生态的墙看成三层心智层写 GPU 代码默认 CUDA就像写网页默认 JavaScript、迁移层代码、工具链、调优经验全绑在 CUDA 上、锁定层买了英伟达的卡就只能在 CUDA 生态里——而 CUDA 是这堵墙的默认地基。DeepSeek 这次动的是心智层TileLang 让写算子不再默认等于写 CUDA kernel一个开发者写*_kernel.py运行时自动选*_cuda.py还是*_asc.py新一代开发者的肌肉记忆可能不再是从__global__开始的。数字的对比也要选对口径一边CUDA 有约四百万开发者二十年沉淀的工具链、文档与问答社区另一边按华为发布会自己公布的口径CANN 社区月活开发者约 5,200——这里指的是官方开发者社区的月活而非昇腾生态的实际开发者总数。两者不是同一口径不能直接比较但即便只看活跃指标差距方向仍然明显。侵蚀会不会从推理蔓延到训练链条是这样的推理部署相对标准化、硬件选择弹性大、成本敏感是墙最薄的一段六件套里 FlashMLA、DeepSelect 正是打在这里推理侧沉淀的 TileLang 算子和工程经验与训练框架自定义算子共享同一套抽象当算子层与硬件解耦训练框架更换后端的边际成本随之下降。推理场景的硬件弹性又直接反映在每百万 token 的 TCO 上。生态战争最终要在成本曲线上见分晓。英伟达生态的墙不会被一次开源推倒但 CUDA 的默认选项地位正在被一种更安静的方式侵蚀——这才是真正的拆。六、从能编译到能调优隔着生态最贵的一段路硬件限定为昇腾 950 系列软件栈要 CANN 9.20 torch_npu Python 3.10 C20需要克隆源码、运行develop.sh链接头文件、再 pip 安装DeepEP 的完整性能要等 10 月中的商用 HDK跑完整模型则依赖社区维护的 vLLM-ascend。六件套给的是工具不是工具链没有 Nsight 对等的性能分析器没有成熟调试器调优仍要下沉到 Ascend C。社区里CANN 多次重构、版本混乱、门槛高的吐槽指向同一个缺口——从能编译到能调优隔着生态最昂贵的一段路。当前可及性是算子可用、栈可用、全模型推理仅实验可用、生产级复制暂不可复现。对一个开发者而言能不能跑通一次推理远比99.8% 的峰值算力重要。七、三块未砌牢的砖数据布局、工具链、第三方复现第一块砖是数据布局。第一节所述的错位尚未看到公开的通用消除方案UE8M0 打包与 MN-major 存储意味着任何跨平台权重迁移都要做物理排布适配而API 兼容的声明本身未经独立测试。调用代码零改动的前提是权重数据先过一道手工的坎。第二块砖是工具链。第六节所述的缺口同样没有补齐时间表没有性能分析器没有成熟调试器vLLM-ascend 仍靠社区维护。工具可以由六件套交付工具链只能由生态积累——这是用钱和代码都换不来的部分只能靠时间。第三块砖是第三方复现也是最关键的一块。截至 10 月 1 日的公开信息六件中唯独 DeepEP-Ascend 未附许可证文件其余五件均为 MITDeepEP-Ascend 在许可证明确前第三方不能合法复用。而全栈复现又绕不开 DeepEP-Ascend——它是六件套里与超节点硬件耦合最深的通信核心。值得追问的不是是否疏忽而是为何偏偏是通信库DeepEP 与超节点硬件耦合最深、最依赖底层指令暂时的缺证更像一种法律或商业保护姿态。而只有当与 DeepSeek、华为均无利益关系的第三方在公开市场采购的硬件上复现出可审计的生产级结果时一切生态拐点的表述才站得住在那一天到来之前都应是试探性的。结语回到地基这个隐喻接口契约这一层已经对齐算子效率接近封顶但数据布局、工具链、第三方复现三块砖还没砌牢。另起地基的人手里已经有了路线图而第三方复现这一环仍卡在 10 月中的商用 HDK 和 DeepEP-Ascend 的许可证上。国产算力多了一个开发与实验可用的选项但还不是一个无脑替换的选项。而真正的验收标准只有一个无利益关系的第三方在公开市场采购的硬件上复现出可审计的生产级结果。