
想到之前梁文锋讲过TileLang解决的是CUDA卡脖子的问题之前DeepSeek V3训练的时候用的英伟达的卡和CUDA生态但这次V4就直接用TileLang生态直接在华为卡上跑解决了华为卡生态不好的问题是非常非常大的突破。这次开源的最核心组件TileLang for Ascend等于是给昇腾做了一套对标CUDA的算子开发工具链以后国产大模型可以直接基于TileLang 在华为卡上跑。大家离不开英伟达GPU其实核心之一在于CUDA它和GPU的关系相当于汽车电控系统和发动机的关系凡开发AI都要在CUDA上写算子和指令用它的工具包而且它不支持AMD、华为的GPU这就导致你必须用英伟达的卡来跑模型。后来北大几位研究员开源了tilelang不光适配各种GPU还能把CUDA 算子直接移植到昇腾上可以见当时的论文《TileLang : A Composable Tiled Programming Model for AI Systems》。因此华为在2025年9月开始支持昇腾接入TileLang从DeepSeek-V3.2-Exp开始用TileLang来训练模型算是TileLang的重度用户了。我在2026年华为HC大会上还看到了TileLang核心开发者王磊的讲座它的三层API分层确实比如CUDA开发简单很多现在已经支持DeepSeek、Qwen、FLA等开源模型算子而且基于昇腾NPU做了很多优化比如编译优化、存储栈。这次DeepSeek干脆直接开源V4实战的组件包括DeepGEMM、FlashMLA等整套的算子库分布式通信组件DeepEP等等于在TileLang社区基础上开放了一套高级能力直接把昇腾的TileLang生态提升了一个位次。引用DeepSeek官方的话这次是DeepSeek和华为共同的战果非常直接肯定。在面向昇腾平台的研发过程中华为团队给予了毫无保留的大力支持。双方紧密合作共同推进基于 昇腾 950 的 128 卡超节点方案、共同对计算与通信进行了深度优化。我们将持续推进技术创新与社区共同建设开放的软件生态、共同进步。附开源项目链接TileLang:https://github.com/tile-ai/tilelangDeepGEMM Ascend:https://github.com/deepseek-ai/DeepGEMM-AscendDeepEP Ascend:https://github.com/deepseek-ai/DeepEP-AscendTileKernels:https://github.com/deepseek-ai/TileKernelsFlashMLA:https://github.com/deepseek-ai/FlashMLADeepSelect:https://github.com/deepseek-ai/DeepSelect