ARTICLE DETAIL

资讯详情

深耕网站建设与运营推广的一线实战洞察。

大语言模型技术 step by step 第21章 MoE:混合专家模型

大语言模型技术 step by step 第21章 MoE:混合专家模型 第21章 MoE混合专家模型学习目标理解 MoE 的核心思想与稀疏激活机制掌握 MoE 的架构设计与专家路由理解 MoE 的训练特性与负载均衡了解主流 MoE 模型与工程挑战Scaling Law 告诉我们模型越大效果越好但计算量也随参数线性增长。有没有办法放大容量而不等比例放大计算混合专家模型Mixture of Experts, MoE给出了答案用稀疏激活实现大容量、小计算。本章讲解 MoE 的原理、架构、负载均衡与工程挑战。21.1 MoE 的动机21.1.1 规模与效率的矛盾Scaling Law 指出增大参数量能持续提升性能。但稠密模型dense model的每个参数在每次前向都参与计算计算量与参数量成正比。这意味着要获得更强的模型就必须付出等比例的计算代价。矛盾在于我们想要大模型的容量参数多、能存储更多知识但不想支付大模型的计算成本每 token 计算量。21.1.2 稀疏激活的思想MoE 的解法是稀疏激活模型总参数量很大容量大。但每个 token 只激活其中一小部分参数计算量小。用路由机制为每个 token 选择最合适的专家处理。这样一个总参数量万亿的 MoE 模型每个 token 的计算量可能只相当于几百亿参数的稠密模型——以小计算撬动大容量。21.2 MoE 架构21.2.1 基本结构在 Transformer 中MoE 通常替换FFN 层为多个并行的 FFN专家 一个路由器输入 x | 路由器(Router) / | \ 专家1 专家2 ... 专家N (每个是一个FFN) \ | / 加权求和 | 输出专家ExpertNNN个并行的 FFN每个是一组独立的参数。路由器Router一个小网络为每个 token 计算分配到各专家的权重。21.2.2 路由机制最常用的是Top-k 路由路由器为 token 计算对各专家的得分选得分最高的kkk个专家处理通常k1k1k1或k2k2k2G(x)softmax(TopK(x⋅Wg,k))G(x) \mathrm{softmax}(\mathrm{TopK}(x \cdot W_g, k))G(x)softmax(TopK(x⋅Wg​,k))被选中的kkk个专家分别计算输出按路由权重加权求和得到最终输出。未被选中的专家不计算稀疏性的来源。例如 Mixtral 8x7B8 个专家每 token 选 2 个总参数 46.7B激活参数仅 12.9B。21.2.3 容量因子为平衡各专家负载每个专家有容量capacity上限每步最多处理一定数量 token。容量 (token 数 / 专家数) × 容量因子。超容量的 token 被丢弃或传递给下一层。容量因子调节负载与丢弃率的平衡。21.3 负载均衡21.3.1 负载不均衡问题MoE 训练的常见故障是负载不均衡路由器偏向少数专家导致热门专家过载token 被丢弃信息损失。冷门专家闲置参数浪费未充分训练。训练效率与效果下降。若不加约束路由器可能陷入赢者通吃——少数专家越来越强吸引更多 token其余专家越来越弱。21.3.2 辅助损失最常用的均衡方法是辅助损失auxiliary loss鼓励 token 均匀分配到各专家LauxN∑i1Nfi⋅Pi\mathcal{L}_{\text{aux}} N \sum_{i1}^{N} f_i \cdot P_iLaux​Ni1∑N​fi​⋅Pi​fif_ifi​实际分配到专家iii的 token 比例。PiP_iPi​路由器输出到专家iii的平均概率。当分配完全均匀时fiPi1/Nf_i P_i 1/Nfi​Pi​1/N损失最小。辅助损失以小系数α\alphaα如 0.01Switch Transformer 原文写作α⋅N∑ifiPi\alpha \cdot N\sum_i f_i P_iα⋅N∑i​fi​Pi​加权求和到主任务损失引导路由器均衡分配。21.3.3 其他均衡策略容量因子调整增大容量减少丢弃但增计算。噪声注入路由时加噪声增加探索避免路由固化。Expert Choice 路由反过来让专家选 token天然均衡。负载均衡损失的变体如 router-z-loss 稳定路由 logits。无辅助损失均衡DeepSeek-V3不用辅助损失而给负载不足的专家加动态偏置实时调整路由既均衡又不干扰主任务见 21.4.3。21.4 主流 MoE 模型21.4.1 Mixtral (Mixtral 8x7B)Mistral AI 的 Mixtral 是有影响力的开源 MoE8 个专家每 token 选 2 个。总参数 46.7B激活 12.9B。性能媲美更大的稠密模型如 LLaMA-2 70B但推理计算量小得多。21.4.2 GShard 与 Switch TransformerGShardGoogle, 2020探索大规模 MoE 的分布式设计奠定 top-k 路由与容量因子等基础组件。Switch TransformerGoogle, 2021每 token 只选 1 个专家k1k1k1极致稀疏扩展到万亿参数。这些工作验证了 MoE 在大规模下的可行性。21.4.3 DeepSeek-MoE 与 DeepSeek-V3DeepSeek 在 MoE 上持续创新从 DeepSeek-MoE 到 V3 逐步成熟。DeepSeek-MoE引入两项创新细粒度专家分割把每个专家再切小用更多更小的专家增加组合灵活性。共享专家设置一部分共享专家始终激活处理通用知识路由专家处理专门知识。DeepSeek-V32024将上述思想推向极致671B 总参数、37B 激活是当时最强的开源 MoE 之一。关键改进无辅助损失的负载均衡摒弃会损害性能的辅助损失改用动态偏置调整——给负载不足的专家在路由分数上加一个动态偏置促使其接收更多 token。偏置根据专家负载实时更新无需梯度既均衡又不干扰主任务。细粒度专家 共享专家的规模化大量细粒度路由专家 少量共享专家兼顾专门化与通用性。Multi-Token PredictionMTP训练时预测多个 token 提升效率推理时可用于投机解码。DeepSeek-V3 证明 MoE 在超大尺度下可兼顾效果与极低推理成本深刻影响了后续开源 MoE 的设计。其推理模型 R1 即基于 V3 训练第13章。21.4.4 国产 MoE 实践Qwen3-MoE、GLM-4.5 等国产模型在 MoE 上做了大量工程优化在训练效率与效果间取得平衡。MoE 正成为国产大模型的主流选择之一。21.4.5 2025-2026 年超大 MoE 的爆发2025-2026 年MoE 从一种选择变为开源前沿模型的默认架构一系列超大 MoE 涌现下述 2026 年型号规格截至 2026 年中据官方技术报告DeepSeek 系列从 V3671B/37B到V42026V4-Pro 1.6T/49B、V4-Flash 284B/13B支持百万 token 上下文持续在超大 MoE 与高效长上下文上推进。V4 采用混合稀疏注意力CSA/HCA7.7.4与 Muon 优化器把稀疏注意力产品化推理成本进一步压低。Llama 4Meta首次将 Llama 转为 MoE7.4.5标志主流开源基座完成稠密 → MoE 的迁移。Qwen3-MoE阿里235B 总参/22B 激活配合可切换的思考模式。Kimi 系列月之暗面从 K21T/32B到K32026持续迭代超大 MoE 与 agentic 能力。一个显著趋势是激活比激活参数/总参数持续走低从 Mixtral 的约 28%到 DeepSeek-V3 的约 5.5%再到 DeepSeek-V4-Pro 与 Kimi K2 的约 3%。这意味着用更小的单 token 计算量撬动更大的总容量。但代价是显存——所有专家参数仍需驻留显存21.6.1超大 MoE 的部署门槛反而更高。因此 2025-2026 年 MoE 的工程重点转向降低显存占用MLA 压缩、量化、稀疏注意力降长序列成本、专家卸载/路由优化21.6.3。MoE 与混合推理、Agent 能力的结合也成为新方向。21.5 MoE 的训练21.5.1 训练稳定性MoE 训练比稠密模型更易不稳定Top-k 的离散选择本身不可导主流实现Switch、Mixtral、DeepSeek的做法是对被选专家的 logits 做 softmax、以路由权重加权专家输出使梯度经权重回传到路由器Gumbel-Softmax、STE 等技巧则用于更彻底离散化的场景。负载不均衡导致部分专家训练不充分。初始化需谨慎避免早期路由固化。21.5.2 数据效率MoE 的稀疏性带来一个特点每个专家的有效训练数据更少只有被路由到的 token 才训练它。因此 MoE 通常需要更多总数据才能充分训练所有专家。数据多样性与充足性对 MoE 尤为重要。21.5.3 MoE vs 稠密模型同等计算量下MoE 效果优于稠密模型容量更大。同等参数量下MoE 训练更快每步计算少。MoE 的性价比在计算受限场景尤为突出。21.6 MoE 的推理挑战21.6.1 显存开销MoE 的致命弱点虽然每 token 只激活部分专家但所有专家的参数都要驻留显存因为不同 token 激活不同专家。因此 MoE 的显存占用由总参数决定而非激活参数。Mixtral 8x7B 总参数 46.7B显存占用接近 47B 稠密模型但计算量只有 13B 级别。这导致 MoE 推理显存重、计算轻对显存带宽敏感。21.6.2 通信开销专家并行下token 需路由到不同设备上的专家产生All-to-All 通信。这是 MoE 分布式推理的主要通信开销。21.6.3 推理优化专家卸载Offloading把不常用专家放到 CPU/磁盘按需加载牺牲速度换显存。专家缓存与预取预测即将使用的专家提前加载。专家剪枝移除少用专家降低显存。21.7 MoE 的分布式策略21.7.1 专家并行MoE 特有的并行把不同专家放到不同设备。前向时token 通过 All-to-All 路由到对应专家所在设备计算后再路由回来。专家并行与数据并行、张量并行组合形成 MoE 的混合并行策略。21.7.2 调度与通信两阶段 All-to-All先把 token 发到目标专家设备计算后再发回。负载感知调度尽量让各设备负载均衡减少等待。通信计算重叠隐藏通信延迟。21.8 MoE 的发展方向21.8.1 细粒度专家更多更小的专家提供更灵活的组合。DeepSeek-MoE 验证了这一方向的有效性。21.8.2 层级 MoE层级路由先粗分大类再细分专家提升路由效率与精度。21.8.3 MoE 与其他技术结合MoE 长上下文稀疏注意力 稀疏专家双重稀疏降成本2025 年 NSA 等原生稀疏注意力使这一组合落地。MoE 显存优化MLA 压缩、KV 量化、专家卸载共同应对超大 MoE 的显存压力。多模态 MoE不同模态用不同专家。MoE 对齐与 agenticSFT/DPO/RL 在 MoE 上的适配2025 年超大 MoE 普遍主打 agentic 能力。小结MoE 通过稀疏激活实现大容量、小计算是扩展模型规模的重要路径。它用路由器为每个 token 选择专家负载均衡是训练关键显存开销是推理瓶颈。随着 DeepSeek-V3无辅助损失均衡 细粒度共享专家等创新MoE 正成为大模型的主流选择。掌握 MoE 的原理与工程是理解当前大模型前沿的必备。延伸阅读Shazeer et al.Outrageously Large Neural Networks: The Sparsely-Gated Mixture-of-Experts Layer(2017)。Fedus et al.Switch Transformers: Scaling to Trillion Parameter Models(2021)。Jiang et al.Mixtral of Experts(2024)。DeepSeek-AI.DeepSeekMoE: Towards Ultimate Expert Specialization in MoE Language Models(2024)。Lepikhin et al.GShard: Scaling Giant Models with Conditional Computation(2020)。Yang et al.Qwen3 Technical Report(2025, arXiv:2505.09388) - 稠密与 MoE 双线布局。DeepSeek-AI.DeepSeek-V4: Towards Highly Efficient Million-Token Context Intelligence(2026, arXiv:2606.19348) - 1.6T/49B MoE、混合稀疏注意力。Moonshot AI.Kimi K2 / K3技术报告2025-2026- 超大 agentic MoE。
返回列表