ESRL:在 MoE 强化学习中的专家空间探索)
Expert-Space Exploration in MoE Reinforcement Learning论文地址https://arxiv.org/abs/2609.13058项目页面https://strawberrymaster111.github.io/esrl-project-page/学术交流922230617目录0. 一句话总结1. 背景MoE RL 中被忽视的探索维度2. 核心观察路由扰动像 “另一种温度”2.1 专家利用率扰动让专家利用更广2.2 Next-token 分布路由变化会传播到输出2.3 序列级多样性提升但直接扰动会伤质量3. ESRL 方法三大关键组件3.1 组件 1自适应噪声调整3.2 组件 2锚定专家采样3.3 组件 3Rollout Routing Replay4. 实验多 MoE 骨干、多任务全面领先4.1 实验设置4.2 主结果数学推理4.3 科学和代码任务4.4 在 Instruct 模型上继续提升5. 消融与分析为什么 ESRL 有效5.1 采样温度鲁棒性5.2 Group大小与 informative groups5.3 噪声尺度与专家锚定5.4 自适应噪声 vs 固定噪声5.5 锚定专家数量与候选池大小5.6 路由参数如何塑造准确率–多样性权衡5.7 扰动位置5.8 解耦专家探索与 token 探索5.9 专家负载更均衡6. 结论与启发0. 一句话总结ESRL 把 MoE 中原本固定的专家路由从 “架构组件” 变成了 RL 的探索空间通过锚定高置信专家、自适应扰动候选专家、并在训练时回放replayrollout 路由让模型在稀疏计算路径层面获得额外多样性从而提升数学、科学和代码任务表现。1. 背景MoE RL 中被忽视的探索维度现在 LLM 后训练越来越依赖 RL尤其是数学、代码等可验证任务。GRPO 等组相对策略优化方法已经成为主流。但 MoE 模型的 RL 研究大多聚焦于优化稳定性训练效率路由回放、负载均衡奖励设计而专家选择本身通常被当作固定组件。问题在于MoE 中每个 token 会动态路由到稀疏专家集合不同专家路径会直接决定下一 token 分布。也就是说专家路由本身就是一条潜在的探索维度。传统 MoE rollout 使用确定性的 Top-K 路由。同一 prefix 会反复激活同一批专家备选的alternativerouting paths 没有被显式探索。虽然 token 采样可以间接改变后续路由但它并没有在相同 context 下主动探索不同专家路径。于是论文提出核心问题Can routing-level perturbation provide an architecture-aware exploration mechanism for MoE LLM reinforcement learning beyond conventional token-level sampling?路由级扰动能否为 MoE LLM RL 提供一种超越 token 采样的、架构感知的探索机制2. 核心观察路由扰动像 “另一种温度”论文从多个层面分析了路由扰动的影响。2.1 专家利用率扰动让专家利用更广在 Qwen3-30B-A3B-Base 上注入高斯噪声到 router logits随着噪声尺度 σ 增大all-token 专家变更率、top-1 专家变更率上升top-K 专家 Jaccard 相似度下降专家负载 CVCoefficient of Variation变异系数 降低专家激活更均衡。说明路由扰动确实让模型探索了 Top-K 之外的专家路径。【变异系数Coefficient of VariationCV的核心作用是衡量数据的相对波动程度也就是 “变化相对于平均水平有多大”。公式CV σ / μ其中σ 表示标准差衡量绝对波动μ 表示平均值。标准差只能看绝对波动。比如A 组平均 100标准差 10B 组平均 10标准差 2B 的标准差更小但相对波动其实更大A 的 CV 10/100 0.1B 的 CV 2/10 0.2所以CV 更适合比较不同量纲、不同均值的数据波动大小。】2.2 Next-token 分布路由变化会传播到输出相同 prefix、固定模型参数下标准 Top-K 下的 top-1 token在扰动路由下排名下降标准与扰动 top-20 token 集合 Jaccard 相似度下降PCA 投影显示 first-token logits 出现系统性位移和扩散。结论专家路径变化会改变下一 token 分布连接了 “专家探索” 和 “输出多样性”。2.3 序列级多样性提升但直接扰动会伤质量用 Self-BLEU 衡量多样性温度越高Self-BLEU 越低多样性越高RL 训练越往后策略越集中需要更高温度才能维持同样多样性直接路由扰动也有类似温度的效果但无约束路由扰动会在相同 Self-BLEU 下带来更低准确率可能激活不合适的专家。因此需要一种受控的专家空间探索。3. ESRL 方法三大关键组件ESRLExpert-Space Exploration Reinforcement Learning专家空间探索强化学习不改变 reward也不改 policy optimization objective而是在 rollout 阶段扩展专家路径探索。3.1 组件 1自适应噪声调整不同 token、不同层的 router 分布差异很大。router 分布很尖锐专家选择置信需要更强扰动才能改变专家router 分布已经很分散再加噪声容易过度扰动。因此 ESRL 根据 router entropy 调整噪声强度。先归一化 router logits再计算归一化 router 熵噪声尺度直觉路由越尖锐H 越低扰动越强路由越不确定H 越高扰动越弱。3.2 组件 2锚定专家采样直接扰动所有专家可能激活 “不匹配专家”降低 rollout 质量。ESRL 将 K 个激活专家拆成K K_anchored K_exploreAnchored experts保留高置信专家直接由原始 logits Top-K 选出Explore experts只在候选池中加噪采样。锚定集合候选池对候选池加噪选出探索专家最终激活专家关键细节扰动 logits 只用于选择专家不用于计算聚合权重。权重仍由原始 router logits 计算最终 MoE 的输出为这样做既改变了离散计算路径又保留了原始 router 对已选专家的相对置信度。3.3 组件 3Rollout Routing Replay如果训练时重新计算 Top-Krollout 时探索到的专家可能在训练时不再被激活导致探索效果丢失。因此 ESRL 采用Rollout Routing Replayrollout 时记录每条轨迹每个 token、每个 MoE 层的专家集合 Z^i训练时绕过 Top-K固定使用 rollout 专家集合但 gating weights 由当前 router logits 重新计算最终 MoE 的输出为这样rollout 探索到的专家能在训练中收到梯度减少 rollout policy π_roll 和当前 policy π_θ 之间的路由不匹配稳定重要性采样比率。最终仍使用 GRPO 做策略优化但计算路径与 rollout 保持一致。4. 实验多 MoE 骨干、多任务全面领先4.1 实验设置模型模型路由结构Qwen3-30B-A3B-Base激活 8/128 expertsSigma-20B-A0.5B每 token 激活单个专家Moonlight-16B-A3B激活 6/64 experts 2 shared experts训练优化器GRPO数据Math 训练集batch size256每个 prompt 生成 8 个 response训练 300 iterationsrolloutT0.8top-p0.95最大 8192 tokens评估数学OlympiadBench、AIME、AMC、MinervaMath科学GPQA、MMLU-Pro、MMLU-Redux代码LiveCodeBench v6基线GRPO、GSPO、GRPO-R3、Aux-Loss、N-Sampling、RO-GRPO。4.2 主结果数学推理说明 ESRL 对 top-K、top-1、shared-expert 等不同 MoE 路由结构都有效。4.3 科学和代码任务Qwen3-30B-A3B 上其中GPQA Pass8 23.3MMLU-Pro Pass8 15.1MMLU-Redux Pass8 8.2LiveCodeBench v6 Pass1 1.9Pass8 2.1说明专家路径探索不只提升单样本准确率更大幅扩大成功推理轨迹覆盖范围。4.4 在 Instruct 模型上继续提升Qwen3-30B-A3B-Instruct 上即使模型已经过指令微调ESRL 仍能提供额外收益。5. 消融与分析为什么 ESRL 有效5.1 采样温度鲁棒性ESRL 在不同 rollout 温度下都优于 GRPO-R3。低温 T0.6、T0.8 时收益尤其明显ESRL 在 T1.0 达到最佳 42.8并在 T1.2 保持 42.7GRPO-R3 在 T1.0 后下降。说明单纯提高 token 级随机性不够专家路径探索是互补来源。5.2 Group大小与 informative groupsESRL 用 64 样本即可超过 GRPO-R3 用 128 样本ESRL 用 128 样本超过 GRPO-R3 用 256 样本ESRL 在训练中始终维持更高的 informative-group ratio。所谓 informative group就是组内同时有正确和错误回答的组。GRPO 需要组内奖励差异来构造优势信号。ESRL 提升了这种有效学习信号的比例。5.3 噪声尺度与专家锚定σ0.1→0.4 时ESRL 平均 Pass1 提升峰值约 42.1%σ 再增大性能缓慢下降但到 σ4 仍高于 GRPO-R3去掉 anchored experts 后σ0.4 就开始退化σ0.8 崩溃到约 32%。结论锚定专家避免过度扰动候选池限制探索范围。5.4 自适应噪声 vs 固定噪声固定噪声non-adaptive甚至不如 baselineGRPO-R3说明控制扰动强度比简单加噪更关键。5.5 锚定专家数量与候选池大小K_anchor4, M_explore16平均 Pass1 最佳 42.1K_anchor2, M_explore16平均 Pass8 最佳 64.9M_explore64 通常变差无锚定配置明显落后。解释保留更多高置信专家 → 单样本准确率更好K 4/2M 16avg1 42.1/41.6给更多探索槽位 → 解覆盖更广K 2M 16/32avg1 41.6/42.1候选池过大 → 引入不匹配专家路径。5.6 路由参数如何塑造准确率–多样性权衡(a) 锚定专家数 K_anchor会同时影响可达多样性范围和曲线几何增大 K_anchor 可在相同多样性下提升质量但会压缩可达空间。(b) 扰动层位置方面扰动后层比前层产生更大位移最后八层扰动带来最宽多样性范围说明后层路由决策对输出分布影响更强。(c) 噪声尺度 σ 与候选池 M_explore增大 σ 会持续降低 Self-BLEU增大 M_explore 会扩展可达多样性范围但不同候选池大小的结果基本坍缩到同一条准确率–Self-BLEU 关系上说明 M_explore 主要控制可用探索支撑集而非改变底层质量–多样性趋势。(d) 与解码策略类比σ 类似温度控制探索强度M_explore 类似 top-k/top-p决定可用替代集合。总体而言这些参数主要让模型沿共享的质量–多样性趋势移动而锚定专家数量和扰动位置还会额外影响曲线几何。5.7 扰动位置所有层都加扰动效果最好扰动后层比前层影响更大最后 8 层扰动带来最宽的 diversity 范围。说明 late routing decisions 对输出分布影响更强。5.8 解耦专家探索与 token 探索两阶段策略Stage 1T0只用路由噪声训练Stage 2关闭路由噪声开启温度采样 T0.8。结果高预算 PassN 曲线中解耦 ESRL 在 N 较大时反超说明仅靠专家探索也能发现替代稀疏计算路径。5.9 专家负载更均衡ESRL 在训练中全局 expert-load CV 和 imbalance factor 都低于 GRPO-R3说明它缓解了专家利用不平衡。6. 结论与启发ESRL 的核心思想很简单但很有效MoE 的专家路由不是只能固定或做负载均衡它还可以作为 RL 的探索维度。它通过熵自适应噪声控制扰动强度锚定专家采样保留可靠路径只探索合理候选Rollout Routing Replay让 rollout 探索到的专家参与训练在不改 reward、不改策略优化目标的情况下提升了多个 MoE 骨干、多个任务领域的表现。对实际工作的启发MoE RL 不一定要只卷 stability 和 load balancing路由扰动可以作为一种架构感知的 explorationESRL 与 GSPO、RO-GRPO、DAPO 等优化/奖励层方法正交可组合对 group-relative RL 来说提高 informative groups 比例非常关键专家探索和 token 温度采样互补低温度下尤其有价值。论文最终结论Expert routing 是 RL exploration 的一个有效且互补的维度而不仅仅是架构组件。