
Weak-to-Strong Generalization via Direct On-Policy Distillation 全文总结+指定章节中英对照翻译一、文章整体核心内容总结1. 研究背景当前基于可验证奖励的强化学习(RLVR)是提升大模型数学推理能力的主流后训练方案,但存在极高算力成本:模型规模越大,生成采样轨迹、迭代RL的开销呈指数上涨,每一款新的强推理模型都要从头跑完整RL,后训练成为性能扩展瓶颈。传统在策略蒸馏(OPD)直接模仿小RL模型的最终策略,存在致命缺陷:小模型的最终策略混合了RL带来的推理增益与小模型本身的容量短板;若学生模型本身性能已经超过小教师,单纯模仿会直接拉低学生效果。2. 核心方案:Direct-OPD(直接在策略蒸馏)不蒸馏小RL模型的绝对输出分布,而是提取RL带来的策略偏移量作为可迁移隐式奖励:取同一小模型RL前后两个权重:RL前参考模型πTref\pi_{T_{ref}}