ARTICLE DETAIL

资讯详情

深耕网站建设与运营推广的一线实战洞察。

DOPD: Dual On-policy Distillation

DOPD: Dual On-policy Distillation DOPD: Dual On-policy Distillation 论文完整总结+指定章节中英对照翻译一、论文整体核心内容总结1. 研究背景与现存痛点现有在线策略蒸馏(OPD, On-policy Distillation)使用学生模型自采样轨迹,由教师提供逐Token监督,有效缓解离线蒸馏分布偏移问题,是大模型后训练主流方案。但当引入特权信息(Privileged Information)(LLM推理分步提示、VLM视觉标注框等辅助线索)时,传统OPD存在致命缺陷:特权错觉(Privilege Illusion):师生性能差距分为两类,传统方法无法区分:可迁移能力差距:学生真正需要学习的底层能力;信息不对称差距:仅教师能获取特权输入带来的表面优势,学生无法复刻,强行蒸馏会让模型拟合捷径而非通用能力,引发熵坍缩、探索性下降、后期性能下滑。Token监督均匀化缺陷:所有Token使用完全相同的监督来源、损失权重、对齐目标;但轨迹中只有少量Token承载核心能力信息,大量低价值Token掺杂特权捷径噪声,均匀蒸馏会放大特权错觉。现有OPD三类范式(标准师生蒸馏、自蒸馏、自适应蒸馏)均未显式区分能力/信息差距,缺少动态路由机制,在师生模型尺寸差距大、多
返回列表