ARTICLE DETAIL

资讯详情

深耕网站建设与运营推广的一线实战洞察。

分布的“差异尺子”:深度学习中的散度全景

分布的“差异尺子”:深度学习中的散度全景 散度是衡量两个概率分布“有多不一样”的一类尺子。它不像距离那样要求对称、也不要求三角不等式因此更灵活。深度学习中散度负责回答一个核心问题模型分布和真实数据分布到底差在哪里、差多少、该怎么拉近从 VAE、GAN、扩散模型到知识蒸馏、域适应、RLHF散度几乎无处不在。一、散度不是距离很多人把散度和距离混着说但两者有本质区别性质距离散度对称性通常要求 A 到 B 等于 B 到 A不要求KL 就是典型非对称三角不等式通常要求不要求同一性相同分布距离为零相同分布散度为零直观空间中的远近分布之间的差异、惊讶、信息损失所以散度更像“差异度量”而不是“几何距离”。但有些散度经过对称化后可以接近距离Wasserstein 距离则本身就是真正的距离只是常和散度一起讨论。二、为什么深度学习需要散度深度生成模型、变分推断、表示学习本质上都在做同一件事让模型分布逼近真实数据分布。但分布不能直接相减也不能直接比较大小。于是需要散度来量化“逼近得怎么样”。不同散度关注不同的差异有的关注平均信息损失。有的关注最大概率差。有的关注模式覆盖。有的关注模式崩塌。有的关注几何搬运成本。有的关注样本层面是否容易估计。选哪种散度直接决定模型是“覆盖所有模式但模糊”还是“只生成少数模式但清晰”。三、常见散度详解1. KL 散度最基础也最挑剔KL 散度是深度学习里最常用的散度直觉是用模型分布去编码真实数据时额外付出多少代价。也可以理解为看到真实数据后模型有多“惊讶”。KL 最重要的特点是非对称前向 KL真实分布有、模型没有惩罚很重。结果是模型倾向于覆盖所有模式宁可模糊也不漏掉。最大似然估计本质上就在优化前向 KL。反向 KL模型有、真实没有惩罚很重。结果是模型倾向于锁定少数模式生成清晰但容易模式崩塌。变分推断常用反向 KL。KL 的另一个特点是“零避免”如果真实分布某处有概率模型却给它零概率KL 会趋向无穷大。所以 KL 对覆盖不足非常敏感。应用VAE 的 ELBO、知识蒸馏、RLHF 中的策略约束、信息瓶颈、互信息估计。2. JS 散度KL 的对称版JS 散度把 KL 对称化并做了平滑因此对称。有界。不会像 KL 那样轻易趋向无穷。原始 GAN 的判别器目标就和 JS 散度密切相关。但 JS 有一个致命问题当两个分布支撑集不重叠时JS 是常数梯度消失。这就是原始 GAN 训练不稳定、容易饱和的重要原因。3. 总变差最大概率差总变差衡量两个分布在任何事件上的最大概率差。它直观、有界但高维下难以估计梯度也偏弱。常用于理论分析、两样本检验、图像比较。4. f 散度统一框架f 散度是一大类散度的统称通过一个凸函数生成。KL、JS、总变差、Hellinger 都可以看作 f 散度的特例。它的价值在于提供统一理论视角。可以用变分方法估计。在 GAN 中衍生出 f-GAN。让研究者可以设计新的散度。5. Rényi 散度与 α 散度连续谱Rényi 散度和 α 散度是一族带参数的散度。参数控制对罕见事件的敏感度参数接近 1接近 KL。参数趋近 0更关注罕见事件。参数趋近无穷更关注最大概率。它们用于鲁棒变分推断、互信息估计、隐私保护、鲁棒学习。6. Hellinger 距离有界且稳定Hellinger 距离和总变差关系密切但有界且数值稳定。它对概率密度的平方根敏感常用于分类、两样本检验、鲁棒统计。7. Bregman 散度凸函数生成Bregman 散度由凸函数生成KL 是其中一个特例。它不限于概率分布也可以衡量向量、矩阵、函数之间的差异。应用非负矩阵分解、聚类、优化、镜像下降、指数族。8. MMD核方法里的分布比较最大均值差异把分布映射到再生核希尔伯特空间然后比较两个均值嵌入的距离。它的优点是可以直接从样本估计不需要密度。计算方便。有理论保证。应用域适应、生成模型评估、两样本检验、GAN 训练。9. Wasserstein 距离搬土成本Wasserstein 距离来自最优传输直觉是把一堆土从分布 A 搬到分布 B最少要花多少力气。它最大的优势是即使两个分布完全不重叠也能提供有意义的梯度。这使它在 GAN 中解决了 JS 的梯度消失问题缓解模式崩塌。但精确计算很贵常用 Sinkhorn 等近似方法。应用WGAN、最优传输、域适应、图像检索、生成模型评估。10. Fisher 散度局部差异Fisher 散度衡量两个分布在小扰动下的局部差异。它和信息几何、自然梯度密切相关。在持续学习、元学习、自然梯度优化中有应用。11. 其他散度Jeffreys 散度KL 的对称化但无界。能量距离基于样本距离不依赖密度。Cramér 距离基于累积分布。最大均值差异核方法代表。总相关多变量互信息分解。四、深度学习中的典型应用场景常用散度作用VAEKL变分推断ELBO 中的正则项原始 GANJS判别真假但易梯度消失WGANWasserstein稳定训练缓解模式崩塌扩散模型KL / 变分界去噪得分匹配变分训练知识蒸馏KL学生匹配教师软标签域适应MMD / JS / Wasserstein对齐源域和目标域特征对比学习InfoNCE / KL最大化互信息拉近正样本RLHFKL约束策略不要偏离太远TRPO / PPOKL策略更新步长控制信息瓶颈KL压缩表示保留任务信息解耦表示KL / 总相关让隐变量独立持续学习KL防止遗忘旧任务模型融合KL / JS对齐多个模型输出两样本检验MMD / 能量距离判断两组样本是否同分布生成评估FID / MMD / Wasserstein衡量生成分布与真实分布差距五、怎么选散度你想要什么选什么最基础、信息论解释KL对称、有界JS、Jeffreys、Hellinger支撑不重叠仍有梯度Wasserstein、MMD、能量距离样本可直接估计MMD、能量距离覆盖所有模式前向 KL生成清晰、锁定模式反向 KL统一理论框架f 散度鲁棒、关注罕见事件Rényi、α 散度局部几何、自然梯度Fisher凸优化、非概率分布Bregman关键权衡模式覆盖 vs 模式崩塌前向 KL 覆盖反向 KL 锁定。梯度消失 vs 计算成本JS 便宜但可能消失Wasserstein 稳定但贵。密度估计 vs 样本估计KL 需要密度比MMD 可直接用样本。对称 vs 非对称KL 非对称JS 对称。有界 vs 无界JS 有界KL 无界。六、口述总结“深度学习中的散度本质是衡量两个概率分布差异的尺子。它和距离不同不要求对称也不要求三角不等式。最常用的是 KL 散度非对称前向 KL 鼓励覆盖所有模式反向 KL 鼓励锁定少数模式VAE、知识蒸馏、RLHF 都用它。JS 是 KL 的对称版有界但支撑不重叠时梯度消失原始 GAN 就受这个困扰。Wasserstein 来自最优传输像搬土即使分布不重叠也有梯度WGAN 用它缓解模式崩塌但计算贵。MMD 用核方法可以直接从样本估计常用于域适应和两样本检验。f 散度是统一框架KL、JS、总变差、Hellinger 都是它的特例。Rényi 和 α 散度是连续谱控制对罕见事件的敏感度。Bregman 散度由凸函数生成用于非负矩阵分解和优化。Fisher 散度关注局部差异和自然梯度、信息几何相关。选择散度主要看要不要对称、支撑是否重叠、要不要覆盖所有模式、计算成本、能否从样本估计。面试里如果被追问我会强调散度不是距离选散度就是选模型的行为前向 KL 让模型保守覆盖反向 KL 让模型大胆锁定Wasserstein 让模型平滑搬运MMD 让模型用核比较。不同散度没有绝对好坏只有适不适合当前任务。”
返回列表