
排序推荐任务覆盖面很广包括召回、粗排、精排、重排、序列推荐、会话推荐、多任务推荐、生成式推荐、强化学习推荐等。不同阶段的损失函数差异很大召回阶段更关心从海量物品中快速找出相关候选常用对比学习、采样 Softmax、BPR 等。精排阶段更关心 CTR、CVR、时长、互动等目标常用二元交叉熵、Focal、多任务损失、校准损失。重排阶段更关心整个列表的排序质量常用 ListNet、ListMLE、LambdaRank、ApproxNDCG 等 listwise 损失。序列推荐更关心下一项预测常用交叉熵、采样 Softmax、对比损失、掩码预测。推荐系统还存在曝光偏差、位置偏差、选择偏差、流行度偏差因此有 IPS、DR、反事实、对抗去偏等损失。下面按类别介绍排序推荐任务常见损失函数。一、按学习范式分类1. Pointwise 损失Pointwise 把每个用户物品对当作独立样本预测一个分数或概率。常见损失包括均方误差用于评分预测惩罚大误差但对异常值敏感。平均绝对误差对异常值更鲁棒但收敛可能较慢。Huber 损失小误差平方、大误差线性兼顾平滑和鲁棒。二元交叉熵用于点击、购买、点赞等隐式反馈是最常用的 CTR 损失。加权二元交叉熵给正样本或不同物品不同权重缓解类别不平衡。Focal Loss降低易分样本权重聚焦难分样本适合极端不平衡。标签平滑缓解过度自信提升泛化。Brier 分数关注概率校准适合需要可靠概率的推荐。分位数损失用于预测评分分布或停留时间分位数。序数回归损失用于星级评分等有序标签考虑类别顺序。Pointwise 优点是简单、易实现、易并行。缺点是忽略物品之间的相对顺序和 NDCG、MRR 等排序指标不完全一致。2. Pairwise 损失Pairwise 比较一个正物品和一个负物品要求正物品得分高于负物品。常见损失包括BPR贝叶斯个性化排序让用户对正物品的偏好高于负物品并留出间隔。RankNet把排序看作成对分类用交叉熵比较正负样本。RankSVM用 Hinge 损失要求正样本得分高出负样本一个间隔。Margin Ranking Loss要求正样本得分比负样本高出一个边界。Triplet Loss使用锚点、正样本、负样本让正样本更近、负样本更远。N-pair Loss一个锚点同时与多个负样本比较提高训练效率。InfoNCE让正样本在众多负样本中脱颖而出适合召回和对比学习。对比损失拉近正样本对推远负样本对。Pairwise 更贴近排序目标适合隐式反馈和召回。缺点是负采样策略影响很大难负样本可能带来噪声简单负样本又学不到判别力。3. Listwise 损失Listwise 直接优化整个列表的排序质量更贴近 NDCG、MRR、MAP 等指标。常见损失包括ListNet对排列概率做交叉熵考虑整个列表。ListMLE最大化真实排列的似然。LambdaRank用 NDCG 变化量加权成对误差是 Learning to Rank 经典方法。LambdaMARTLambdaRank 和梯度提升树的结合。ApproxNDCG可微 NDCG 近似直接优化 NDCG。SoftRank用软排序近似排序指标。Plackett-Luce对列表排列建模常用于推荐和排序。NDCG、MAP、MRR 代理损失直接优化排序评估指标。Listwise 优点是贴近最终评估指标适合精排和重排。缺点是计算复杂对列表长度和采样敏感训练可能不稳定。二、按推荐阶段分类4. 召回阶段损失召回阶段面对海量物品常见损失包括采样 Softmax从全量物品中采样部分负样本近似全量 Softmax。InfoNCE双塔对比学习让用户与正物品相似与负物品不相似。双塔对比损失用户塔和物品塔分别编码再在向量空间对比。BPR适合隐式反馈召回。Triplet Loss适合用户、正物品、负物品三元组。N-pair Loss一个用户同时对比多个负物品。Cross-batch 对比跨批次构造负样本增加负样本数量。MoCo 式队列用队列保存历史物品向量增加负样本。硬负样本损失专门挑难负样本提升判别力。去偏对比损失缓解流行度偏差和曝光偏差。召回损失的关键是负采样。负样本太少模型学不到区分力负样本太难又容易过拟合噪声。常见策略包括随机负采样、流行度负采样、硬负采样、混合负采样、课程负采样。5. 粗排阶段损失粗排介于召回和精排之间常见损失包括二元交叉熵预测点击或转化。蒸馏损失用精排模型指导粗排模型。对比损失学习用户和物品表示。多任务损失同时预测点击、转化、时长等。排序蒸馏让学生模型模仿教师模型的排序。特征蒸馏让学生模型模仿教师模型的中间特征。粗排损失通常要兼顾效果和效率常用蒸馏和对比学习。6. 精排阶段损失精排阶段目标多、特征丰富常见损失包括二元交叉熵CTR 预估最常用。加权二元交叉熵处理正负样本不平衡。Focal Loss聚焦难分样本。校准损失让预测概率接近真实点击率。ESMM 类损失用点击和转化概率的链式关系联合建模。多任务损失CTR、CVR、时长、互动、收藏、分享等联合训练。MMoE、PLE多任务共享底层、独立专家。不确定性加权自动平衡不同任务。GradNorm、PCGrad、CAGrad解决多任务梯度冲突。LambdaRank、ListNet、ListMLE、ApproxNDCG直接优化排序。精排损失的关键是多目标平衡和排序一致性。CTR 高不一定排序好因此常把排序损失和点击损失结合。7. 重排阶段损失重排阶段对精排结果重新排序常见损失包括ListNet、ListMLE直接优化整个列表。LambdaRank、ApproxNDCG优化 NDCG。多样性损失鼓励列表覆盖不同类别、作者、风格。新颖性损失鼓励推荐新鲜物品。序列生成损失把重排看作序列生成用交叉熵或强化学习。强化学习损失用策略梯度优化长期收益。对比损失让最终列表与理想列表接近。重排损失通常考虑列表整体质量包括相关性、多样性、新颖性、商业价值。三、按反馈类型分类8. 显式反馈损失显式反馈包括评分、星级、喜欢程度。常见损失包括均方误差评分预测最常用。平均绝对误差对异常评分更鲁棒。Huber 损失折中方案。序数回归损失考虑评分顺序例如一星到五星。分位数损失预测评分分布。概率回归损失预测评分均值和方差。显式反馈损失适合评分预测但真实推荐中显式反馈较少。9. 隐式反馈损失隐式反馈包括点击、浏览、购买、停留、点赞。常见损失包括二元交叉熵最常用。加权二元交叉熵处理正负不平衡。Focal Loss聚焦难例。BPR成对排序。RankNet成对交叉熵。Hinge 损失最大间隔。采样 Softmax大规模召回。InfoNCE对比学习。WARP加权近似排序适合多标签和召回。隐式反馈通常只有正样本和未观测样本未观测不一定是负样本因此需要负采样和去偏。10. 多行为反馈损失用户有点击、加购、收藏、分享、购买等多种行为。常见损失包括多任务损失每个行为一个任务。多标签损失每个行为独立预测。层次分类损失先预测行为大类再预测细类。概率链式损失例如点击后再转化。多目标加权不同行为不同权重。不确定性加权自动平衡。多行为损失的关键是任务相关性和冲突处理。四、按推荐任务分类11. CTR 预估损失CTR 是推荐系统最核心任务之一。常见损失包括二元交叉熵标准损失。加权二元交叉熵缓解不平衡。Focal Loss难例聚焦。校准损失让预测概率准确。对比损失学习更好表示。多任务损失CTR 加 CVR 加时长。ESMM用点击和转化关系联合建模。蒸馏损失教师模型指导学生。CTR 损失通常用二元交叉熵但要注意校准和排序。12. CVR 预估损失CVR 预估转化率正样本更少。常见损失包括ESMM用点击率乘转化率建模。IVR用逆倾向加权处理选择偏差。多任务损失点击和转化联合。延迟反馈损失处理转化延迟。二元交叉熵基础损失。Focal Loss处理极端不平衡。CVR 损失的关键是选择偏差和延迟反馈。13. 序列推荐损失序列推荐根据用户历史预测下一项。常见损失包括下一项交叉熵最常用。采样 Softmax大规模物品。BPR成对排序。对比损失序列增强对比。掩码预测损失类似 BERT。自回归损失逐项生成。序列对比损失让相似序列靠近。图对比损失图神经网络序列推荐。序列推荐损失要建模时序依赖和长短期兴趣。14. 会话推荐损失会话推荐根据短会话预测下一项。常见损失包括交叉熵下一项预测。BPR成对排序。对比损失会话增强。图对比损失会话图。注意力对齐损失提升会话表示。会话推荐损失要处理短序列和匿名用户。15. 知识图谱推荐损失知识图谱推荐利用实体关系。常见损失包括Margin Ranking Loss让真实三元组得分高于错误三元组。TransE 类损失知识图谱嵌入。BPR用户物品偏好。对比损失图对比。交叉熵关系预测。知识图谱推荐损失要兼顾图谱补全和推荐排序。16. 多模态推荐损失多模态推荐利用图像、文本、视频、音频。常见损失包括跨模态对比损失让匹配模态靠近。CLIP 类损失图像文本对齐。匹配损失模态对应。重建损失模态重建。对抗损失模态对齐。多任务损失推荐加多模态。多模态推荐损失要处理模态鸿沟和缺失模态。17. 生成式推荐损失生成式推荐把推荐看作序列生成。常见损失包括自回归交叉熵逐项生成。掩码预测损失遮住物品预测。扩散损失去噪生成。对比损失表示学习。强化学习损失长期收益。生成式推荐损失要处理离散物品和巨大词表。五、偏差与去偏损失推荐系统存在多种偏差曝光偏差用户只看到部分物品。位置偏差排在前面的物品更容易被点击。选择偏差用户自选物品。流行度偏差热门物品更易被推荐。反馈偏差点击不等于喜欢。常见去偏损失包括IPS 逆倾向加权给不同样本不同权重纠正曝光偏差。DR 双鲁棒结合倾向和模型降低方差。反事实损失建模反事实反馈。位置感知损失把位置作为特征或偏差塔。偏差塔单独建模位置偏差。对抗去偏用对抗网络消除偏差。无偏损失设计无偏估计。重加权与重采样平衡流行度和长尾。去偏损失的关键是估计倾向和偏差同时避免方差过大。六、多任务与多目标损失推荐系统通常同时优化点击、转化、时长、互动、多样性、新颖性。常见方法包括加权和人工权重。不确定性加权自动学习任务权重。GradNorm动态平衡梯度。PCGrad解决梯度冲突。CAGrad冲突感知梯度。MMoE多门混合专家。PLE渐进式分层提取。ESMM概率链式多任务。多标签损失每个目标独立预测。排序损失加点击损失兼顾排序和点击。多任务损失的关键是任务相关性和冲突处理。七、对比学习与自监督损失对比学习在推荐中用于召回、冷启动、长尾、序列推荐。常见损失包括InfoNCE正样本在负样本中脱颖而出。NT-Xent批次内对比。MoCo队列和动量编码器。BYOL无负样本。SimSiam无负样本孪生。Barlow Twins冗余消除。VICReg方差、不变性、协方差。DINO自蒸馏。序列对比序列增强。图对比图增强。跨模态对比多模态对齐。对比损失能学习判别性表示缓解稀疏和长尾。八、强化学习与离线推荐推荐是长期交互过程适合强化学习。常见损失包括策略梯度直接优化长期收益。REINFORCE基础策略梯度。Actor-Critic策略和价值联合。DDPG、TD3、SAC连续动作。CQL、IQL离线强化学习。行为克隆模仿日志策略。奖励建模学习用户长期满意度。保守 Q 学习避免分布外动作。强化学习损失适合长期收益和动态推荐但训练不稳定离线评估困难。九、蒸馏与压缩损失推荐模型大线上要求低延迟蒸馏常用。常见损失包括知识蒸馏软标签 KL。排序蒸馏模仿教师排序。列表蒸馏模仿教师列表分布。特征蒸馏模仿中间特征。注意力蒸馏模仿注意力。对比蒸馏表示对齐。多教师蒸馏多个教师融合。蒸馏损失能压缩模型保留教师知识。十、评估指标与代理损失排序推荐常用评估指标AUC、GAUC点击排序。LogLoss概率校准。NDCG排序质量。MRR首个相关物品位置。MAP平均精度。RecallK、Hit RateK召回。PrecisionK精度。Coverage、Diversity、Novelty多样性和新颖性。这些指标大多不可导因此有代理损失ApproxNDCG可微 NDCG。LambdaRankNDCG 加权成对。SoftRank软排序。ListNet、ListMLE列表似然。AUC 代理成对排序。MRR 代理可微 MRR。代理损失直接优化评估指标但实现复杂可能过拟合指标。十一、训练技巧与采样策略排序推荐损失的效果很大程度取决于采样负采样随机、流行度、硬负、混合负。难负样本挖掘提升判别力但可能噪声。课程学习从易到难。温度参数控制对比分布锐度。标签平滑缓解过度自信。重加权处理不平衡和偏差。重采样平衡长尾。正则化防止过拟合。EMA稳定训练。蒸馏压缩和迁移。十二、如何选择排序推荐损失可以按以下思路召回采样 Softmax、InfoNCE、双塔对比、BPR、Triplet、N-pair。粗排二元交叉熵、蒸馏、对比、多任务。精排二元交叉熵、加权、Focal、校准、ESMM、MMoE、PLE、多任务。重排ListNet、ListMLE、LambdaRank、ApproxNDCG、多样性损失。显式反馈均方误差、平均绝对误差、Huber、序数回归、分位数。隐式反馈二元交叉熵、BPR、RankNet、Hinge、采样 Softmax、InfoNCE。多行为多任务、多标签、层次分类、概率链式。序列推荐下一项交叉熵、采样 Softmax、BPR、对比、掩码。会话推荐交叉熵、BPR、图对比。知识图谱Margin Ranking、TransE、BPR、对比。多模态跨模态对比、CLIP、匹配、重建、对抗。生成式自回归交叉熵、掩码、扩散、对比。偏差IPS、DR、反事实、位置感知、偏差塔、对抗去偏。多目标加权、不确定性加权、GradNorm、PCGrad、MMoE、PLE。冷启动对比、自监督、元学习、蒸馏。长尾重加权、重采样、对比、知识蒸馏。长期收益策略梯度、Actor-Critic、离线强化学习。评估 NDCGLambdaRank、ApproxNDCG、ListNet、ListMLE。评估 AUC二元交叉熵、Pairwise、AUC 代理。简单稳定二元交叉熵加 BPR 或采样 Softmax 通常是最强 baseline。