ARTICLE DETAIL

资讯详情

深耕网站建设与运营推广的一线实战洞察。

TreeBoN:投机树搜索 × Best-of-N 采样,普林斯顿大学提出的大语言模型推理时对齐「提升秘籍」

TreeBoN:投机树搜索 × Best-of-N 采样,普林斯顿大学提出的大语言模型推理时对齐「提升秘籍」 文档教程大模型【免费下载链接】Foundations-of-LLMsA book for Learning the Foundations of LLMs项目地址https://gitcode.com/GitHub_Trending/fo/Foundations-of-LLMs点击查看免费下载导读本篇文章围绕普林斯顿大学等机构提出的TreeBoNTREEBON: Enhancing Inference-Time Alignment with Speculative Tree-Search and Best-of-N Sampling展开系统讲解其如何在推理阶段将投机树搜索与Best-of-NBoN采样结合用从 DPO 隐式奖励改造而来的 token 级加权奖励引导生成从而在控制计算成本的前提下提升对齐性能与推理效率。读完本文你将掌握 TreeBoN 的五步树搜索流程、加权部分奖励的数学形式、关键超参数层数、子节点数、根样本数的作用以及它相对传统 BoN 与 Speculative BoN 的优势边界。本文是仓库中「Arxiv 一周进展报告大模型方向」系列的一篇深度解读相关论文解读原文见 20241018-20241024 周报中的 TreeBoN 文档同期聚焦 BoN 加速的另一篇解读可参考 CMU 与普林斯顿大学携手改进 BoN 算法。一、研究背景推理时对齐与 BoN 采样的困境1.1 为什么要推理时对齐让大语言模型的输出符合人类意图与伦理标准是部署前绕不开的环节。传统路线是训练时对齐例如基于人类反馈的强化学习RLHF与直接偏好优化DPO它们通过在人类偏好数据集上微调模型实现对齐但成本高昂需要大量时间、数据与计算资源且面对多目标偏好时训练流程复杂。推理时对齐Test-Time Alignment则提供了另一条路径不改动模型权重只在解码阶段调整生成策略以较低代价让输出贴近人类偏好。TreeBoN 正属于这一类方法。仓库《大模型基础》教材的第 3 章 Prompt 工程 与第 1 章 语言模型基础 对采样方法与解码策略有系统的铺垫可作为理解本文的背景读物大模型经典论文列表 中收录的 Tree of Thoughts、Self-Consistency 等论文则代表了树式搜索与多数投票解码的既有探索。1.2 BoN 采样简单有效但成本线性爆炸Best-of-NBoN采样是推理时对齐中最简单直观的策略用基础策略生成 N 个完整回答再用奖励模型对每个回答打分选出奖励最高的一个作为最终输出。它的优点是实现简单、无需训练效果通常随 N 增大而提升。但 BoN 存在明显缺陷计算成本高必须完整生成 N 个回答计算成本随 N 线性增长延迟与显存压力大虽然 N 个回答的生成与评估可以并行延迟在很大程度上不受 N 影响但当 N 超过单块 GPU 显存可容纳的最大批量大小时就需要多块 GPU 支撑对齐效果受 N 制约要达到接近后训练方法的对齐效果可能需要 N 达到 1000 甚至 60000 量级这在算力上往往不可行。1.3 加速方法的局限Speculative BoN 的部分评分不准难题针对 BoN 的高成本已有工作尝试投机式加速Speculative BoNSBoN对部分回答如前 K 个 Token进行评分用部分奖励预测整体回答质量从而提前淘汰低质量候选。但 SBoN 依赖一个并不总是成立的假设——部分奖励分数与完整回答奖励正相关。由于奖励模型通常是在完整回答上训练的对不完整前缀的评分并不准确预测结果与实际评分存在较大偏差不仅难以有效提升性能反而可能损害最终推理效果。这正是 TreeBoN 要解决的问题。二、TreeBoN 核心方法分层树搜索 加权部分奖励2.1 总体思想TreeBoN 采用层次化策略将长序列生成过程拆分为多个子序列通过树结构逐层生成候选回答片段避免了一次性生成大量完整回答带来的高额计算成本。算法的整体脉络可以概括为从一组初始根回答片段出发在每一层选择高奖励的回答片段并将其扩展为多个子回答片段。这种对树空间的推测性搜索同时提升了效率与最终回答质量。论文信息速览来自 原始周报文档项目内容论文TREEBON: Enhancing Inference-Time Alignment with Speculative Tree-Search and Best-of-N Sampling作者Jiahao Qiu, Yifu Lu, Yifan Zeng, Jiacheng Guo, Jiayi Geng, Huazheng Wang, Kaixuan Huang, Yue Wu, Mengdi Wang单位Princeton University, University of Michigan, Oregon State University2.2 五步生成流程TreeBoN 的生成过程包含以下五个步骤① 初始候选生成Initial Candidate Generation使用基础策略 $\pi_{base}$ 生成 $N$ 个长度为 $l_1$ 的候选回答片段 $C_1$。总最大回答长度 $l_{max}$ 被分割为多个长度为 $l_i$ 的段segment每一层对应一个片段长度。② 部分奖励评分Partial Reward Scoring在每一层 $i$使用奖励模型或部分奖励函数 $r(y|x)$ 计算候选回答片段 $y \in C_i$ 的奖励分数。评分在生成长度为 $l_i$ 的回答片段后进行即在每个决策点评估当前已生成前缀的质量。③ 剪枝与选择Pruning and Selection根据奖励分数从当前层中选择前 $N / N_{children}$ 个候选回答片段形成活动集active set$P_i$。这些高奖励的父回答片段将用于在下一层继续生成。④ 回答片段扩展Expansion对于每个父回答片段 $y \in P_i$TreeBoN 从基础策略 $\pi_{base}$ 中采样 $N_{children}$ 个回答片段每个片段的最大新 token 长度为 $l_{i1}$从而生成下一层的候选集 $C_{i1}$。⑤ 最终选择Final Selection在生成完所有层的候选片段后使用奖励模型计算最后一层候选集 $C_{N_{layer}}$ 的最终奖励选择奖励最高的回答 $y^*$ 作为最终输出。整个过程中存在两个关键不变量保证计算预算可控候选集大小始终为 $N$每层从 $N/N_{children}$ 个父节点各扩展 $N_{children}$ 个孩子总数恒为 $N$活动集 $P_i$ 大小始终为 $N / N_{children}$。也就是说TreeBoN在不增加计算预算的前提下生成了与 BoN 相同数量的总 token但把这些 token 组织成了宽根、逐层收敛的树结构而不是 N 条互不相干的完整序列。2.3 加权隐式奖励函数树搜索的评分引擎TreeBoN 在树搜索中使用加权隐式奖励函数来评估部分回答片段。对于序列 $y$ 的前 $K$ 个 token部分奖励计算为$$ r_{partial}(y_{:K}|x) \sum_{k0}^{K-1} w_k \log\frac{\pi^{*}(y_k|x,y_{:k})}{\pi(y_k|x,y_{:k})} $$其中$y_{:k}$ 表示前缀$\pi^{*}(y_k|x,y_{:k})$ 与 $\pi(y_k|x,y_{:k})$ 分别表示对齐策略DPO 训练得到的策略与参考策略在给定前缀条件下对 token $y_k$ 的条件概率$w_k \frac{1}{|y_k|}$ 是加权因子对每个 token 级别的对数似然比贡献按 token 长度做归一化。这个加权奖励来自DPO 隐式奖励DPO implicit reward的改造DPO 的闭式解隐式地定义了一个奖励函数 $r(x,y) \beta \log\frac{\pi^{*}(y|x)}{\pi_{ref}(y|x)}$TreeBoN 将其从整句奖励改造为逐 token 的部分奖励并用长度加权系数平衡每个 token 的贡献。这种设计带来的直接收益帮助在早期层剪枝低质量回答片段把计算资源留给有潜力的候选在整个树扩展过程中鼓励继续生成更高质量的候选片段相比直接用完整回答训练的奖励模型对前缀打分DPO 策略模型的隐式奖励在 token 级语义上更精确缓解了 SBoN 中部分评分不准的根本问题。2.4 关键超参数一览超参数含义作用与典型取值论文实验$N$根样本候选数量控制总计算预算实验取值 8128$N_{children}$每个父节点扩展的子节点数控制树的宽度与层间的剪枝强度$N_{layer}$树层数段数控制探索-利用的粒度层数越多性能越好$l_{max}$最大回答长度被切分为各层片段长度 $l_1, l_2, \dots, l_{N_{layer}}$$l_i$第 $i$ 层片段的 token 长度决定各层评分决策点的位置$w_k$token 级加权因子$w_k 1/y_k$长度归一化三、实验结果对齐质量与计算效率的双重验证论文通过一系列实验评估了 TreeBoN 在不同数据集上的表现覆盖与 Baseline 的对比、树结构影响、效率评估、隐式奖励探索四个方面。3.1 不同数据集上的改进评估设置使用GPT-4 win-rate评估方法在 AlpacaFarm、UltraFeedback、HH-RLHF、TutorEval 四个数据集上针对 100 个随机选择的提示对比 TreeBoN 与 Baseline 方法Best-of-N 采样N 128的性能对于数学推理数据集 GSM8K报告零样本 pass1 解决率。主要结果对话/指令遵循类数据集在最大长度为 192 与 384 tokens 时TreeBoN 始终优于 Baseline。192 tokensAlpacaFarm 上达到64%的 win-rate其余数据集上至少达到60%384 tokensAlpacaFarm 上保持62%的 win-rate其余数据集上至少54%使用 SFR 模型时所有数据集达到60%65%的 win-rate。数学推理数据集 GSM8K在最大回答长度为 576 tokens 时TreeBoN 的 pass1 解决率比 BoN 高出9%。这说明 TreeBoN 的分层结构尤其适合需要长链式思维CoT推理的任务——逐层生成与剪枝让长序列探索更高效。3.2 不同树结构的影响实验设置保持计算成本不变$N 128$ 且 $l_{max}$ 相同分别改变树层数Number of Layers与每个节点的子节点数量Number of Children在 AlpacaFarm 数据集上计算 TreeBoN 相对于 BoN 的 win-rate。结果要点增加树层数能持续提高性能在 192 与 384 tokens 两种最大长度下win-rate 都随层数增加而提升——更细粒度的分段意味着更多评估-剪枝决策点探索更精细最佳子节点数量随最大生成长度变化不同 $l_{max}$ 下最优 $N_{children}$ 不同说明树的宽度需要与序列长度匹配稳健性无论树结构如何变化TreeBoN 相对 Baseline 的 win-rate 均保持在约 60%左右验证了方法的有效性同时暗示未来可针对不同任务探索更多超参数以进一步提升性能。3.3 效率评估实验设置计算成本仅由根样本数量 $N$ 与最大生成长度 $l_{max}$ 控制BaselineBoN同时生成 128 个回答并从中用奖励模型选择最佳结果。结果要点随着计算预算增加$N$ 增大TreeBoN 相对于 BoN 的 win-rate 也增加表明 TreeBoN比 Baseline 更具可扩展性能更有效地利用额外的计算预算在 AlpacaFarm 上当 $N$ 从 8 增加到 128TreeBoN 的 win-rate 逐渐提高即使在 $N 8$仅为 BoN 计算成本的 $8/128 6.3%$时TreeBoN 仍能以55%的 win-rate 优于 BoN——只用不到 7% 的算力就实现了超越这是提升秘籍最直观的体现。3.4 不同隐式奖励的探索实验设置测试不同隐式奖励形式包括候选奖励说明DPO 隐式奖励标准的 DPO 闭式解奖励加权隐式奖励TreeBoN 提出的 $w_k 1/y_k$ 加权形式加权隐式奖励指数衰减对更早 token 的权重做指数衰减长度归一化 DPO 隐式奖励对整句奖励按长度归一化DPO 策略对数概率和直接用 DPO 策略的对数概率求和SimPO 奖励简单偏好优化SimPO的奖励形式实验在 AlpacaFarm 数据集上使用默认配置的 TreeBoN 进行。结果表明加权隐式奖励在树搜索设置中表现最佳取得最高的 GPT-4 win-rate证明了该奖励设计在 TreeBoN 框架中的有效性——长度归一化的加权因子让部分奖励在不同长度的前缀间可比较这对逐层剪枝至关重要。3.5 与其他方法对比讨论与 SBoN 的对比SBoN 依赖部分奖励分数与完整回答奖励正相关的假设但由于奖励模型通常在完整回答上训练对部分回答的评分不准确导致性能欠佳。TreeBoN 通过使用更精确的DPO 策略模型隐式奖励信号解决了这一问题显著提高了部分奖励近似的可靠性。此外TreeBoN 的分层树结构能更全面地探索回答空间——在扩展有希望候选片段的同时有效地剪枝低质量片段。从结构上看TreeBoN 是 SBoN 的广义形式当 $N_{children} 1$ 且 $N_{layer} 2$ 时TreeBoN 可简化为 SBoN 的两层结构。与传统 BoN 的对比传统 BoN 生成候选回答时没有分层结构只是简单地探索回答空间TreeBoN 采用更结构化的探索策略通过逐层生成和优化回答用更少的总样本更有效地搜索回答空间在速度与性能上都有改进更好地平衡了**探索exploration与利用exploitation**之间的权衡。与 KV 缓存加速的结合TreeBoN 可以天然利用**键值缓存KV cache**机制进一步加速——在树结构中父 token 的键Key和值Value可被其所有子节点重用避免了重复计算公共前缀的注意力状态这正是树结构相对 N 条独立序列的又一效率优势。四、技术总结与后续视角TreeBoN 的核心贡献可以归结为三点结构创新把 BoN 的一次性生成 N 条完整序列改造成逐层生成、逐层剪枝的树在相同 token 预算下获得更高质量的输出奖励创新把 DPO 隐式奖励改造成长度加权、可逐 token 累加的部分奖励解决了此前投机式方法部分评分不准的痛点效率创新借助树结构中公共前缀的 KV 缓存复用在探索更充分的同时进一步压缩计算开销。从研究脉络看TreeBoN 处于推理时对齐 × 投机解码交叉地带它继承了 BoN 的简单性吸收了投机式方法早期剪枝的思想又用 DPO 隐式奖励补上了部分评分精度这一关键短板。与之同源的后续工作如仓库中收录的 Speculative Rejection 解读继续沿着用部分奖励提前拒绝低质量响应的方向推进共同构成了推理时对齐加速的一条清晰技术路线。参考资料TreeBoN 周报解读原文本仓库「Arxiv 一周进展报告大模型方向/20241018-20241024」目录CMU 与普林斯顿大学携手改进 BoN 算法Speculative Rejection解读大模型经典论文列表其中思维链小节收录 Tree of Thoughts、Self-Consistency 等树式/多数投票解码代表作《大模型基础》完整版 PDF第 1 章语言模型基础覆盖语言模型的采样方法第 3 章Prompt 工程覆盖思维链等解码相关技术Foundations_of_LLMs(English_version)/readme.md/readme.md)项目英文版说明赞分享文档教程大模型【免费下载链接】Foundations-of-LLMsA book for Learning the Foundations of LLMs项目地址https://gitcode.com/GitHub_Trending/fo/Foundations-of-LLMs点击查看免费下载相关推荐3行代码提升大模型效果trl最佳采样技术(Best-of-N)实战指南3行代码提升大模型效果trl最佳采样技术 Best of N 实战指南 你还在为大模型输出不稳定发愁同样的prompt有时精彩有时离谱本文将用不到200行人工智能大模型强化学习RLHF预训练微调LoRAMachineLearningLM让大语言模型像随机森林一样处理表格数据性能提升15%MachineLearningLM让大语言模型像随机森林一样处理表格数据性能提升15% 导语 2025年7月一个名为MachineLearningLM的7localpilot模型管理详解如何快速切换CodeLlama、Mistral和官方Copilotlocalpilot模型管理详解如何快速切换CodeLlama、Mistral和官方Copilot localpilot是一款强大的模型管理工具支持快速切换上一篇Agent Zero 调度器Scheduler Tool深入解析定时任务、计划任务与临时任务全指南下一篇Hindsight 接入 GitHub CopilotVS Code基于 MCP 的长期记忆集成 hindsight-copilot 实战指南创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表