ARTICLE DETAIL

资讯详情

深耕网站建设与运营推广的一线实战洞察。

RetroLLM 生成式检索框架深度解析:分层 FM-Index 约束与前瞻性解码如何实现检索生成一体化

RetroLLM 生成式检索框架深度解析:分层 FM-Index 约束与前瞻性解码如何实现检索生成一体化 文档教程大模型【免费下载链接】Foundations-of-LLMsA book for Learning the Foundations of LLMs项目地址https://gitcode.com/GitHub_Trending/fo/Foundations-of-LLMs点击查看免费下载导读RetroLLMarXiv 2412.11919由中国人民大学高瓴人工智能学院、清华大学、华为泊松实验室等机构的研究者提出其核心思想是从生成式检索Generative Retrieval的视角出发把检索增强过程直接整合进大语言模型的自回归解码过程通过语料库级与文档级两层 FM-Index约束解码空间、通过前瞻性约束解码生成证据从而同时提升开放域问答Open-domain QA的答案准确性与推理效率。本文将以本仓库《大模型基础》教材第 6 章检索增强生成与大模型经典论文列表为知识坐标逐层拆解 RetroLLM 的研究动机、技术设计与实验结论读完你可以完整掌握这一检索-生成一体化新范式的设计脉络与实现要点。一、研究背景与动机经典 RAG 的四大痛点在了解 RetroLLM 之前需要先定位它要解决的问题。经典 RAGRetrieval-Augmented Generation采用先检索、后生成的两段式流水线检索器从外部知识库中取回相关文档片段再与查询拼接后交给生成器作答。本仓库《大模型基础》教材的第 6 章 检索增强生成系统覆盖了这一主题包括 6.1 检索增强生成简介、6.2 检索增强生成架构、6.3 知识检索、6.4 生成增强与 6.5 实践与应用而经典的开山之作Retrieval-augmented generation for knowledge-intensive NLP tasksLewis 等人NeurIPS 2020也收录在大模型经典论文列表的检索增强生成章节中。按照原论文的论述经典 RAG 方法在融入大语言模型生成过程时存在四类典型局限部署成本较高检索器、索引、重排器等额外组件构成独立于生成模型的系统工程增加了系统的部署与维护开销检索文本冗余取回的文档片段往往较长且存在信息重复全部塞进上下文会带来显著的 Token 消耗与推理开销灵活性受限检索环节与生成环节相互割裂检索结果无法根据生成过程中的状态自适应调整难以联合优化检索目标如召回率与生成目标如答案正确率通常被分开优化二者难以在同一目标函数下协同更新。与此同时生成式检索Generative Information Retrieval取得了长足进展——不再依赖显式的索引-匹配流程而是让模型直接生成文档标识符如文档 ID来完成检索典型代表如Transformer Memory as a Differentiable Search IndexDSI。仓库论文列表中的综述From matching to generation: A survey on generative information retrieval大模型经典论文列表/readme.md对该方向做了系统梳理。不过原论文指出现有生成式检索方法虽然已经能将检索任务转化为生成任务但检索与生成的集成度仍然不足并且在约束解码过程中还存在**错误剪枝erroneous pruning**问题——过早或过激进地剪掉解码分支可能把蕴含关键证据的后续序列一并剪除最终损害下游任务性能。这正是 RetroLLM 要攻克的核心矛盾。二、技术动机分层 FM-Index 与前瞻性解码针对上述问题RetroLLM 的技术动机可以概括为两个关键设计的组合分层 FM-Index与前瞻性解码策略。FM-Index是一种基于 Burrows-Wheeler 变换BWT构建的压缩全文本索引能够在占用较小内存的前提下支持快速的子串计数count与定位locate操作——即给定一个短语迅速判断它是否出现在语料中、出现在哪些文档的什么位置。RetroLLM 将其组织为两个层次语料库级 FM-IndexCorpus-level FM-Index基于整个语料库构建从结构上对检索空间进行有效约束减少无关解码干扰文档级 FM-IndexDocument-level FM-Index针对候选文档分别构建用于在证据生成阶段快速定位线索在文档中的位置进一步缩小无关的解码空间。前瞻性解码策略则解决错误剪枝问题传统的逐步贪心解码只看当前步的局部置信度容易在早期剪掉虽然局部不显眼、但对未来序列高度相关的候选词。RetroLLM 通过对未来窗口相关性的感知让解码决策建立在未来一段文本与查询的语义相关度之上从而避免错误剪枝、提升证据生成的准确性。分层索引负责在哪约束、如何约束前瞻性解码负责约束时不犯错两者结合实现检索与生成的高效协同。三、解决方案RetroLLM 的三阶段一体化流程RetroLLM 将检索与生成紧密结合在同一个自回归解码过程中无需部署独立检索器。其整体流程分为三个阶段线索生成 → 证据生成 → 答案生成。阶段一线索生成Clue Generation系统首先接收用户输入的查询随后利用基于整个语料库构建的语料库级 FM-Index来引导线索生成。具体而言大语言模型依据对查询的理解尝试生成可能出现在相关文档中的关键短语作为线索clues语料库级 FM-Index 在此起到约束作用——只有那些在语料库中实际存在的短语才能被视作有效的线索。这一设计同时实现两个目标一方面保证线索有据可依线索必然能索引到真实文档杜绝凭空生成的幻觉短语另一方面将线索生成的解码空间压缩到语料实际包含的短语集合上显著减少无关解码干扰。阶段二证据生成Evidence Generation证据生成阶段分为文档检索与评分与前瞻性约束解码证据生成两大步骤。1文档检索与评分基于生成的线索从语料库中检索包含这些线索的文档对文档进行评分评估指标包括线索在文档中的出现频率、分布情况等根据评分排名确定一个候选文档子集作为后续生成证据的基础。2前瞻性约束解码证据生成针对每个候选文档都存在对应的文档级 FM-Index。通过文档级 FM-Index 可以快速定位线索在候选文档中的位置从而缩小无关的解码空间。具体的解码过程按如下三个子步骤进行定位未来窗口Locate Future Windows对于每个线索在文档中确定包含该线索的未来窗口——即线索周围的一段文本范围将模型的注意力聚焦在可能包含与线索相关证据的区域评估窗口相关性Evaluate Window Relevance对定位到的未来窗口通过计算其内部文本与查询之间的语义相似度来评估相关性调整解码 LogitsAdjust Decoding Logits根据窗口相关性的评估结果调整解码 logits——如果某个未来窗口相关性高就提高该窗口内词汇的生成概率使生成的证据更倾向于来自这些高相关性的未来窗口。可以看到这一阶段实质上是把检索内化为受索引约束的生成文档级 FM-Index 提供空间定位未来窗口提供生成素材语义相关性打分则决定每个词汇的生成倾向。相比传统 RAG 将整段检索文本原样拼入上下文RetroLLM 是按需、按相关度逐词生成证据从而避免了输入冗余。阶段三答案生成Answer Generation在前面成功生成证据的基础上模型再次发挥其生成能力依据这些证据内容生成最终的答案以回答最初用户输入的查询。由于证据本身已经经过了线索约束与前瞻性相关度筛选答案生成阶段的输入质量更高答案的准确性与可解释性也相应提升。此外原论文的研究内容还明确指出RetroLLM 探索联合训练Joint Training方法使检索任务与生成任务在统一的目标下协同优化进一步弥合检索与生成之间的鸿沟。四、实验结果域内域外均占优Token 消耗显著下降原论文在两类任务设定下对 RetroLLM 进行了验证域内任务In-domainNQ、TriviaQA、HotPotQA 数据集域外任务Out-of-domainPopQA、2WIKI 数据集。据论文报告RetroLLM 在上述开放域问答任务中均表现出色优于传统 RAG 方法同时RetroLLM显著减少了 Token 消耗。其背后的原因有二精准检索细粒度证据RetroLLM 定位到的是文档中与线索相关的未来窗口这一细粒度证据而非整篇检索文档避免了无关文本进入上下文动态决定检索证据的数量模型根据查询与线索的实际匹配情况按需生成证据无需固定地检索固定数量的文档进一步压缩了推理开销。需要说明的是本仓库所收录的这篇进展报告未给出具体评测数值以上均为原论文的定性结论精确的得分与 Token 节省比例请以论文原文为准。五、在本仓库中的知识坐标从《大模型基础》第 6 章到生成式检索RetroLLM 并非孤立的单点创新而是检索增强生成这条研究主线上的最新一环。本仓库恰好为理解它的位置提供了两条清晰的路径路径一教材主线。《大模型基础》教材第 6 章检索增强生成从 6.1 简介讲到 6.5 实践与应用帮助读者先建立 RAG 的整体认知框架架构、知识检索、生成增强读完本章后再看 RetroLLM就能理解它是在知识检索环节向生成环节的深度渗透。路径二论文脉络。大模型经典论文列表的检索增强生成章节按主题编排了大量可追踪的原作经典 RAG 起点Lewis 等人 2020 年的RAGreadme.md架构演化In-context RALM、REPLUG、Atlas、RETROImproving language models by retrieving from trillions of tokens、Self-RAG等readme.md——展示检索与生成如何从外挂拼接逐步走向深度融合知识检索基础DPR、ColBERT、HNSW/ANN 近似最近邻搜索等readme.md生成式检索综述From matching to generation: A survey on generative information retrievalreadme.md——值得注意的是该综述的作者团队如 Xiaoxi Li、Zhicheng Dou与 RetroLLM 同源说明 RetroLLM 正是从匹配到生成这一研究纲领的延续与深化。建议的阅读顺序是先读第 6 章 PDF 建立 RAG 知识底座再借助论文列表追踪从经典 RAG 到生成式检索的演进路线最后回到本文理解 RetroLLM 如何在解码阶段完成检索-生成一体化。六、总结与展望RetroLLM 的贡献可以概括为三点一是架构上消除独立检索器降低部署成本二是将检索细粒度化到未来窗口级别的证据消除输入冗余并显著节省 Token三是通过分层 FM-Index 与前瞻性解码把检索约束嵌入自回归生成过程提升证据准确性从而增强大语言模型在开放域问答等实际应用中的可靠性与有效性。从延伸思考的角度看以下为基于原论文机制的推断并非论文中的明确结论落地时值得关注两个维度其一两层 FM-Index 的构建与维护成本——语料库级索引覆盖整个语料文档级索引按需构建如何平衡索引精度与构建开销是工程化的关键其二线索质量的敏感性——线索是检索的锚点线索若偏离查询意图后续文档评分与窗口定位都会受影响因此线索生成与联合训练的质量直接决定框架上限。RetroLLM 为我们展示了一条值得持续关注的路线当检索不再是一次性的外部动作而是贯穿解码全程的内在约束时大模型的知识运用方式将变得更加精准、节俭且可解释。赞分享文档教程大模型【免费下载链接】Foundations-of-LLMsA book for Learning the Foundations of LLMs项目地址https://gitcode.com/GitHub_Trending/fo/Foundations-of-LLMs点击查看免费下载相关推荐RAG 生成阶段Generation深度解析检索结果如何转化为事实性回答RAG 生成阶段Generation深度解析检索结果如何转化为事实性回答 导读 本文聚焦 RAG检索增强生成流水线中关键的 生成Generatio文档教程知识库Guidance约束生成技术深度解析Guidance约束生成技术深度解析 本文深入解析Guidance框架中的核心约束生成技术包括Select选择器、正则表达式约束、上下文无关文法 CFG 应用大模型提示工程AI Agent如何用 douyin-downloader 快速上手抖音视频、主页、直播的去水印下载完整实战教程如何用 douyin downloader 快速上手抖音视频、主页、直播的去水印下载完整实战教程 douyin downloader 是一个免费开源的抖音批量网页爬虫CLI上一篇financial-services callable_agents机制研究预览能力与单层委派约束完整指南下一篇如何用PCL2启动器内存优化功能让低配电脑流畅玩Minecraft创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表