尧图网站设计 尧图网站设计YAOTU DESIGN
ARTICLE DETAIL

资讯详情

深耕网站设计与一线实操的经验洞察。

【北大】RAG新范式:把“检索”变成Token生成,小模型逼近GPT-4o

【北大】RAG新范式:把“检索”变成Token生成,小模型逼近GPT-4o 背景检索控制为何难以与生成推理深度协同现有研究试图从检索控制入手优化检索时机与证据利用主要分为两类一类是无需训练的启发式方法靠不确定性信号触发检索另一类是基于监督学习的方法让模型掌握检索行为覆盖单步控制及迭代式深度搜索。但这些方案普遍存在核心局限检索时机、查询重构与终止决策并未作为可训练动作融入模型的单一解码轨迹而是依赖辅助控制器或多阶段流程。这种分离不仅让错误归因变得困难更无法让模型学习到与自身推理状态紧密绑定的一致性策略。针对这一痛点研究者提出了Retrieval as Generation检索即生成的全新范式不再将检索视为外部干预而是直接嵌入模型的生成过程。基于该范式的GRIP框架通过控制令牌的发射调节检索行为实现了检索与推理的深度耦合让模型能够自主完成检索规划、查询重构与终止决策的全流程。热力评分95分关键亮点提出Retrieval as Generation全新范式将检索控制内化为token级自回归解码过程通过专属控制令牌实现检索时机、查询重构与终止的端到端统一决策无需外部控制器或多阶段流程解决传统RAG检索与生成分离的核心瓶颈。数据亮点基于LLaMA3-8B小模型在5个知识密集型QA基准上超越现有开源RAG基线Avg.Score达41.0接近GPT-4o的41.4经强化学习优化后平均检索次数减少22.5%实现任务自适应检索大幅降低冗余检索开销。是否开源已开源。方法亮点一、令牌级统一检索-生成控制无外部控制器的端到端融合GRIP的核心创新在于将检索控制完全嵌入自回归令牌级解码流程无需额外外部控制器。它定义了4种专属控制令牌分别承担检索与生成的不同调控功能• [RETRIEVE]触发外部证据检索• [INTERMEDIARY]输出当前推理状态或已有知识• [ANSWER]启动最终答案生成• [SOLVED]终止整个检索-推理流程。这些令牌构成两类核心行为分支当需补充证据时模型输出[INTERMEDIARY] [RETRIEVE]序列天然支持多步递归检索当信息足够时则输出[ANSWER] [SOLVED]序列。通过极简的控制接口检索与生成的协调完全在自回归流程内完成实现端到端的联合学习。二、自触发信息规划流程模型自主决策的闭环推理GRIP的核心机制是自触发信息规划让模型自主决定“何时检索、生成何种查询、何时终止”整个流程在单一自回归轨迹中展开分为四个核心步骤初始决策接收原始查询后模型先判断内部知识是否足够回答。若足够直接输出[ANSWER]答案[SOLVED]终止若不足先输出[INTERMEDIARY]展示当前推理/知识再输出[RETRIEVE]并生成检索查询。检索与迭代查询生成基于当前查询检索相关段落并补充到上下文后模型重新评估信息充足性。若证据足够则生成最终回答并终止若仍不足输出[INTERMEDIARY]说明推理状态再生成[RETRIEVE]与针对性新查询结合原始问题与已得信息聚焦未解决部分进入下一轮循环。多跳递归推进“推理-检索”交替递归进行每个[INTERMEDIARY]反映当前理解状态每个[RETRIEVE]带着精准查询补充缺失知识逐步推进推理。终止机制输出[ANSWER][SOLVED]时流程结束为保证效率设置默认3轮检索上限达到上限后强制基于现有信息生成回答。框架图清晰展示了GRIP的完整流程上半部分为训练阶段通过结构化样本完成监督微调再经强化学习优化回答质量与检索控制下半部分为推理阶段的自触发信息规划模型通过动态发射控制令牌自主决策。GRIP框架概述三、结构化监督学习绑定令牌行为与检索场景为让模型将检索控制内化为生成技能GRIP设计了结构化监督范式将四类检索场景与对应控制令牌模式绑定通过标注样本让模型学习检索控制逻辑Type-α直接可回答场景筛选基础模型多次解码均能精确匹配答案的样本训练模型输出[ANSWER]答案[SOLVED]序列对应无需检索的简单问题。Type-β需触发检索的部分回答场景通过宽松覆盖型精确匹配指标筛选样本训练模型先输出[INTERMEDIARY]展示部分知识再输出[RETRIEVE]原始查询让模型识别自身不确定性并触发检索。Type-γ多跳/复杂知识场景筛选BM25检索后仍无法回答的样本借助外部模型生成针对缺失信息的优化查询训练模型多轮迭代输出[INTERMEDIARY][RETRIEVE]优化查询直至信息充足后输出[ANSWER][SOLVED]。Type-θ需信息筛选合成场景通过CoverEM指标筛选需压缩/筛选检索信息的样本训练模型输出[INTERMEDIARY][RETRIEVE][ANSWER]序列学会在噪声语境中选择性利用证据。下图展示了四类样本对应的令牌结构与示例通过这种语言原生的监督方式模型可将检索控制内化为自身生成行为的一部分。GRIP中的四种结构化训练样本每种样本对应特定的令牌模式以控制检索行为四、两阶段训练优化兼顾控制逻辑与检索效率GRIP采用两阶段训练策略先让模型掌握检索控制逻辑再平衡检索效率与回答质量监督微调SFT阶段使用包含推理内容与控制令牌的结构化目标序列训练最小化自回归交叉熵损失其中为输入查询为包含自然语言内容与控制令牌的真实目标序列。此阶段让模型学习不同场景下的令牌发射与检索行为模式。强化学习RL阶段解决SFT模型易出现的过度检索问题设计两类互补奖励信号•回答保真度奖励用BLEU分数衡量生成答案与真实答案的相似度鼓励生成精准、语义贴合的回答•控制准确性奖励对正确发射控制令牌的行为奖励对错误/缺失令牌的行为惩罚强化检索控制逻辑。总奖励定义为采用DAPO算法优化模型使其形成平衡的检索策略既保证回答质量又避免冗余检索。实验结果实验设置研究者在5个典型知识密集型QA基准上全面评估GRIP覆盖多跳推理、长尾实体、开放域事实查询等多样化任务类型•HotpotQA多步推理导向的组合式任务•PopQA聚焦长尾实体的开放域问答•Natural QuestionsNQ通用开放域事实查询•WebQuestionsWebQ基于网页知识的开放域问答•TriviaQA阅读理解类事实问答。评测采用多维度指标全面衡量性能精确匹配EM、回答完整性指标ROUGE、令牌级匹配度F1同时以Avg.Score所有数据集与指标的未加权平均值作为综合性能基准。主结果小参数RAG超越开源基线性能逼近GPT-4oGRIP在所有开源RAG系统中表现最优显著领先GainRAG、RobustRAG等强训练基线更值得关注的是基于LLaMA3-8B小参数模型的GRIPAvg.Score达到41.0与GPT-4o的41.4十分接近。其中GRIP在多跳或组合性强的任务如HotpotQA、TriviaQA上提升尤为显著同时其ROUGE与F1分数始终高于其他基线证明GRIP生成的回答不仅准确性更高还兼具更好的完整性与语义贴合度。五个问答基准测试的主结果检索行为分析自适应、高效的检索决策机制1. 检索深度的动态适应性通过两类对比子集验证GRIP的检索控制能力无需检索的样本子集针对DRAGIN/GainRAG触发检索但GRIP直接回答的样本GRIP的Avg.Score达到42.7高于DRAGIN的41.2与GainRAG的37.4说明GRIP能精准判断内部知识是否足够有效避免冗余检索。DRAGIN/GainRAG至少执行一次检索而GRIP无需检索即可回答的样本子集。百分比表示各数据集上该子集的占比。需深度检索的困难样本子集针对GRIP触发两次检索但基线最多检索一次的样本GRIP的Avg.Score为22.1远超DRAGIN的19.6与GainRAG的15.5证明GRIP能主动检测信息缺口并扩展检索深度。GRIP执行两次检索而DRAGIN/GainRAG最多执行一次检索的样本子集2. 跨任务的检索次数自适应各模型的跨任务平均检索次数对比显示GRIP具备明确的任务感知能力• 在多跳推理、长尾知识需求强烈的HotpotQA1.44次、PopQA1.58次中主动增加检索次数• 在多数问题可依赖内部知识解决的NQ0.76次中显著减少检索次数。对比来看GainRAG固定单次检索R1-Searcher平均检索次数高达5.12次而GRIP在保证性能的前提下大幅降低检索成本且经过强化学习后平均检索次数从1.60降至1.24减少22.5%同时保留了任务自适应的检索模式。每个示例的平均检索次数3. 迭代查询生成提升检索精准度对比GRIP生成的新查询与原始查询的检索效果以top-1、top-3段落包含正确答案的比例为指标结果显示GRIP生成的查询在NQ、WebQ上的检索覆盖度显著高于原始查询尤其是top-1段落的提升更为明显。这说明GRIP的迭代推理过程能生成更具针对性的查询精准聚焦未解决的信息缺口有效提升证据检索的效率与准确性。4. 可控预算下的自适应检索与深度外推调整最大检索预算B的性能测试显示当B从3增加到10时Avg.Score从41.0提升至41.8而平均检索次数仅从1.24增加到1.62远低于预算上限说明GRIP不会盲目消耗检索资源而是根据推理需求触发检索即使训练阶段最多仅使用3轮检索测试时更大的预算仍能带来性能提升证明模型学会了自主判断信息需求而非机械遵循固定检索步骤。推理阶段最大检索预算B的影响鲁棒性与通用能力验证框架优势而非依赖外部资源1. 开源教师模型替代实验为验证GRIP性能是否依赖专有模型监督研究者将Type-γ样本中用于生成优化查询的GPT-4o-mini替换为开源模型LLaMA3-8B-Instruct与Qwen3-32B• 替换为Qwen3-32B后GRIP的Avg.Score达到40.3与使用GPT-4o-mini的41.0十分接近• 即使替换为同参数的LLaMA3-8B-InstructGRIP仍能达到39.0的Avg.Score。这表明GRIP的性能优势核心来自框架设计而非依赖专有模型的监督信号。2. 通用语言能力的有效保留针对检索控制微调可能损害通用能力的顾虑研究者在非RAG任务上进行验证• 在MMLU多任务知识测试、MBPP代码生成任务中GRIP相比基础Instruct模型仅出现微小性能下降而SFT-RAG的性能下降幅度则十分显著• 在CNN/DailyMail摘要任务上GRIP与基础Instruct模型的胜率为51.0%远高于其他检索基线证明GRIP在学习检索控制机制的同时很好地保留了通用生成能力。结论与展望从更长远的视角看GRIP真正重要的意义是重新定义了RAG系统的架构边界。当检索时机、查询生成与终止决策不再由外部控制器拼接完成而是成为语言模型自回归解码的一部分RAG第一次从“工程系统”转变为“模型能力”。这种从外挂式增强到内生式能力的转变使小参数模型也能展现出接近顶级闭源模型的知识获取与推理表现同时显著降低无效检索成本为构建高效、可控、低成本的知识增强系统打开了新的路径。当模型能够在生成过程中主动决定何时寻找证据、如何改写查询、以及何时停止搜索检索就不再是工具调用而成为思考本身的一部分。学AI大模型的正确顺序千万不要搞错了2026年AI风口已来各行各业的AI渗透肉眼可见超多公司要么转型做AI相关产品要么高薪挖AI技术人才机遇直接摆在眼前有往AI方向发展或者本身有后端编程基础的朋友直接冲AI大模型应用开发转岗超合适就算暂时不打算转岗了解大模型、RAG、Prompt、Agent这些热门概念能上手做简单项目也绝对是求职加分王给大家整理了超全最新的AI大模型应用开发学习清单和资料手把手帮你快速入门学习路线:✅大模型基础认知—大模型核心原理、发展历程、主流模型GPT、文心一言等特点解析✅核心技术模块—RAG检索增强生成、Prompt工程实战、Agent智能体开发逻辑✅开发基础能力—Python进阶、API接口调用、大模型开发框架LangChain等实操✅应用场景开发—智能问答系统、企业知识库、AIGC内容生成工具、行业定制化大模型应用✅项目落地流程—需求拆解、技术选型、模型调优、测试上线、运维迭代✅面试求职冲刺—岗位JD解析、简历AI项目包装、高频面试题汇总、模拟面经以上6大模块看似清晰好上手实则每个部分都有扎实的核心内容需要吃透我把大模型的学习全流程已经整理好了抓住AI时代风口轻松解锁职业新可能希望大家都能把握机遇实现薪资/职业跃迁这份完整版的大模型 AI 学习资料已经上传CSDN朋友们如果需要可以微信扫描下方CSDN官方认证二维码免费领取【保证100%免费】
返回列表