尧图网站设计 尧图网站设计YAOTU DESIGN
ARTICLE DETAIL

资讯详情

深耕网站设计与一线实操的经验洞察。

让AI智能体学会“复盘进化“:清华等提出SEED框架,自进化蒸馏突破稀疏奖励瓶颈

让AI智能体学会“复盘进化“:清华等提出SEED框架,自进化蒸馏突破稀疏奖励瓶颈 大模型智能体在长程任务中常常知其然不知其所以然——只知道最终成没成却不知道哪一步走对了、哪一步走错了。SEEDSelf-Evolving On-Policy Distillation框架让智能体像种子一样自我进化一边执行任务收集经验一边自动复盘提炼技能再把这些经验内化成自身能力实现了性能、样本效率和泛化能力的全面提升。一、先搞懂智能体强化学习的监督鸿沟难题在深入SEED之前我们先理解一个核心痛点。如今的大语言模型正在从一问一答的对话模式进化为能多轮交互、调用工具、与环境互动的AI智能体Agent。比如让AI帮你网购商品、在虚拟房间里找东西放东西、通过搜索引擎回答复杂问题……这些任务都需要智能体一步步做决策。为了训练这样的智能体强化学习RL是主流方法。但这里有个大问题奖励太稀疏了想象一下你学下棋下完一整盘才知道自己赢了还是输了但中间哪一步是妙手、哪一步是昏招没人告诉你。智能体强化学习也是如此——通常只有等一整条任务轨迹结束才能拿到一个成功/失败的最终结果中间几十上百步的决策每一步是对是错完全没有直接反馈。这就形成了一道监督粒度鸿沟上方是轨迹级的稀疏奖励只有最终结果下方是token级的策略学习每一个字都要学中间巨大的信息差导致智能体学习效率很低尤其是在长程任务中可能要探索很久才能碰巧走对一次。二、SEED框架全景一颗会自我进化的种子SEED的核心思想非常巧妙事后诸葛亮也是诸葛亮。一条轨迹走完之后站在上帝视角回头看其实能看出很多门道哪一步是关键决策、哪些操作可以复用、失败的原因是什么……这些后见之明Hindsight如果能转化为监督信号就能填补稀疏奖励的空白。但怎么转化呢SEED给出了一套两阶段自进化框架整体架构一览SEED分为两个训练阶段第一阶段后见之明技能SFT先教会模型一件事给你一条完整的交互轨迹你能用自然语言总结出其中的技能——比如成功经验、避坑指南、通用流程。第二阶段自进化在策略蒸馏同一个模型身兼二职既是执行者去环境里收集轨迹又是分析者从自己跑完的轨迹里提炼技能把技能带来的行为变化蒸馏成密集的token级监督信号和强化学习一起优化模型更新后执行者和分析者同步升级形成自我进化的闭环。最妙的是推理的时候完全不需要技能、不需要额外模块所有经验都已经内化到模型参数里了部署零额外成本。三、第一阶段后见之明技能SFT——教会模型复盘总结第一阶段的目标很明确给模型植入复盘能力。3.1 离线轨迹收集先用一个基础模型在训练任务上跑一批轨迹就像让新手先随便做做任务积累一批原始经验。每条轨迹都包含完整的观察、动作、奖励和最终结果。3.2 外部分析器标注技能然后用一个外部的强模型比如GLM-5.2作为老师给每条轨迹写一段后见之明技能如果轨迹成功了就总结成功的策略、可复用的工作流如果轨迹失败了就分析失败原因、给出纠正或规避的规则。这些技能都是自然语言形式的比如先系统地检查所有货架再行动、不要在没找到目标物品时就去目标容器之类的经验总结。3.3 监督微调最后用这些轨迹→技能的数据对微调我们的策略模型。微调之后模型就具备了一项新能力看到一条完整的交互轨迹就能自动提炼出其中的可复用技能。这一步就像是给模型上了一堂复盘课教会它怎么从经验中总结规律。四、第二阶段自进化在策略蒸馏——让经验内化为本能如果说第一阶段是学会复盘那第二阶段就是用复盘来进化自己。这是SEED最核心的部分也是自进化三个字的由来。4.1 共享模型双重角色每一轮训练开始时先把当前策略模型冻结住这个快照同时扮演两个角色Actor执行者去环境里和任务交互收集一批轨迹Analyzer分析者拿到这些跑完的轨迹用第一阶段学到的能力逐条生成后见之明技能。划重点这两个角色共享同一套模型参数。所以模型每更新一次执行能力和分析能力会一起变强——执行者能探索更复杂的状态分析者能提炼更高阶的技能两者同步进化。4.2 技能增强上下文重新打分有了轨迹和对应的技能之后SEED做了一件很巧妙的事同一条动作在两种上下文中分别算概率看差了多少。具体来说对轨迹里每一个采样出来的动作token学生分支用普通的交互历史算概率这是模型正常决策的状态教师分支把后见之明技能加到上下文里再算一次概率这是开了上帝视角后的状态。两个概率的差值就是技能带来的行为偏移——技能越支持某个动作这个差值就越大。4.3 转化为密集的蒸馏信号这个概率偏移不会直接用而是通过一个置信门控confidence gate过滤一下正向偏移大的token技能强烈支持的动作给予更强的监督权重负向偏移的token技能不认可的动作权重降低甚至忽略。这样就得到了一个token级的密集监督信号——每一个动作token都有了自己的指导权重不再是整条轨迹共用一个稀疏奖励了。4.4 联合优化闭环进化最后把这个蒸馏损失OPD Loss和传统的强化学习损失GRPO Loss加在一起共同优化策略模型优化完成后新的模型又成为下一轮的ActorAnalyzer继续收集轨迹、提炼技能、更新自己……如此循环往复形成一个自我驱动的进化闭环。五、三大核心创新为什么SEED这么强创新一自进化循环——执行者和分析者同步成长以往的方法要么用固定的外部老师要么用静态的技能库模型进步了但指导者还停留在原地慢慢就跟不上了。SEED的共享参数设计解决了这个问题模型越强复盘能力越强复盘能力越强指导信号质量越高模型就更强。这是一个正向循环的自进化过程。创新二在策略蒸馏——监督永远贴合当前状态很多蒸馏方法用的是离策略数据——老师和学生的行为分布不一样教的东西可能学生根本遇不到。SEED的轨迹是当前策略自己跑出来的技能是针对这些轨迹提炼的所以监督信号完全在策略On-Policy精准命中模型当前正在犯的错、正在探索的状态没有分布偏移问题。创新三密集token级信用分配——每一步都有反馈传统RL只有最终结果整条轨迹所有步骤共享同一个奖励好的坏的混在一起 credit assignment信用分配非常粗糙。SEED通过技能上下文的概率偏移给每一个token都计算了个性化的监督权重实现了细粒度的密集监督大大提升了学习效率。六、实验效果全面碾压基线方法研究团队在三类典型的智能体任务上做了全面测试结果非常亮眼。6.1 三大基准全面领先测试覆盖了三种不同类型的长程智能体任务在3B模型规模的ALFWorld上SEED的平均成功率达到了91.8%而纯GRPO只有75.0%提升非常显著。6.2 样本效率60%数据吊打100%样本效率是SEED的一大亮点。实验显示SEED只用60%的训练数据就能达到80.7%的成功率这个成绩已经超过了用100%数*训练的GRPO75.0%用40%数据的SEED和用80%数据的GRPO表现相当。相当于数据效率直接翻倍每一条轨迹都能榨出更多学习信号。6.3 泛化能力没见过的任务也更强更重要的是泛化性。在ALFWorld的未见过任务拆分上测试SEED的平均成功率比GRPO高出15.3个百分点尤其是Heat加热类任务提升高达35个百分点。这说明SEED不是死记硬背训练轨迹而是真的学到了可迁移的行为策略。6.4 消融实验每个组件都不可或缺研究团队还做了消融实验去掉三个核心组件分别测试去掉后见之明SFT下降5.8个点去掉自进化OPD下降4.8个点把在策略技能换成静态离线技能下降7.4个点三个组件缺一不可其中在策略的同步性影响最大——静态的老师终究不如同步进化的自己。6.5 定性对比一个瞎逛一个直奔目标论文里有个很直观的例子任务是把蜡烛放到马桶里GRPO训练的智能体先跑去马桶那找蜡烛拿了无关的厕纸然后在马桶、架子、洗手台之间来回绕圈到步数上限都没找到蜡烛SEED训练的智能体系统地逐个检查货架在第二层架子上找到蜡烛然后直接放到马桶里5步就完成了。差距一目了然SEED学会了更有条理、更目标导向的决策策略。七、总结与思考SEED这篇工作给我最大的启发是经验的价值不在于存储而在于内化。很多智能体方法喜欢搞记忆库、“技能库”推理的时候去检索调用既增加部署成本又受限于检索质量。SEED走了另一条路——把后见之明的经验通过蒸馏揉进模型参数里推理时零额外开销但能力实实在在地提升了。更重要的是自进化的思路执行者和反思者是同一个体成长同步发生。这其实很像人的学习过程——我们做事情、复盘总结、然后下次做得更好复盘能力本身也在不断进步。当然SEED目前也还有可以探索的方向技能的质量上限受限于模型自身的分析能力目前主要在文本类智能体任务上验证更复杂的多模态、机器人场景效果如何还待探索自进化循环的稳定性在更长训练轮次下是否会出现自我强化的偏差。但无论如何SEED为解决智能体强化学习的稀疏奖励问题提供了一个优雅且有效的新范式。让AI智能体学会自我复盘、自我进化这颗种子或许会长出更强大的智能体能力树。学AI大模型的正确顺序千万不要搞错了2026年AI风口已来各行各业的AI渗透肉眼可见超多公司要么转型做AI相关产品要么高薪挖AI技术人才机遇直接摆在眼前有往AI方向发展或者本身有后端编程基础的朋友直接冲AI大模型应用开发转岗超合适就算暂时不打算转岗了解大模型、RAG、Prompt、Agent这些热门概念能上手做简单项目也绝对是求职加分王给大家整理了超全最新的AI大模型应用开发学习清单和资料手把手帮你快速入门学习路线:✅大模型基础认知—大模型核心原理、发展历程、主流模型GPT、文心一言等特点解析✅核心技术模块—RAG检索增强生成、Prompt工程实战、Agent智能体开发逻辑✅开发基础能力—Python进阶、API接口调用、大模型开发框架LangChain等实操✅应用场景开发—智能问答系统、企业知识库、AIGC内容生成工具、行业定制化大模型应用✅项目落地流程—需求拆解、技术选型、模型调优、测试上线、运维迭代✅面试求职冲刺—岗位JD解析、简历AI项目包装、高频面试题汇总、模拟面经以上6大模块看似清晰好上手实则每个部分都有扎实的核心内容需要吃透我把大模型的学习全流程已经整理好了抓住AI时代风口轻松解锁职业新可能希望大家都能把握机遇实现薪资/职业跃迁这份完整版的大模型 AI 学习资料已经上传CSDN朋友们如果需要可以微信扫描下方CSDN官方认证二维码免费领取【保证100%免费】
返回列表