,从入门到精通,收藏这一篇就够了!)
背景这篇论文在解决什么问题现在很多 LLM Agent例如 Web 导航、检索问答、交互式任务都有一个共性痛点每一轮任务都像“失忆重开”。虽然已有 memory-based 方法会保存历史轨迹但原始轨迹通常又长又噪包含大量试错与回退动作最终导致两件事• 信息密度低Token 开销大。• 模型学不到可复用的高层策略只是在“抄作业”。这篇论文提出了SkillRL。其核心思想是把经验从“轨迹记忆”升级为“技能抽象”并让技能库在 RL 训练中持续进化而不是一次性静态写死。方法总览SkillRL 的三段式闭环SkillRL Framework图解整体流程是“收集轨迹 → 蒸馏技能 → 冷启动 SFT 学会用技能 → RL 训练中递归更新技能库”。横向是训练阶段推进纵向是知识形态从 raw trajectory 到 structured skill 的抽象提升。SkillRL 包含三个关键模块Experience-based Skill Distillation将成功/失败轨迹都蒸馏为技能。Hierarchical Skill LibrarySkillBank构建“通用技能 任务专用技能”的分层库。Recursive Skill Evolution在 RL 过程中依据验证失败样本增量扩展技能。为什么它比“存轨迹”更有效Intro Figure图解左图对比了方法差异。传统方法灰色虚线偏向存原始轨迹SkillRL 转向结构化技能抽取。右图给出 ALFWorld 曲线SkillRL 收敛更快、最终成功率更高。作者的关键判断是经验迁移的本质是抽象不是复制。人类专家不会记住每一步点击而是提炼“何时该用什么策略”的技能规则。SkillRL 的技能条目是结构化的通常包含• skill name技能名• principle策略原则• when_to_apply适用条件方法细节拆解1) 经验蒸馏成功学“该做什么”失败学“不要怎么做”先用基础策略 在环境 中采样轨迹保留成功集 和失败集 。• 成功轨迹提炼正向策略• 失败轨迹提炼反事实教训这里教师模型 不只是摘要还会定位失败点、错误原因、正确替代动作与可迁移原则。论文报告该蒸馏可带来约10–20×的 Token 压缩。2) SkillBank分层组织 检索增强决策SkillBank 由两层组成•General Skills跨任务通用策略。•Task-Specific Skills任务类型 的专项启发。推理时给定任务描述 总是注入 并从 中做相似度检索策略条件化为3) 递归进化技能库与策略一起长大• 先做Cold-start SFT让模型先学会“如何使用技能”避免直接 RL 时不会调用技能• 再做 GRPO 训练采用组内归一化优势目标函数PPO-style clipping KL 正则每轮验证后若某类任务成功率低于阈值就分析失败轨迹并生成新技能加入技能库从而形成“失败驱动增量学习”。实验设置与基线• 环境ALFWorld、WebShop、7 个 Search-augmented QA 数据集。• Base ModelQwen2.5-7B-Instruct。• TeacherOpenAI o3。• RLGRPO。• 关键超参检索数、失败更新阈值 、RL 学习率 。主结果不是小幅提升而是一档跃迁ALFWorld WebShop方法ALFWorld(All)WebShop Succ.GRPO77.666.1Mem0GRPO54.737.5SimpleMemGRPO62.546.9SkillRL89.972.7结论非常直接• 相比 GRPOALFWorld 绝对提升12.3%。• 相比强 memoryRL 组合Mem0GRPOALFWorld 领先约35.2%。• 甚至超过 GPT-4o / Gemini-2.5-Pro 在该任务上的分数。Search-Augmented QA7 数据集平均方法Avg.Search-R138.5EvolveR43.1SkillRL47.1在多跳任务尤其 Bamboogle上提升明显说明分层技能对复杂推理链有效。消融实验每个模块都“真有用”变体ALFWorldWebShopSkillRL89.972.7w/o Hierarchical Structure76.861.4w/o Skill LibraryRaw Trajectories61.750.2w/o Cold-start SFT65.246.5w/o Dynamic Evolution84.470.3关键观察• 去掉分层结构后性能显著下降。• 用 raw trajectory 替代 skill library 时下降最大验证了“抽象优于记忆”。• 不做冷启动 SFT 会明显崩溃。• 动态进化还能继续抬升上限。训练动态与效率证据Skill Growth图解技能库从 55 增长到约 100增长主力是 task-specific skills说明策略在训练中确实学到更多任务化“招式”。Prompt Length图解与 raw memory 检索相比SkillRL 的 prompt token 更短且更稳定平均约减少 10.3% 上下文开销。Success Curve图解带递归进化的版本更快到达高成功率约 60 steps 超过 80%且最终上限更高。Case Study图解案例显示 agent 会组合调用 General Skills 与 Task-Specific Skills而非机械复读历史轨迹体现“策略级检索”而非“文本级回忆”。附录中值得关注的复现信息•训练预算8×H100 80GB总墙钟约 30 小时/实验。•冷启动 SFT 数据规模ALFWorld 7500、WebShop 2400。•验证驱动更新频率每 5 steps 可触发一次技能进化。•提示词工程附录给出完整模板覆盖在线执行、失败技能发现、冷启动轨迹合成三类模板。•技能可解释性附录展示了 ALFWorld/WebShop 的技能样例和错误 taxonomy失败原因 → 规避策略。结论SkillRL 的价值不只在“分数更高”还在于它把 Agent 学习范式从Trajectory Memory推向Skill Abstraction Co-evolution• 用结构化技能降低噪声与 Token 成本。• 用冷启动让模型真正学会使用技能。• 用失败驱动递归更新让系统持续适应新场景。如果你在做 Agent 训练这篇文章最可迁移的工程启发是别把 memory 当数据库要把 memory 变成可执行策略接口。学AI大模型的正确顺序千万不要搞错了2026年AI风口已来各行各业的AI渗透肉眼可见超多公司要么转型做AI相关产品要么高薪挖AI技术人才机遇直接摆在眼前有往AI方向发展或者本身有后端编程基础的朋友直接冲AI大模型应用开发转岗超合适就算暂时不打算转岗了解大模型、RAG、Prompt、Agent这些热门概念能上手做简单项目也绝对是求职加分王给大家整理了超全最新的AI大模型应用开发学习清单和资料手把手帮你快速入门学习路线:✅大模型基础认知—大模型核心原理、发展历程、主流模型GPT、文心一言等特点解析✅核心技术模块—RAG检索增强生成、Prompt工程实战、Agent智能体开发逻辑✅开发基础能力—Python进阶、API接口调用、大模型开发框架LangChain等实操✅应用场景开发—智能问答系统、企业知识库、AIGC内容生成工具、行业定制化大模型应用✅项目落地流程—需求拆解、技术选型、模型调优、测试上线、运维迭代✅面试求职冲刺—岗位JD解析、简历AI项目包装、高频面试题汇总、模拟面经以上6大模块看似清晰好上手实则每个部分都有扎实的核心内容需要吃透我把大模型的学习全流程已经整理好了抓住AI时代风口轻松解锁职业新可能希望大家都能把握机遇实现薪资/职业跃迁这份完整版的大模型 AI 学习资料已经上传CSDN朋友们如果需要可以微信扫描下方CSDN官方认证二维码免费领取【保证100%免费】