尧图网站设计 尧图网站设计YAOTU DESIGN
ARTICLE DETAIL

资讯详情

深耕网站设计与一线实操的经验洞察。

模型后训练:从 SFT 到强化学习的工程实践

模型后训练:从 SFT 到强化学习的工程实践 模型后训练从 SFT 到强化学习的工程实践Agent LLM 上下文 工具。当上下文工程和工具设计已经做到位剩下的瓶颈往往在 LLM 本身——这时需要通过后训练改动模型权重把能力沉淀进参数。本章系统讨论了从预训练到 RL 的四阶段能力开发流水线以及 SFT 与 RL 在工程实践中的本质区别、数据合成方法和环境工程要点。四阶段能力开发全景现代模型的能力开发通常拆成四个环节阶段用什么数据优化目标学到什么典型代价预训练海量原始互联网文本预测下一个词语言规律、世界知识、基本推理极高Mid-training目标语言/领域语料继续预测下一个词补齐领域知识、基础能力中到高SFT几千~几万条示范对预测下一个词只在回答上算损失指令遵循、输出格式、流程协议低RL任务、环境奖励信号最大化期望奖励可迁移的决策策略、探索出的新解法高一个直觉类比预训练是通识教育Mid-training 是研修专业教材SFT 是老师示范答题规范RL 是自己下场做题、按得分反复打磨。SFT 的本质换了数据的预测下一个词SFT 在数学上和预训练是同一个任务——都是预测下一个词、最小化同一个损失函数。差别只有两点数据不同SFT 用人工准备的输入—输出示范对损失屏蔽loss masking计算损失时把问题部分的 token 屏蔽掉只对回答部分回传梯度SFT 的本质是用极高的样本效率把一套稳定的输入→输出映射与协议固化进参数。它固化的是格式、风格、流程这类协议性知识而非大量事实性知识。SFT 与 RL 的本质区别两条贯穿全章的主线之一是SFT 记忆RL 泛化SFT 最大化标注回答的概率——推动模型复现示范。示范缺乏多样性时容易对表面模式过拟合。RL 最大化期望奖励——模型探索多条路径提高高奖励路径概率。当奖励忠实时可能发现示范中没有的可迁移策略。从概率分布看SFT 常表现出覆盖式倾向尽量覆盖训练数据中的多个模式RL 配合反向 KL 约束更容易表现出寻峰倾向集中到少数高奖励峰上。维度SFTRL优化目标最大化标注答案概率最大化期望奖励样本效率高几千条见效低常是 SFT 的几十~上百倍训练稳定性高、收敛快低、易震荡分布漂移下取决于示范覆盖取决于奖励与探索最适合固化格式/风格/流程需泛化到新场景Mid-training补知识与基础能力Mid-training 解决两类缺口知识缺口通用预训练未覆盖目标语言、领域文档和基础能力缺口长上下文、代码模式、跨模态表征。为什么不应把 SFT 当成主要知识注入工具少量 QA 对只覆盖有限问法更擅长训练如何访问与表达不适合承载大规模、相互关联的原始知识。Mid-training 降低领域文本的语言模型损失也不保证模型会自动按用户问题取出知识——稳健配方通常是 Mid-training 吸收知识 → 小规模 SFT 建立输出格式 → 有非零成功率后再 RL。数据构造的关键步骤包括从失败分布反推数据缺口、构造高密度目标语料、按能力进行数据配比、每个阶段做双重回放通用保留数据长度提升后的旧任务、用多维门禁决定何时停止。SFT 的工程实践LoRA 参数高效微调全参数微调对显存要求很高LoRA 在原始权重旁挂一个低秩补丁学习任务参数量仅占 1%-5%。关键实践必须应用到所有主要权重矩阵尤其 MLP 层只加在注意力层会掉点最优学习率约是全参微调的 10 倍SFT 用中高 rank64-256RL 用小 rank8-32SFT 数据从哪来三条路径经常组合使用人工专家示范——质量最高但贵且慢适合定义格式的种子数据教师模型生成合成数据——让强模型批量产出过滤后蒸馏给学生拒绝采样——模型自己采样多条候选用验证器筛出正确样本再反过来训练自己蒸馏Prompt 蒸馏与 CoT 蒸馏Prompt 蒸馏把长提示 思考型教师的行为压缩到短提示/无提示 非思考学生中可获得 20-30 倍的响应速度提升。CoT 蒸馏把教师模型的完整思考轨迹转移给学生模型。在同等参数量下可恢复教师 70%-80% 的能力。DeepSeek-R1 开源的蒸馏小模型正是这条路线的代表。值得注意的是对绝大多数做后训练的人来说根本不需要去蒸馏闭源模型的思维链。当前最先进的开源模型与 SOTA 闭源模型差距并没有想象中大教师模型只需要明显高于学生即可。RL 算法从 rollout 到参数更新GRPO 的四步闭环GRPOGroup Relative Policy Optimization是当前最常用的 RL 算法之一。以 SWE-bench 的一条修复任务为例让策略模型重复尝试同一份代码和问题描述复制到 16 个隔离沙箱让模型独立解决 16 次每次叫一个 rollout计算奖励验证器在干净环境中应用补丁并运行测试通过得 1、失败得 0计算相对优势组内平均成功率 4/16通过的 4 条得正优势、失败的 12 条得负优势梯度下降更新策略提高正优势轨迹中选择的概率降低负优势的PPO 与 GRPO 的区别主要在拿谁来比较GRPO 直接比较同一问题的多条 rollout不需要额外价值模型PPO 训练价值模型估计每步通常能做到多好更适合需要细粒度信用分配的长轨迹。On-Policy 与数值误差LLM RL 通常优先 on-policy——让当前策略自己生成 rollout训练集中在当前模型实际会进入的状态。但大规模训练中推理引擎vLLM/SGLang和训练引擎FSDP/Megatron即使加载同一权重浮点精度、归约顺序、张量并行方式的差异也可能让同一 token 的 log probability 不同使名义上的 on-policy 变成隐式 off-policy。敏感性来自放大链条log probability 小误差 → 指数化的概率比偏差 → 长前缀上的累积 → clipping 改变 → 梯度方向改变。若 4000 个 token 的 log ratio 都有10−310^{-3}10−3同向偏差轨迹级比率会累积到e4≈54.6e^4 \approx 54.6e4≈54.6。RL 环境从评估到仿真环境工程是 RL 的前置条件RL 训练的瓶颈往往不在算法而在环境是否足够真实、可重置、可并行。真实 API 有速率限制、会封号、有副作用根本无法直接用于训练。环境工程的顺序应是任务蓝图 → 可重置模拟器 → 确定性验证器 → 训练/评估隔离 → 少量真实交互校准。造不出环境怎么办让模型扮演环境当高保真环境根本造不出来时可以用 LLM 扮演环境模型合成工具调用的返回值如 ZeroSearch 用 LLM 扮演搜索引擎甚至仿真整个环境的动态如 DreamGym 蒸馏环境转移。但模拟器的世界知识就是训练的天花板系统性偏差会被策略照单全收——稳妥做法是混合使用模型模拟和真实环境交互。多轮任务的信用分配从单轮到多轮复杂性发生质变策略不仅要选择当前最优动作还要在延迟奖励下进行信用分配——判断多步序列中到底哪一步对最终结果贡献最大。工具调用 RL 引入了一个关键实现细节环境返回的 token 不是策略生成的计算策略梯度时应屏蔽这些反馈 token只对模型自己的思考和工具调用参数回传梯度。否则模型会被训练去预测沙盒输出而不是学会如何使用工具。何时选择 Mid-training、SFT 与 RL书中给出了实操诊断框架观察到的现象主要缺口优先方法passk仍接近 0知识与能力不在基模中Mid-training偶尔做对但格式不稳定行为协议没有固化SFT有非零成功率但好策略概率低概率分配与策略优化RL只有少量示范无在线环境可模仿数据有、在线反馈无SFT/RFT核心判断逻辑是先排除不需要改权重的方案prompt、工具、约束能解决就不训练再测能力支持passk近零先补 Mid-training用 SFT 立协议不塞知识只在有探索空间时上 RL。经典 RL 与 LLM Agent 的根本差异书中用同一个寻宝游戏对比了 Q-learning 与 LLM AgentQ-learning需要近 10000 局试错10 秒但理解门“钥匙”剑只是无意义符号LLM Agent第一局就在 18 步内通关每一步都有目的和逻辑支撑姚顺雨在《The Second Half》中总结的 OpenAI 认知演变值得深思不是算法 环境 先验而是先验 环境 算法。预训练赋予的先验知识使 LLM Agent 能够理解未见过的指令零样本泛化用少量示范适应新任务——这与无先验知识、需大量试错的经典 RL 形成鲜明对比。小结本章的两条主线贯穿始终主线一是SFT 记忆RL 泛化——在受控实验条件下SFT 对训练数据过拟合RL 在分布变化时更容易学到可迁移策略但这是特定实验条件下的结果不是 SFT 与 RL 的普遍属性。主线二是数据和环境比算法更重要——掌握现成 RL 算法PPO、GRPO的基本用法即可真正决定成败的是 Mid-training 语料有没有补齐底座、示范数据有没有建立行为协议、仿真环境与奖励能不能提供可靠反馈。很多场景下只要前两类数据质量到位甚至根本不需要做 RL。本文内容整理自开源技术书《深入理解 AI Agent》(bojieli/ai-agent-book)采用 Apache 2.0 许可证
返回列表