
note文章目录note一、Deep Research Agent 训练一、Deep Research Agent 训练【Deep Research Agent 训练经验探索】Deep Research智能体通过多轮检索、证据聚合和决策生成解决知识密集型任务RL 是优化其长 horizon 交互行为的关键方法但现有训练方案碎片化难以明确性能驱动因素所以可以做个工作以 “预测准确率、训练稳定性、推理成本” 为统一评估框架拆解Deep Research究智能体 RL 训练的提示模板、奖励函数和策略优三大维度明确各组件对性能、稳定性、成本的影响从提示模板、奖励函数、策略优化三个解耦维度分析其对模型预测精度、训练稳定性和推理成本的影响发现快速思考模板比慢思考模板稳定性和性能更优纯 F1 奖励因答案回避引发训练崩溃加入动作级惩罚后的 F1 奖励可超越 EM 奖励经典的REINFORCE 算法在性能和效率上优于 PPO 且搜索动作更少GRPO 稳定性最差。工作在How to Train Your Deep Research Agent? Prompt, Reward, and Policy Optimization in Search-R1https://arxiv.org/html/2602.19526v1看几个详细核心结论1提示模板。“少思考”更优Fast Thinking模板胜出传统Slow Thinking模板要求模型在检索/回答前通过专用标签进行显式推理但实验表明显式推理长度与任务性能呈负相关过长推理会导致训练崩溃。所以提出FastThinking模板直接引导模型输出检索和回答决策无需冗余推理步骤训练稳定性显著提升Qwen2.5-7B模型平均准确率从0.403提升至0.422Qwen2.5-3B从0.289提升至0.297。崩溃原因在于SlowThinking模板下模型会通过堆叠无意义的推理标签获取奖励形成自我强化的冗余推理循环2奖励函数。F1需结合动作惩罚F1超越EM。现有研究倾向用F1替代ExactMatchEM作为奖励但论文发现纯F1训练因“答案回避”导致训练崩溃—模型为避免错误答案选择不输出答案零奖励与错误答案一致稳定性和性能均劣于EM。提出F1奖励在F1基础上增加动作级惩罚未执行检索/未输出答案时扣分α0.1β0.1既解决答案回避问题又发挥F1对部分匹配的敏感性最终性能超越EMQwen2.5-7B的F1平均准确率0.429高于EM的0.4223对比三大主流算法REINFORCE、PPO、GRPOGRPO稳定性最差易出现训练崩溃PPO依赖价值模型估计优势但稀疏奖励场景下存在偏置导致检索动作冗余单轮/多轮任务检索次数均接近2次REINFORCE无需外部基线直接优化累积回报不仅准确率最高Qwen2.5-7B整体平均0.437且推理成本最低单轮检索约1.02次多轮约1.68次。