尧图网站设计 尧图网站设计YAOTU DESIGN
ARTICLE DETAIL

资讯详情

深耕网站设计与一线实操的经验洞察。

DRACO:面向长视界智能体训练的动态评分细则细粒度信用分配

DRACO:面向长视界智能体训练的动态评分细则细粒度信用分配 DRACO:面向长视界智能体训练的动态评分细则细粒度信用分配arXiv编号:arXiv:2609.04094v1摘要基于可验证奖励的强化学习(RLVR)在具备程序校验器的任务中效果出色,但绝大多数长视界智能体任务不存在程序式真值校验器。本文研究**无结果真值(outcome(1‑Q_j)blind)**设置:训练全程无法获取任务成功的真值信号,全部训练信号只能来自过程性评判标准。多维度评分细则(rubric)是获取这类奖励的常用手段,但它仅能对整条轨迹输出一个标量奖励;对于数十步的长轨迹,单一标量信号的学习效果很差。本文提出DRACO:Distributing Rubric(1‑Q_j)based Advantage for Credit Optimization(基于评分细则的优势分配信用优化算法)。DRACO在训练过程中动态生成每条轨迹专属评分细则,对完整轨迹完成打分,再将评判结果重分配到对应的执行步骤,在GRPO(Group Relative Policy Optimization)框架内生成差异化的逐步优势值。整套重分配采用闭式解析解,不需要额外训练归因模块。在AppWorld基准上,DRACO相比基座模型提升15.9个点;对比使用稀疏真值奖励训练的GRPO基线,提升5.3个点,整个过程完全不依赖任何程序校验器。在跨域的τ \tauτ-bench基准上,即使不使用顶尖大模型作为评判器,相比基座模型依然提升5.3个点,优于真值奖励训练基线以及其他基于评分细则的训练方案。关键词长视界智能体、信用分配、GRPO、动态评分细则、无结果真值强化学习、过程监督目录引言相关工作2.1 基于评分细则的奖励2.2 步骤级信用分配方法3.1 背景知识:GRPO算法3.2 单条轨迹动态评分细则3.3 基于评分细则的步骤信用分配3.3.1 步骤质量3.3.2 符号保持的步骤权重3.3.3 步骤优势值3.3.4 训练循环实验4.1 实验配置4.1.1 实验设置4.1.2 训练与实现细节4.1.2.1 数据与模型4.1.2.2 RL超参数4.1.3 评测方案4.1.3.1 评测基准4.1.3.2 评测指标4.1.3.3 评测协议4.2 整体实验结果4.2.1 相比基线的性能增益4.2.2 可复现性与任务发现能力4.3 消融实验4.3.1 结果奖励的影响4.3.2 评分细则类型与步骤信用分配4.3.3 自评判器Self(1‑Q_j)judge4.4 分析实验4.4.1 评测开销与episode长度4.4.2 轨迹终止模式4.4.3 静态评分细则会饱和,动态评分细则不会结论局限性伦理声明参考文献附录A 补充实验结果A.1 Self(1‑Q_j)judge变体A.2 与前沿大模型对比附录B 补充分析B.1 自评判器对比前沿评判器B.1.1 标注:应用给定评分细则B.1.2 生成:编写评判标准B.1.3 合并:候选标准合并为打分集合B.2 动态评分细则包含哪些内容B.3 为什么步骤信用分配依赖动态评分细则附录C 评分细则构建附录D 训练超参数D.1 Qwen2.5(1‑Q_j)32B(1‑Q_j)Instruct服务配置D.2 (\tau)(1‑Q_j)bench检索配置附录E 信用重分配完整推导E.1 前置知识:GRPO与token级优势E.2 符号与设定E.3 完整公式推导E.4 各项数学项含义E.5 手工演算示例E.6 真实日志轨迹演算样例E.7 全票通过/失败轨迹会关闭信用区分能力E.8 配置参数E.9 七条数学性质附录F 全套提示词脚本1 引言可验证奖励强化学习RLVR在数学推理、工具调用智能体领域取得巨大成功,该范式依靠程序校验器(单元测试、正则匹配)提供可靠的终端奖励。但大量真实智能体场景不存在可用的程序真值校验器,例如客户服务、开放式研究智能体;要构造这类场景的校验器,难度几乎等同于解决任务本身。本文研究无结果真值(outcome(1‑Q_j)blind)设定:训练阶段完全不能访问任务成功真值,全部训练信号只能来自过程评判标准。该场景比绝大多数强化学习文献的假设条件更难。同时长视界智能体还面临经典信用分配难题:一条轨迹包含几十步互相依赖的工具调用;即便可以拿到轨迹级标量奖励,把同一个标量均匀分配给每一步,统计效率低下甚至会带来负面影响:成功轨迹中存在冗余、碰运气的步骤;失败轨迹中大量步骤其实是正确的。现有工作大多在存在真值结果前提下做步骤级信用分配;缺少面向无结果真值场景的方案:如何把评分细则输出的评判信号,路由分配到每一个执行步骤。DRACO整体两大核心组件动态逐轨迹评分细则生成:训练时针对每一条采样轨迹生成专属评判标准,适配策略模型不断变化的行为;对完整轨迹打分。评分细则条件下的步骤信用重分配:闭式解析解,把整条轨迹的GRPO优势,按照评判器标注的步骤归因结果重新分配到各个步骤;不引入任何可训练归因模块。关键特性:信用重分配严格守恒整条轨迹总梯度推动幅度,不会放大/削弱整条轨迹的总更新强度,只改变内部步骤之间的梯度分配。在AppWorld基准上,DRACO(Qwen3.6(1‑Q_j)27B)相比基座TGC指标提升15.9点;在零样本跨域τ \tauτ-bench同样获得收益。消融实验证明:动态评分细则 + 步骤信用分配两者必须组合,单独一个组件收益有限。静态评分细则随着训练会快速饱和,失去区分信号;动态细则可以持续提供判别性训练信号。本文贡献形式化定义无结果真值场景下,基于评分细则的强化学习问题;梳理该领域现有工作。提出DRACO:动态逐轨迹评分细则 + 闭式步骤信用重分配;给出7条严格证明的数学不变性质;不需要训练额外归因网络。在AppWorld、τ \tauτ-bench开展完整实验、大规模消融;验证动态细则、步骤信用分配、自评判器变体的效果;分析饱和现象、开销、长度特性。公开全套提示词脚本、超参数、演算示例;所有附录提供可复现细节。2 相关工作2.1 基于评分细则的奖励一部分方法在训练过程迭代更新评分细则,每条完整轨迹打分;但是只输出整条轨迹标量,没有细粒度步骤分配,例如DR(1‑Q_j)Tulu、EvoRubric。另一类工作在每一步都调用评判器生成细则,绑定任务分解;开销巨大,每一步都要调用LLM评判。Rubrics(1‑Q_j)to(1‑Q_j)Tokens是为数不多把轨迹级评分映射到token的工作,但依赖固定评判标准,并且需要训练判别器模块。DRACO继承“轨迹完成后打分”范式,增加闭式步骤信用重分配,不需要训练任何归因模块。2.2 步骤级信用分配现有LLM智能体步骤信用分配方案,绝大多数依赖任务真值结果:训练进度估计器、回溯Q值、参考模型似然。少数使用LLM做事后归因,但依然需要真值结果作为监督。DRACO区别:✅ 完全不需要任务真值结果;✅ 不绑定特定动作空间;✅ 信用重分配是闭式解析解,无训练参数。方法无结果真值评分细则奖励动态细则轨迹级打分步骤归因无训练归因模块DR(1‑Q_j)Tulu✓✓✓✓✗(1‑Q_j)EvoRubric✓✓✓✓✗(1‑Q_j)RubricARM✗✓✓✓✗(1‑Q_j)ARCO◐✓✓✗✓✗RubricEM✓✓✓✗✓✓SCRIBE◐◐✓✗✗✗Rubrics(1‑Q_j)to(1‑Q_j)Tokens◐✓✗✓✓✗AgentEvolver✗◐✗✓✓✓HCAPO✗✗✗✓✓✓SALT✗✗✗✓✓✓DRACO(本文)✓✓✓✓✓✓符号说明:✓支持;✗不支持;◐部分支持;(1‑Q_j)不适用。3 方法策略模型π θ \pi_\thetaπθ​执行长视界episode,任务x xx生成轨迹τ = ( s 1 , a 1 , … , s T , a T ) \tau=(s_1,a_1,\dots,s_T,a_T)τ=(s1​,a1​,…,sT​,aT​),包含多轮推理与工具调用。训练全程没有程序校验器;全部奖励来自评判器输出的评分细则。整套方法分为两大模块。3.1 背景知识:GRPO算法对于任务x xx,采样一组G GG条轨迹τ i ∗ i = 1 G {\tau_i}*{i=1}^Gτi​∗i=1G,每条得到标量奖励R i R_iRi​。GRPO在组内做标准化,得到轨迹优势:A ∗ i = R i − mean ⁡ ( R j ) std ⁡ ( R j ) A*{i}=\frac{R_{i}-\operatorname{mean}({R_j})}{\operatorname{std}({R_j})}A∗i=std(Rj​)Ri​−mean(Rj​)​轨迹τ i \tau_iτi​的token序列y i , 1 , … , y i , N i y_{i,1},\dots,y_{i,N_i}yi,1​,…,yi,Ni​​。GRPO将同一个标量A i A_iAi​施加给该轨迹全部token,策略梯度:∇ θ J = E [ ∑ t = 1 N i A i ∇ θ log ⁡ π θ ( y i , t ∣ y i , t , x ) ] \nabla_{\theta}\mathcal{J}=\mathbb{E}\left[\sum_{t=1}^{N_i}A_i\nabla_\theta\log\pi_\theta(y_{i,t}\mid y_{i,t},x)\right]∇θ​J=E[t=1∑Ni​​Ai​∇θ​logπθ​(yi,t​∣yi,t​,x)
返回列表