尧图网站设计 尧图网站设计YAOTU DESIGN
ARTICLE DETAIL

资讯详情

深耕网站设计与一线实操的经验洞察。

Reasoning in Diffusion Large Language Models is Concentrated in Dynamic Confusion Zones

Reasoning in Diffusion Large Language Models is Concentrated in Dynamic Confusion Zones 一、文章主要内容总结该研究聚焦扩散大型语言模型(dLLMs)的强化学习(RL)优化,核心围绕“去噪轨迹中推理过程的非均匀性”展开分析与方法创新:核心问题指出:现有dLLM的轨迹型RL方法普遍采用均匀子采样策略,假设所有去噪步骤同等重要,但这一假设存在缺陷——推理过程中仅少数“关键节点”决定最终成败,均匀分配梯度预算会浪费计算资源在无意义步骤上,导致训练不稳定、推理精度不足。轨迹动态分析:通过熵基不确定性、置信度边际(CM)不确定性、熵变化率(RoEC)三种指标,首次系统分析dLLM去噪轨迹,发现轨迹中存在“困惑区”(zones of confusion):即不确定性骤增、信念突变的短暂阶段,且这些区域的位置会随训练进程和任务类型动态变化,与最终推理结果强相关。方法提出:基于上述分析,提出自适应轨迹策略优化(ATPO)框架,核心是用“RoEC+CM混合规则”替代均匀子采样,动态将梯度预算分配给高杠杆步骤(困惑区),且不改变原有RL目标、奖励函数和计算预算。实验验证:在GSM8K、Math500、数独、Countdown等推理基准测试中,ATPO与diffu-GRPO、GDPO、d2等方法相比,在不同生成长度下均实现推理精度提升,同时显著增强训练稳定性;消融实验证明RoEC与CM的混合策略优于单一指标策略。二、文章创新点打破均匀性假设:首次从理论和实证层面否定“
返回列表