
标题CLIPO: Contrastive Learning in Policy Optimization Generalizes RLVR来源arXiv, 2603.10101v1摘要具有可验证奖励的强化学习RLVR显著提高了大型语言模型LLM的推理能力。然而RLVR只依赖最终答案作为结果奖励忽略了中间推理步骤的正确性。对这些过程错误但结果正确的推出进行训练会导致幻觉和答案复制严重破坏模型的泛化和稳健性。为了解决这个问题我们将对比学习机制纳入策略优化CLIPO以推广RLVR过程。通过优化成功推出的对比损失CLIPO引导LLM捕获正确推理路径之间共享的不变结构。这提供了比RLVR中原始的单路径监督更健壮的交叉轨迹正则化有效地缓解了步骤级推理不一致并抑制了幻觉伪影。在实验中CLIPO在不同的推理基准中不断改进多个RLVR基线展示了LLM策略优化的泛化和鲁棒性的统一改进。我们的代码和训练食谱可在https://github.com/Qwen-Applications/CLIPO获得。️文章简介研究问题如何解决现有可验证奖励强化学习RLVR仅依赖最终答案、忽视中间推理步骤正确性从而导致模型产生幻觉和过拟合的问题主要贡献论文提出CLIPO框架将对比学习机制融入策略优化通过最大化成功推理轨迹间的相似性来提取不变逻辑结构显著提升了大语言模型的推理泛化能力和鲁棒性。重点思路构建轻量级对比头将大语言模型生成的推理轨迹映射到语义嵌入空间提取句子级别的表征以捕捉整体语义内容。在每组采样响应内部应用InfoNCE损失函数将正确的推理轨迹作为正样本对拉近错误的轨迹作为负样本推远从而最大化正样本间的互信息。将计算得到的对比损失转化为稠密的辅助奖励信号与稀疏的二元结果奖励相加形成混合奖励机制以指导策略更新。仅在存在多个正确和错误样本的组别中激活对比损失避免退化情况迫使模型学习不同成功路径共享的逻辑本质而非记忆特定答案。分析总结实验表明CLIPO在GSM8K和MATH等多个数学基准上consistently优于GRPO、DAPO等主流基线尤其在符号推理和扰动测试中提升显著。消融实验证明对比头必须与主模型联合训练固定对比头参数会导致性能下降说明自适应的语义空间构建对区分推理质量至关重要。较低的对比学习温度参数能带来更好的性能因为它增强了模型对困难负样本的判别能力使正样本聚类更紧密。增大采样组别规模能提供更多样的正负样本对从而生成更丰富的对比信号进一步提升模型在复杂竞赛级任务上的表现。个人观点论文将无监督对比学习的思想引入有监督的强化学习流程中挖掘“成功路径具有共性”这一隐式规律。附录