DeepSeekMath与GRPO:探索开源语言模型在数学推理中的强化学习优化

发布时间:2026/7/23 13:20:57

DeepSeekMath与GRPO:探索开源语言模型在数学推理中的强化学习优化 1. DeepSeekMath开源数学推理模型的新标杆当ChatGPT在数学题面前频频翻车时一个名为DeepSeekMath的开源模型正在悄然改写游戏规则。这个仅有70亿参数的小个子在最具挑战性的MATH基准测试中取得了51.7%的惊人准确率直逼GPT-4和Gemini Ultra等商业巨头的表现。更令人惊讶的是它完全依靠自身推理能力没有借助任何外部工具或投票技术。DeepSeekMath的成功秘诀来自两大创新首先是其独特的训练数据策略。研究团队从Common Crawl海量数据中精心筛选出1200亿个数学相关token构建了目前规模最大的开源数学语料库。这个数据量是之前知名数学数据集OpenWebMath的9倍更是Minerva所用数据的7倍。有意思的是团队发现arXiv论文对提升数学推理能力帮助有限反而普通网页中的数学内容更具训练价值。另一个突破是模型架构的选择。与常规做法不同DeepSeekMath选择从代码模型DeepSeek-Coder起步而非通用语言模型。这种看似反常的决策带来了意外收获——代码训练显著提升了模型解决数学问题的能力无论是否使用编程工具。这为代码训练是否有助于推理这个长期争议提供了有力证据。2. GRPO强化学习的内存优化革命在模型微调阶段研究团队面临一个棘手难题传统的PPO近端策略优化算法需要同时训练策略模型和价值模型这对显存的要求几乎翻倍。对于7B参数量的模型这意味着需要昂贵的计算资源。为此他们创新性地提出了GRPO组相对策略优化算法。GRPO的核心思想相当巧妙它完全摒弃了独立的价值模型改为从同一问题的多个回答中计算相对得分。具体来说对每个数学问题模型会生成64个不同解答然后根据这些解答的奖励分数分布来计算标准化优势值。这种方法不仅节省了40%以上的显存还更符合人类评判数学解答的方式——我们总是比较不同解法的优劣而非给每个解法打绝对分数。实际效果令人振奋在仅使用部分英语微调数据的情况下GRPO让模型在GSM8K上的准确率从82.9%提升到88.2%MATH测试集上从46.8%提升到51.7%。更难得的是这种提升不仅体现在训练见过的题目类型上连未专门训练的中文数学题CMATH也同步提升了4.2个百分点。3. 数学预训练的数据艺术构建高质量的数学预训练语料库远比想象中复杂。团队设计了一个四阶段的迭代筛选流程先用OpenWebMath作为种子训练分类器再从Common Crawl中挖掘相似内容然后人工标注高价值数学网站用这些新数据改进分类器如此循环直到数据质量达标。这个过程中有几个关键发现网页数据需要严格去重仅URL去重就能减少90%数据量数学内容在网页中呈现长尾分布需要多轮迭代才能充分挖掘适当保留代码数据约20%有助于提升模型性能中英文混合训练使模型具备跨语言数学能力有趣的是数据量并非越多越好。实验显示当训练token超过1200亿时模型性能进入平台期。这说明数据质量比单纯规模更重要也解释了为什么仅用1/7数据量的DeepSeekMath能在某些任务上超越Minerva 540B。4. 从理论到实践GRPO的工程实现要实现GRPO算法需要解决几个技术难点。首先是分组采样的效率问题。传统PPO每次只生成一个回答而GRPO需要同时生成多个通常64个。研究团队采用了两阶段流水线先用小批量数据快速生成多样本再用大批量进行策略更新。另一个挑战是奖励标准化。不同数学问题的绝对分值差异很大直接比较可能失真。GRPO的解决方案是在每组样本内部进行z-score标准化def compute_advantages(rewards): mean np.mean(rewards) std np.std(rewards) return [(r - mean)/std for r in rewards]这种组内相对比较的方式使模型能更专注学习解题思路的优劣而不被题目难度差异干扰。实验表明相比全局标准化组内标准化使训练稳定性提高了37%。过程监督是GRPO的另一大亮点。不同于常规RL只在最终结果打分GRPO可以对解题的每个关键步骤单独评估。这就像数学老师不仅看最终答案还会逐步检查推导过程。实现上需要专门训练一个能识别解题步骤边界的奖励模型这对多步推理的数学题尤为重要。5. 数学推理的强化学习新范式DeepSeekMath研究最宝贵的贡献可能是提出了理解不同微调方法的统一框架。团队发现从SFT监督微调、RFT拒绝采样微调到DPO直接偏好优化、PPO和GRPO这些方法本质上都是强化学习的特殊形式区别主要在于三个维度数据来源离线采样如RFTvs在线采样如GRPO奖励函数规则判断如答案对错vs模型评分梯度系数固定权重vs动态调整在这个框架下GRPO选择了最灵活的配置在线采样模型评分动态调整。这使得它既能实时捕捉策略变化又能精细调节学习强度。对比实验显示这种组合相比固定配置能带来15-20%的额外提升。研究还揭示了RL提升数学能力的本质它主要不是增强基础推理能力而是让模型更靠谱——在多次尝试中更稳定地产出正确解答。这解释了为什么RL能显著提升MajK多数投票准确率但对PassK单次尝试准确率改善有限。6. 开源数学模型的未来方向尽管DeepSeekMath表现出色研究团队也坦诚其局限性。比如在几何证明和定理推导方面它与GPT-4仍有明显差距少样本学习能力也不及商业大模型。这些短板指向几个有潜力的改进方向数据层面需要更多样化的数学内容特别是形式化数学证明数据。当前语料库偏重初等数学对高等数学覆盖不足。算法层面探索树搜索等更复杂的解码策略可能突破PassK瓶颈。架构层面将数学符号处理模块与语言模型结合可能提升公式推导能力。最令人期待的是GRPO的拓展应用。这种方法不只适用于数学任何需要多步推理的任务——如代码生成、逻辑推理——都可能受益。团队正在探索将GRPO与过程监督结合开发能自动分解复杂问题的通用推理框架。在开源模型追赶商业产品的竞赛中DeepSeekMath证明了一个道理通过数据精选和算法创新小模型也能在专业领域创造惊喜。这对资源有限的研究者和企业尤其重要——不需要千亿参数专注和巧思同样能创造突破。

相关新闻