尧图网站设计 尧图网站设计YAOTU DESIGN
ARTICLE DETAIL

资讯详情

深耕网站设计与一线实操的经验洞察。

10B激活参数如何撑起智能体模型?——MiniMax-M2 Series技术报告精读

10B激活参数如何撑起智能体模型?——MiniMax-M2 Series技术报告精读 10B激活参数如何撑起智能体模型——MiniMax-M2 Series技术报告精读原论文The MiniMax-M2 Series: Mini Activations Unleashing Max Real-World Intelligence作者MiniMax完整贡献者名单见原论文附录版本arXiv:2605.26494v22026年7月30日原文https://arxiv.org/abs/2605.2649430秒看懂这篇论文研究问题怎样让每个token只激活约100亿参数的稀疏模型完成需要数十到数百轮工具调用的编码、搜索和办公任务技术路线229.9B总参数、9.8B激活参数的MoE基础模型加上可执行环境中的智能体数据、Forge强化学习系统、交错思考与自我迭代工作流。核心结果M2.7在多项智能体基准上接近闭源前沿模型并较M2、M2.5持续提升但它并非多数榜单的第一名。最值得看报告把数据构造、奖励设计和长轨迹训练基础设施讲得比一般模型卡更细。最大局限大量数据、算力和内部基准未完全公开跨模型脚手架并不总是一致“自我进化”也仍处在人类设目标和审查的边界内。1. 这不是单纯的“更小模型”故事报告的口号是“mini activations, max real-world intelligence”。这里的“mini”不是模型只有98亿参数而是每个token只激活约98亿参数模型总容量仍有2299亿参数。这个区别很重要MoE把容量与单步计算量部分解耦却不会自动把显存、通信、路由、缓存和部署成本都缩小到同样比例。M2系列真正想回答的是当大模型从一次性问答进入长时智能体任务性能瓶颈是否已经从“参数量不够”转向“缺少可验证轨迹、稳定的长程信用分配以及能承载不规则任务时长的训练系统”报告把答案组织成四层基础架构、数据流水线、Forge强化学习基础设施和M2.7的自我迭代。来源原论文 Figure 1PDF第1页由原PDF页面忠实裁剪论文标识 arXiv:2605.26494v2。图中可见M2.7在若干任务上有竞争力但SWE-bench Pro、MLE-Bench lite、GDPval-AA等并非最高。2. 基础模型稀疏容量、全注意力与MTPM2是62层decoder-only Transformerhidden size为3072词表大小200,064最长上下文192K。每层MoE含256个细粒度专家每个token激活8个专家路由使用sigmoid gating和可学习的expert bias。注意力采用48个query head与8个key-value head的GQA并在所有层保留full attention。报告给出的预训练总量是29.2T tokensconstant phase约19.9Tdecay phase约9.3T上下文从8K逐级扩展到32K和192K。遗憾的是数据来源比例、去重细节、训练集污染检查、优化器参数、总训练FLOPs和硬件规模没有达到可独立复现的程度。作者专门比较了full attention与hybrid sliding-window attention。小于32K的一些任务差异有限SWA甚至偶有优势但在128K检索和上下文翻译上差距明显例如RULER 128K CWE从90降到72、MTOB K-e BLEURT从60降到45。因此M2选择了更昂贵、但在其生产评测中更稳妥的全注意力。这个结论依赖特定训练配方不能外推为“稀疏注意力必然无效”。来源原论文 Figure 2PDF第7页由原PDF页面忠实裁剪arXiv:2605.26494v2。Multi-Token PredictionMTP同时承担训练辅助目标和推理时草稿模型。预训练初期使用一个MTP模块后续通过权重复制扩展为三个推理时三个模块先提出候选token再由主模型一次前向验证。小规模消融中MTP对MATH与HumanEval有提升但并非所有指标都单调改善真正明显的提升更多来自细粒度专家设计。因此MTP更像“质量与推理吞吐的联合设计”而不是单独解释M2.7成绩的万能组件。3. 数据把智能体轨迹变成可验证训练样本报告最有工程价值的部分是数据流水线。它没有只说“使用高质量合成数据”而是把任务环境、奖励和验收对象绑定起来。来源原论文 Figure 3PDF第8页由原PDF页面忠实裁剪arXiv:2605.26494v2。SWE流水线从GitHub PR与commit出发筛选已合并且带测试的变更再让agent构造可运行Docker环境。不同PR按bug fix、feature addition、performance optimization等类型路由分别提取Fail-to-Pass、Pass-to-Pass或性能测试。随后还会做任务描述与测试的一致性检查并通过注入bug、合并commit、转换为SWE-Test等方式扩增难度。AppDev没有天然的gold patch因而走另一条路领域专家提供meta query和技术栈约束模型采样开发轨迹再由Agent-as-a-Verifier把应用部署到沙箱中依次检查能否运行、交互功能是否正确、视觉质量是否达标。这里的关键思想是“artifact-aligned reward”代码任务看测试表格任务重算单元格研究任务查证据演示文稿既检查执行与结构也看最终渲染。同一原则被扩展到Terminal-Gym、深度搜索、知识工作、财务分析、电子表格和幻灯片生成。优点是奖励比单一LLM judge更接近真实产物风险是验证器本身可能成为新的偏差来源。模型可能学会适应测试、rubric或代理验证器而不是获得更广义的可靠性。4. Forge长轨迹强化学习首先是系统问题智能体轨迹可能短至数秒也可能长达数小时、占用192K上下文。若严格FIFO最慢任务会阻塞整个批次若谁先完成就先训练短而简单的任务会被过度采样。Forge试图同时处理吞吐、训练稳定性和不同agent scaffold的兼容性。来源原论文 Figure 4PDF第20页由原PDF页面忠实裁剪arXiv:2605.26494v2。Forge将Agent Side、Gateway/Data Pool中间层、Rollout Engine和Train Engine解耦。白盒agent可以暴露上下文管理黑盒agent只需把每次LLM调用呈现的状态、动作和观察交给网关。这样训练系统既可接入内部agent也能接入API形式的外部agent而不读取其内部实现。算法层面报告采用CISPOClipped Importance Sampling Policy Optimization把每次LLM completion视为动作单元但在完整episode上计算信用。奖励由任务结果、过程信号和完成时间组成速度奖励鼓励并行工具调用process reward惩罚格式错误或低质量中间步骤。训练数据在reasoning、coding、agent和general四域混合避免连续单域训练造成遗忘或负迁移。来源原论文 Figure 5PDF第22页由原PDF页面忠实裁剪arXiv:2605.26494v2。Windowed FIFO只允许从队首窗口内抽取已完成轨迹窗口内可乱序跨窗口仍保持FIFO。文中实践值为窗口约占队列的0.3。它是一种清晰的工程折中比严格FIFO少空等又比全局greedy更能保持数据分布。然而报告没有给出完整吞吐-偏差曲线0.3并不是可直接迁移到其他集群的通用常数。来源原论文 Figure 6PDF第23页由原PDF页面忠实裁剪arXiv:2605.26494v2。Prefix tree merging把共享长前缀的多个completion合成一棵计算树公共上下文只做一次前向分支再独立计算loss。作者声称在特定场景可获得最高40倍训练加速并降低显存但未给出足够的任务分布、硬件和基线细节因此应把“40×”理解为系统上限案例而非M2训练全程的平均加速。5. 交错思考为什么工具调用之间要保留推理状态来源原论文 Figure 7PDF第25页由原PDF页面忠实裁剪arXiv:2605.26494v2。M2采用interleaved thinking推理、工具调用、观察结果再推理全部留在同一条轨迹中。与“先一次性想完再行动”相比它能根据工具反馈修正计划与每轮丢弃旧思考相比它不用反复重建假设。作者称去掉历史thinking block会让深度搜索和软件工程任务明显下降但报告没有给出这项消融的完整数表与置信区间。更谨慎的结论是在其训练与脚手架下保留推理状态与长程任务表现相关并符合机制直觉。6. 自我迭代自动化研究助手不是脱离人类的自举来源原论文 Figure 8PDF第26页由原PDF页面忠实裁剪arXiv:2605.26494v2。Model Iteration System中人类负责配置harness、设定目标、通过对话引导并在关键节点reviewagent读取日志、诊断异常、修改代码和配置、生成报告并在边界内自动继续。论文称它承担RL团队日常30%到50%的迭代工作还完成过100轮自主改进使内部评测提升30%。这些数字有启发性但缺少公开任务、对照组和失败记录不能据此宣称模型已经能自主完成模型研发。来源原论文 Figure 9PDF第29页由原PDF页面忠实裁剪arXiv:2605.26494v2。Figure 9显示M2到M2.5再到M2.7在11项可比基准上都提高增幅尤其集中在BrowseComp、Toolathlon、GDPval-AA和MLE Bench Lite等新数据流水线覆盖的领域。这支持“后训练系统持续改善产品能力”的叙事却不能隔离究竟是数据规模、数据质量、RL算法、基础模型继续训练还是脚手架变化造成了提升。来源原论文 Figure 10PDF第30页由原PDF页面忠实裁剪arXiv:2605.26494v2。MLE Bench Lite包含22场机器学习竞赛每次试验给agent 24小时运行于单张A30沙箱报告三次独立试验的平均奖牌率为66.6%最佳一次获得9金、5银、1铜。曲线说明迭代过程中最佳验证结果逐步改善也显示“真实/CV选择”的奖牌率低于按内部验证挑选的上限提示模型选择仍会过拟合。三次试验足以作为案例却不足以给出稳定方差估计更不能覆盖真实ML工程的部署、安全和维护要求。7. 成绩应该怎样读M2.7的定位更接近“以较低激活量换取前沿附近表现”而不是全面SOTA。例如SWE-bench Pro为56.2低于GPT 5.4的57.7Terminal-Bench 2.0为57.0明显低于GPT 5.4的75.1BrowseComp为77.8低于Gemini 3.1 Pro的85.9GDPval-AA为50.0低于GPT 5.4的58.0。另一方面Multi-SWE-bench的52.7、VIBE-Pro的55.6和AIME 2026的94.2确实处在前沿区间。比较还存在三类混杂。第一部分基准是内部的VIBE-Pro、HyperTask、RISE、MM Claw和Finance Modeling Pro外部尚难复核。第二编码基准中多数模型使用Claude Code统一脚手架但GPT 5.4使用原生Codex scaffold并非严格同构。第三报告倾向长程、环境可验证任务这与M2的数据和系统设计高度匹配这是合理的产品定位却不等于覆盖所有语言模型能力。8. 贡献、局限与复现判断我认为这份报告有三点实质贡献。其一它把智能体后训练的数据单位从“问答对”提升为“环境、轨迹、产物、验证器”的组合。其二它正面处理了长轨迹RL的调度、共享前缀计算和黑白盒agent兼容问题。其三它把交错思考和自我迭代放入同一套训练-部署闭环而不是只展示单轮推理分数。局限也同样明显预训练语料与许可信息不透明没有总训练算力、能耗和成本许多关键数字来自内部基准消融无法隔离四层系统的独立贡献安全、网络攻击、奖励黑客、工具权限和失控迭代缺少系统评测报告由模型开发方撰写尚非独立同行评审证据。229.9B总参数下的部署内存、专家并行通信与KV cache成本也不能被“9.8B激活”一句话抹平。复现层面可复现的是设计原则可执行任务、产物对齐奖励、混合域RL、窗口FIFO和共享前缀合并。不可复现的是同等规模结果因为数据、训练代码、Forge实现、内部评测和算力配置均不完整。工程团队更适合先复现一个窄域闭环而不是直接复制整个M2系统。9. 给研究与工程实践的启发如果要把这份报告转化为自己的项目我会优先做四件事先为任务定义可执行验收标准把失败轨迹连同环境快照保留下来区分模型策略、agent scaffold与验证器的贡献最后才扩展RL规模。对多数团队而言提升验证器质量和环境可重复性可能比盲目增加参数更划算。M2系列最值得借鉴的不是某个榜单数字而是它对“智能体能力从哪里来”的回答容量给出上限数据提供任务分布奖励决定模型追求什么基础设施决定这些信号能否在长轨迹上稳定放大。这个闭环如果缺一环所谓自我进化就很容易退化为对内部测试的自动化调参。总结MiniMax-M2 Series是一份信息密度较高的工业技术报告。它展示了一个约98亿激活参数的MoE模型如何依靠29.2T token预训练、可验证智能体数据、Forge长程RL、交错思考和受人监督的自我迭代在多类真实任务基准上进入前沿区间。报告最强的是系统设计与工程经验最弱的是独立验证和完整复现条件。读者可以相信“这套方法形成了有竞争力的闭环”但暂时不应把“激活参数少”“自我进化”或个别内部指标直接等同于低成本、通用性或自主科研能力。参考资料与图片来源MiniMax.The MiniMax-M2 Series: Mini Activations Unleashing Max Real-World Intelligence. arXiv:2605.26494v2, 2026.本文全部图片均来自上述论文Figure 1-10由本地原始PDF页面忠实裁剪未生成、重绘、增强或添加标注。
返回列表