尧图网站设计 尧图网站设计YAOTU DESIGN
ARTICLE DETAIL

资讯详情

深耕网站设计与一线实操的经验洞察。

【arXiv 技术报告 2025】NVIDIA Nemotron 3:高效与开放智能|从大模型高效推理架构视角

【arXiv 技术报告 2025】NVIDIA Nemotron 3:高效与开放智能|从大模型高效推理架构视角 摘要本文解读 arXiv 技术报告 2025 论文《NVIDIA Nemotron 3: Efficient and Open Intelligence》。该论文提出Nemotron 3 模型家族Nano / Super / Ultra通过融合混合 Mamba-Transformer MoE 架构、LatentMoE 潜空间路由与NVFP4 低精度训练面向 Agentic AI 场景实现高效开放智能其特别之处在于用 Mamba-2 的恒定状态替换线性增长的 KV Cache并支持1M token 上下文。实验表明Nano 30B-A3B 推理吞吐达 Qwen3-30B-A3B 的 $3.3$ 倍且精度同级最优把开源大语言模型的精度-吞吐前沿整体前移为高效推理与 Agentic AI 部署提供了重要借鉴。视频讲解点击观看 B 站视频摘要论文基本信息背景与动机研究主线从问题到结论基准/方法设计分类全景方法细节实验设计与结果结果对比总结关键发现局限性常见问题FAQNemotron 3 与标准 MoE 大模型的核心区别是什么为什么 Nemotron 3 不需要 RoPE 就能支持 1M token 上下文NVFP4 训练为什么损失差能控制在 1% 以内MTP 如何同时提升精度与推理速度Nemotron 3 家族三个模型怎么选Nemotron 3 是否开源参考链接论文基本信息项目内容标题英文NVIDIA Nemotron 3: Efficient and Open Intelligence标题中文NVIDIA Nemotron 3高效与开放智能作者NVIDIA Nemotron 团队公司级白皮书机构NVIDIA 应用深度学习研究Applied Deep Learning Research会议arXiv 技术报告 2025arXivarXiv:2512.20856项目网站NVIDIA NemotronHugging Face背景与动机Agentic AI智能体应用同时要求高精度、高推理吞吐与超长上下文多步工具调用、长上下文 RAG、多智能体协作都需要模型在生成阶段快速产出且不丢失远距离信息。然而标准 Transformer MoE 的 KV Cache 随序列长度线性增长长序列下显存与带宽开销急剧膨胀成为部署成本的核心瓶颈。既有工作的局限Mamba / Mamba-2Gu DaoCOLM 2024用恒定大小的递归状态做序列建模摆脱注意力二次方开销但纯 SSM 模型在语言建模精度上仍弱于 TransformerDeepSeek-V3展示了 MTP多 token 预测辅助目标的价值但未改变 KV Cache 线性增长Qwen3-30B-A3B与 Nemotron 3 Nano 同为 30B-A3B 稠密 Transformer MoE是直接的对比对象NVIDIA Nemotron H率先规模化混合 Mamba-MoE预训练达 3.7T tokens但未与低精度训练、MTP、超长上下文系统性整合。关键差异在于用Mamba-2 层替代大部分 self-attention生成时 KV Cache 从线性增长变为恒定状态再以LatentMoE在低维潜空间路由专家来弥补精度损失——这正是精度-吞吐双前沿的根源。从历史视角看附录 H混合 SSM-Transformer 从 2023–2024 年 Mamba / Mamba-2 学术原型到 2024–2025 年 Jamba / Samba / Zamba / Nemotron H 的规模化验证再到 2025–2026 年 Nemotron 3 进入 1M 上下文 Agentic 旗舰并在视觉/机器人侧衍生出 VMamba、VideoMamba、RoboMamba 等下游工作恒定推理成本与免 RoPE 长度外推是这条技术路线持续扩散的根本原因。从创新模式看附录 CNemotron 3 的三大动作均有量化证据P2 算子替换——用 Mamba-2 替换绝大部分 self-attention换来 $3.3\times$ 吞吐vs Qwen3-30B-A3B且 RULER 1M 仍达 54.19P10 异构分解差异化处理——路由专家计算压缩到 $\ell$ 维潜空间门控/共享专家保留原维度 $d$同预算消融 5 类任务全胜、MMLU-Pro $4.57$ppP15 属性定向预训练目标——MTP 同时服务多步规划与投机解码草稿两个属性平均精度 $2.4\%$、前 2 个 token 接受率 $\approx 97\%$。每一项创新都配了同预算消融与 1T–25T tokens 的规模化验证。研究主线从问题到结论图 7Nemotron 3 研究主线Mermaid 流程图Agentic AI 需求 → KV Cache 瓶颈 → 混合 Mamba-MoE 设计 → LatentMoE → 同预算消融 → 精度-吞吐双前沿前移基准/方法设计Nemotron 3 是面向Agentic AI的高效开放模型家族包含Nano / Super / Ultra三个规模档位把混合 Mamba-Transformer MoE、LatentMoE、NVFP4 训练、MTP整合进同一训练流程覆盖推理、多步工具使用、长上下文 RAG、多智能体协作等场景支持1M token上下文Nano 30B-A3B 仅需3B 激活参数即可达到同级最高精度。设计总纲一切设计围绕同一目标——精度不变前提下削减带宽与通信把省下的算力转成模型质量。六大关键技术各司其职技术组件作用关键细节混合 Mamba-Transformer MoE恒定状态替代线性 KV CacheMamba-2 层与 MoE 层交错为主仅保留极少数 self-attentionLatentMoE潜空间路由省带宽token 先投影 $d \to \ell$$\ell \approx d/4$再路由/计算专家数与激活数同倍放大NVFP4 训练原生 FP4 GEMM 提速权重/激活/梯度全程 FP4GB300 峰值吞吐 $3\times$ FP8MTP多 token 预测 投机解码草稿前 2 个草稿 token 接受率 $\approx 97\%$长上下文无 RoPE 长度外推CPT 512k SFT 256k RL 长上下文环境支持 1M token多环境 RL单阶段同时训练数学/代码/指令遵循/工具使用等 9 类环境 推理预算控制图 1Nemotron 3 混合 Mamba-Transformer MoE推理吞吐超越同规模 Transformer MoE同时在长上下文任务上保持 SOTA 精度arXiv 2512.20856, Figure 2分类全景图 8Nemotron 3 技术栈分类全景Mermaid 树状图混合 Mamba-MoE 架构、LatentMoE 潜空间路由、NVFP4 训练、MTP 多 token 预测、无 RoPE 1M 长上下文、9 类环境多环境 RL方法细节混合 Mamba-Transformer MoE 层间结构MoE 层与 Mamba-2 层交错为主仅保留极少数 self-attention 层2 个 KV head 的 GQA 注意力层负责全对全路由兼顾稀疏扩展与恒定推理成本。图 2层间结构Mamba-2 与 MoE 层交错为主仅保留极少数 self-attention 层arXiv 2512.20856, Figure 1LatentMoEtoken 先投影 $d \to \ell$$\ell \approx d/4$再路由/计算专家权重加载与 all-to-all 通信量均降为原来的 $d/\ell$省下的预算把专家总数 $N$ 与 top-$K$ 同倍放大8B 消融中从 128 专家/6 激活提升到512 专家/22 激活精度/字节比显著提升。图 3LatentMoE vs 标准 MoE专家计算与 all-to-all 通信全部下沉到 $\ell$ 维潜空间arXiv 2512.20856, Figure 3NVFP4 数值格式附录 B元素格式E2M116 元素细粒度 micro-block 缩放 E4M3 块缩放 二级 FP32 全局缩放权重使用 2D block scalingwgrad 输入加RHTRandom Hadamard Transform梯度随机舍入fprop / dgrad / wgrad 全部使用原生 NVFP4 GEMMcuBLAS Transformer EngineGB300 峰值吞吐达 FP8 的 $3\times$。保精度策略网络最后 $15\%$、QKV/注意力投影、LatentMoE 潜空间投影、MTP 层保持BF16Mamba 输出投影改用MXFP8——NVFP4 下该处冲刷归零高达 $40\%$NanoMXFP8 后损失差收敛到 $1\%$。MTP 多 token 预测轻量模块预测后续 token兼作投机解码草稿无需独立 draft 模型前 2 个 token 接受率 $\approx 97\%$加速长文生成的同时提供更密的训练信号。无 RoPE 长上下文Mamba 的隐式位置信息天然规避长度外推的分布外问题通过 CPT 512k SFT 256k RL 长上下文环境的分阶段训练最终支持1M token上下文。推理预算控制附录 D用户指定思考轨迹的最大 token 数 budget到达预算后追加/think让模型基于部分思考继续生成一条精度-效率权衡曲线覆盖从快答到深度推理的全部需求成本敏感的 Agentic 应用可按 SLA 动态切预算推理成本不再是黑盒。图 6Nano 在不同 token 预算下的精度-效率权衡曲线arXiv 2512.20856, Figure 10实验设计与结果评测协议通用评测用 MMLU / MMLU-Pro、代码 HumanEval/MBPP、数学 GSM8K/MATH-500、常识理解长上下文用 RULER128k–1M与 1M token 仓库级代码 NLLRL 环境覆盖数学与科学推理、竞赛编程、指令遵循、软件工程、搜索、聊天、工具使用、长上下文共9 类单阶段同时训练。消融在8B active / 73B total MoE、1T tokens、同超参下进行Standard MoE$d4096$、128 专家、6 激活vs LatentMoE$\ell1024$、512 专家、22 激活基线包括 Standard MoE、Qwen3-30B-A3B、Nemotron-Nano-12B-v2、BF16 全精度。主表8B active / 1T tokens 同预算消融任务Standard MoELatentMoE提升MMLU-Pro48.3052.874.57MMLU70.1072.112.01Code 平均51.9555.143.19Math 平均78.3280.191.87常识理解平均81.7382.100.37参数量8.09B/72.6B8.02B/72.8B≈ 相同同预算下 LatentMoE 在全部 5 类任务胜出MMLU-Pro 提升最大达 4.57pp。长上下文优雅退化RULER 上 MoE 混合模型 128k/256k/512k/1M 得分 74.48/71.67/66.02/54.19而稠密混合模型 1M 处骤降至 23.43——MoE 外推显著更稳健。NVFP4 逼近 BF16训练/验证损失相对差 Nano $1\%$、8B active $0.6\%$量化损失随规模缩小A3B → A8B敏感层保精度是关键消融结论且小损失差不转化为下游评测退化。图 4NVFP4 vs BF16 损失差随规模缩小敏感层保精度显著收窄损失差arXiv 2512.20856, Figure 6多环境 RL单次 RL 运行内同时优化数学、代码、指令遵循、工具使用等异构环境配合推理预算控制。图 5单次 RL 运行内同时优化多个异构环境数学、代码、指令遵循、工具使用等arXiv 2512.20856, Figure 8MTP 消融附录 A8B MoE任务Baseline (8B MoE) MTPMMLU (5-shot)70.0671.26MMLU-Pro (CoT)45.0547.84MBPP-Sanitized (3-shot)65.5866.89ARC-Challenge (25-shot)86.4388.05RACE (0-shot)84.0285.36GSM8K (8-shot)82.4984.46平均提升 $\approx 2.4\%$MTP 训练信号更密、鼓励多步规划且草稿 token 与主模型高度一致前 2 个接受率 $\approx 97\%$。结果对比总结图 9结果对比总结Mermaid 流程图LatentMoE 同预算 5/5 任务全胜MMLU-Pro 48.30→52.87Nano 30B-A3B 吞吐 3.3 倍于 Qwen3-30B-A3BRULER 1M 达 54.19 优雅退化关键发现LatentMoE 同预算全面胜出8B active / 73B total、1T tokens 下 5/5 类任务优于 Standard MoEMMLU-Pro 提升最大4.57pp。长上下文优雅退化RULER 1M 得分 54.19MoE 混合模型而稠密混合模型仅 23.43两者差距超过 30 分。NVFP4 逼近 BF16Nano 训练/验证损失差 $1\%$、8B active $0.6\%$GB300 峰值吞吐达 FP8 的 $3\times$。推理吞吐 $3.3\times$Nano 30B-A3B 在 8k in / 16k out 推理负载下吞吐达 Qwen3-30B-A3B 的 $3.3$ 倍长序列下优势更大。MTP 双赢8B MoE 消融平均 $2.4\%$ 精度前 2 个草稿 token 接受率 $\approx 97\%$无需独立 draft 模型。全栈开源权重 10T tokens 数据 训练配方1M token 上下文仅需 3B 激活参数。局限性发布节奏当前仅 Nano 配套完整技术报告Super/Ultra 数周后发布白皮书不含其独立评测。白皮书形式无逐基准完整数字与误差线第三方独立评测尚未出现。注意力层保真度仅 2 个 KV head 的 GQA 注意力层承担全对全路由信息混合能力受限以 BF16 保精度缓解。安全与数据审查10T tokens 数据集的合规与安全性有待社区开放审查。作者展望未来数月将开源全部权重、预训练/后训练软件与配方、可再分发数据并发布 Super/Ultra 完整技术报告。常见问题FAQNemotron 3 与标准 MoE 大模型的核心区别是什么核心是混合架构用 Mamba-2 层替换绝大部分 self-attention生成时 KV Cache 从线性增长变为恒定状态再以 LatentMoE 潜空间路由弥补精度损失。为什么 Nemotron 3 不需要 RoPE 就能支持 1M token 上下文Mamba-2 的循环状态天然携带隐式位置信息规避了 RoPE 在超长序列上的分布外外推问题再配合 CPT 512k、SFT 256k 与长上下文 RL 环境的分阶段训练。NVFP4 训练为什么损失差能控制在 1% 以内E2M1 元素格式 micro-block 缩放 RHT 梯度随机舍入降低了量化噪声同时网络最后 15%、QKV/潜空间投影保持 BF16Mamba 输出投影改用 MXFP8敏感层被单独保护。MTP 如何同时提升精度与推理速度MTP 辅助目标提供更密的训练信号、鼓励多步规划平均精度提升约 2.4%其轻量模块又充当投机解码草稿前 2 个 token 接受率约 97%无需独立 draft 模型。Nemotron 3 家族三个模型怎么选Nano30B-A3B面向低成本高效推理Super/Ultra 面向更强能力三者共享同一混合架构与训练流程推理预算控制机制让用户按 SLA 在精度、延迟、成本之间显式取舍。Nemotron 3 是否开源是。NVIDIA 计划开源全部权重、预训练/后训练软件与配方、可再分发数据10T tokensNano 已配套完整技术报告。参考链接Nemotron 3: Efficient and Open IntelligencearXiv:2512.20856NVIDIA NemotronHugging Face 模型库权重与项目发布Mamba: Linear-Time Sequence Modeling with Selective State SpacesarXiv:2312.00752Transformers are SSMs: Generalized Models and Efficient AlgorithmsarXiv:2401.03854DeepSeek-V3 Technical ReportarXiv:2412.19437Better Faster Large Language Models via Multi-token PredictionarXiv:2304.03273Megatron-LM: Training Multi-Billion Parameter Language ModelsarXiv:1909.08053Nemotron H混合 Mamba-MoE 架构先例arXiv:2505.22554给大家推荐一款自用写文献综述、无虚构文献的 AI复旦大学 FudanNLP 团队自研 切问学术官网qiewenpaper.com覆盖3.6 亿篇可溯源真实中英文文献能自动整合文献观点生成规范综述还能挖掘研究创新点、复现实验配合视频教学新手快速上手文献综述写作后记博客的关键词集中在编程、算法、机器人、人工智能、数学等等持续高质量输出中。讨论QQ群白拾的小屋 (750365700)⭐B站账号白拾的物理AI组会活跃于知识区和动画区✨GitHub主页YhbCode000工程文件
返回列表