摘要
本文解读 arXiv 技术报告 2025 论文《NVIDIA Nemotron 3: Efficient and Open Intelligence》。该论文提出Nemotron 3 模型家族(Nano / Super / Ultra),通过融合混合 Mamba-Transformer MoE 架构、LatentMoE 潜空间路由与NVFP4 低精度训练,面向 Agentic AI 场景实现高效开放智能,其特别之处在于用 Mamba-2 的恒定状态替换线性增长的 KV Cache并支持1M token 上下文。实验表明Nano 30B-A3B 推理吞吐达 Qwen3-30B-A3B 的 $3.3$ 倍且精度同级最优,把开源大语言模型的精度-吞吐前沿整体前移,为高效推理与 Agentic AI 部署提供了重要借鉴。
视频讲解:点击观看 B 站视频
- 摘要
- 论文基本信息
- 背景与动机
- 研究主线:从问题到结论
- 基准/方法设计
- 分类全景
- 方法细节
- 实验设计与结果
- 结果对比总结
- 关键发现
- 局限性
- 常见问题(FAQ)
- Nemotron 3 与标准 MoE 大模型的核心区别是什么?
- 为什么 Nemotron 3 不需要 RoPE 就能支持 1M token 上下文?
- NVFP4 训练为什么损失差能控制在 1% 以内?
- MTP 如何同时提升精度与推理速度?
- Nemotron 3 家族三个模型怎么选?
- Nemotron 3 是否开源?
- 参考链接
论文基本信息
| 项目 | 内容 |
|---|---|
| 标题(英文) | NVIDIA Nemotron 3: Efficient and Open Intelligence |
| 标题(中文) | NVIDIA Nemotron 3:高效与开放智能 |
| 作者 | NVIDIA Nemotron 团队(公司级白皮书) |
| 机构 | NVIDIA 应用深度学习研究(Applied Deep Learning Research) |
| 会议 | arXiv 技术报告 2025 |
| arXiv | arXiv:2512.20856 |
| 项目网站 | NVIDIA Nemotron(Hugging Face) |
背景与动机
Agentic AI(智能体应用)同时要求高精度、高推理吞吐与超长上下文:多步工具调用、长上下文 RAG、多智能体协作都需要模型在生成阶段快速产出且不丢失远距离信息。然而标准 Transformer MoE 的 KV Cache 随序列长度线性增长,长序列下显存与带宽开销急剧膨胀,成为部署成本的核心瓶颈。
既有工作的局限:
- Mamba / Mamba-2(Gu & Dao,COLM 2024)用恒定大小的递归状态做序列建模,摆脱注意力二次方开销,但纯 SSM 模型在语言建模精度上仍弱于 Transformer;
- DeepSeek-V3展示了 MTP(多 token 预测)辅助目标的价值,但未改变 KV Cache 线性增长;
- Qwen3-30B-A3B与 Nemotron 3 Nano 同为 30B-A3B 稠密 Transformer MoE,是直接的对比对象;
- NVIDIA Nemotron H率先规模化混合 Mamba-MoE(预训练达 3.7T tokens),但未与低精度训练、MTP、超长上下文系统性整合。
关键差异在于:用Mamba-2 层替代大部分 self-attention,生成时 KV Cache 从线性增长变为恒定状态,再以LatentMoE在低维潜空间路由专家来弥补精度损失——这正是"精度-吞吐"双前沿的根源。
从历史视角看(附录 H),混合 SSM-Transformer 从 2023–2024 年 Mamba / Mamba-2 学术原型,到 2024–2025 年 Jamba / Samba / Zamba / Nemotron H 的规模化验证,再到 2025–2026 年 Nemotron 3 进入 1M 上下文 Agentic 旗舰,并在视觉/机器人侧衍生出 VMamba、VideoMamba、RoboMamba 等下游工作;恒定推理成本与免 RoPE 长度外推是这条技术路线持续扩散的根本原因。
从创新模式看(附录 C),Nemotron 3 的三大动作均有量化证据:P2 算子替换——用 Mamba-2 替换绝大部分 self-attention,换来 $3.3\times$ 吞吐(vs Qwen3-30B-A3B)且 RULER 1M 仍达 54.19;P10 异构分解差异化处理——路由专家计算压缩到 $\ell$ 维潜空间,门控/共享专家保留原维度 $d$,同预算消融 5 类任务全胜、MMLU-Pro $+4.57$pp;P15 属性定向预训练目标——MTP 同时服务多步规划与投机解码草稿两个属性,平均精度 $+2.4\%$、前 2 个 token 接受率 $\approx 97\%$。每一项创新都配了同预算消融与 1T–25T tokens 的规模化验证。
研究主线:从问题到结论
图 7:Nemotron 3 研究主线(Mermaid 流程图):Agentic AI 需求 → KV Cache 瓶颈 → 混合 Mamba-MoE 设计 → LatentMoE → 同预算消融 → 精度-吞吐双前沿前移
基准/方法设计
Nemotron 3 是面向Agentic AI的高效开放模型家族,包含Nano / Super / Ultra三个规模档位,把混合 Mamba-Transformer MoE、LatentMoE、NVFP4 训练、MTP整合进同一训练流程,覆盖推理、多步工具使用、长上下文 RAG、多智能体协作等场景,支持1M token上下文;Nano 30B-A3B 仅需3B 激活参数即可达到同级最高精度。
设计总纲:一切设计围绕同一目标——精度不变前提下削减带宽与通信,把省下的算力转成模型质量。六大关键技术各司其职:
| 技术组件 | 作用 | 关键细节 |
|---|---|---|
| 混合 Mamba-Transformer MoE | 恒定状态替代线性 KV Cache | Mamba-2 层与 MoE 层交错为主,仅保留极少数 self-attention |
| LatentMoE | 潜空间路由省带宽 | token 先投影 $d \to \ell$($\ell \approx d/4$)再路由/计算,专家数与激活数同倍放大 |
| NVFP4 训练 | 原生 FP4 GEMM 提速 | 权重/激活/梯度全程 FP4,GB300 峰值吞吐 $3\times$ FP8 |
| MTP | 多 token 预测 + 投机解码草稿 | 前 2 个草稿 token 接受率 $\approx 97\%$ |
| 长上下文 | 无 RoPE 长度外推 | CPT 512k + SFT 256k + RL 长上下文环境,支持 1M token |
| 多环境 RL | 单阶段同时训练 | 数学/代码/指令遵循/工具使用等 9 类环境 + 推理预算控制 |
图 1:Nemotron 3 混合 Mamba-Transformer MoE:推理吞吐超越同规模 Transformer MoE,同时在长上下文任务上保持 SOTA 精度(arXiv 2512.20856, Figure 2)
分类全景
图 8:Nemotron 3 技术栈分类全景(Mermaid 树状图):混合 Mamba-MoE 架构、LatentMoE 潜空间路由、NVFP4 训练、MTP 多 token 预测、无 RoPE 1M 长上下文、9 类环境多环境 RL
方法细节
混合 Mamba-Transformer MoE 层间结构:MoE 层与 Mamba-2 层交错为主,仅保留极少数 self-attention 层(2 个 KV head 的 GQA 注意力层负责全对全路由),兼顾稀疏扩展与恒定推理成本。
图 2:层间结构:Mamba-2 与 MoE 层交错为主,仅保留极少数 self-attention 层(arXiv 2512.20856, Figure 1)
LatentMoE:token 先投影 $d \to \ell$($\ell \approx d/4$)再路由/计算,专家权重加载与 all-to-all 通信量均降为原来的 $d/\ell$;省下的预算把专家总数 $N$ 与 top-$K$ 同倍放大,8B 消融中从 128 专家/6 激活提升到512 专家/22 激活,精度/字节比显著提升。
图 3:LatentMoE vs 标准 MoE:专家计算与 all-to-all 通信全部下沉到 $\ell$ 维潜空间(arXiv 2512.20856, Figure 3)
NVFP4 数值格式(附录 B):元素格式E2M1,16 元素细粒度 micro-block 缩放 + E4M3 块缩放 + 二级 FP32 全局缩放;权重使用 2D block scaling,wgrad 输入加RHT(Random Hadamard Transform),梯度随机舍入;fprop / dgrad / wgrad 全部使用原生 NVFP4 GEMM(cuBLAS + Transformer Engine),GB300 峰值吞吐达 FP8 的 $3\times$。保精度策略:网络最后 $15\%$、QKV/注意力投影、LatentMoE 潜空间投影、MTP 层保持BF16;Mamba 输出投影改用MXFP8——NVFP4 下该处冲刷归零高达 $40\%$(Nano),MXFP8 后损失差收敛到 $<1\%$。
MTP 多 token 预测:轻量模块预测后续 token,兼作投机解码草稿,无需独立 draft 模型;前 2 个 token 接受率 $\approx 97\%$,加速长文生成的同时提供更密的训练信号。
无 RoPE 长上下文:Mamba 的隐式位置信息天然规避长度外推的分布外问题;通过 CPT 512k + SFT 256k + RL 长上下文环境的分阶段训练,最终支持1M token上下文。
推理预算控制(附录 D):用户指定思考轨迹的最大 token 数 budget,到达预算后追加</think>让模型基于部分思考继续生成;一条精度-效率权衡曲线覆盖从快答到深度推理的全部需求,成本敏感的 Agentic 应用可按 SLA 动态切预算,推理成本不再是黑盒。
图 6:Nano 在不同 token 预算下的精度-效率权衡曲线(arXiv 2512.20856, Figure 10)
实验设计与结果
评测协议:通用评测用 MMLU / MMLU-Pro、代码 HumanEval/MBPP、数学 GSM8K/MATH-500、常识理解;长上下文用 RULER(128k–1M)与 >1M token 仓库级代码 NLL;RL 环境覆盖数学与科学推理、竞赛编程、指令遵循、软件工程、搜索、聊天、工具使用、长上下文共9 类,单阶段同时训练。消融在8B active / 73B total MoE、1T tokens、同超参下进行:Standard MoE($d=4096$、128 专家、6 激活)vs LatentMoE($\ell=1024$、512 专家、22 激活);基线包括 Standard MoE、Qwen3-30B-A3B、Nemotron-Nano-12B-v2、BF16 全精度。
主表(8B active / 1T tokens 同预算消融):
| 任务 | Standard MoE | LatentMoE | 提升 |
|---|---|---|---|
| MMLU-Pro | 48.30 | 52.87 | +4.57 |
| MMLU | 70.10 | 72.11 | +2.01 |
| Code 平均 | 51.95 | 55.14 | +3.19 |
| Math 平均 | 78.32 | 80.19 | +1.87 |
| 常识理解平均 | 81.73 | 82.10 | +0.37 |
| 参数量 | 8.09B/72.6B | 8.02B/72.8B | ≈ 相同 |
同预算下 LatentMoE 在全部 5 类任务胜出,MMLU-Pro 提升最大达 +4.57pp。
长上下文优雅退化:RULER 上 MoE 混合模型 128k/256k/512k/1M 得分 74.48/71.67/66.02/54.19,而稠密混合模型 1M 处骤降至 23.43——MoE 外推显著更稳健。
NVFP4 逼近 BF16:训练/验证损失相对差 Nano $<1\%$、8B active $<0.6\%$;量化损失随规模缩小(A3B → A8B),敏感层保精度是关键消融结论,且小损失差不转化为下游评测退化。
图 4:NVFP4 vs BF16 损失差随规模缩小;敏感层保精度显著收窄损失差(arXiv 2512.20856, Figure 6)
多环境 RL:单次 RL 运行内同时优化数学、代码、指令遵循、工具使用等异构环境,配合推理预算控制。
图 5:单次 RL 运行内同时优化多个异构环境:数学、代码、指令遵循、工具使用等(arXiv 2512.20856, Figure 8)
MTP 消融(附录 A,8B MoE):
| 任务 | Baseline (8B MoE) | + MTP |
|---|---|---|
| MMLU (5-shot) | 70.06 | 71.26 |
| MMLU-Pro (CoT) | 45.05 | 47.84 |
| MBPP-Sanitized (3-shot) | 65.58 | 66.89 |
| ARC-Challenge (25-shot) | 86.43 | 88.05 |
| RACE (0-shot) | 84.02 | 85.36 |
| GSM8K (8-shot) | 82.49 | 84.46 |
平均提升 $\approx 2.4\%$;MTP 训练信号更密、鼓励多步规划,且草稿 token 与主模型高度一致(前 2 个接受率 $\approx 97\%$)。
结果对比总结
图 9:结果对比总结(Mermaid 流程图):LatentMoE 同预算 5/5 任务全胜(MMLU-Pro 48.30→52.87),Nano 30B-A3B 吞吐 3.3 倍于 Qwen3-30B-A3B,RULER 1M 达 54.19 优雅退化
关键发现
- LatentMoE 同预算全面胜出:8B active / 73B total、1T tokens 下 5/5 类任务优于 Standard MoE,MMLU-Pro 提升最大(+4.57pp)。
- 长上下文优雅退化:RULER 1M 得分 54.19(MoE 混合模型),而稠密混合模型仅 23.43,两者差距超过 30 分。
- NVFP4 逼近 BF16:Nano 训练/验证损失差 $<1\%$、8B active $<0.6\%$,GB300 峰值吞吐达 FP8 的 $3\times$。
- 推理吞吐 $3.3\times$:Nano 30B-A3B 在 8k in / 16k out 推理负载下吞吐达 Qwen3-30B-A3B 的 $3.3$ 倍,长序列下优势更大。
- MTP 双赢:8B MoE 消融平均 $+2.4\%$ 精度,前 2 个草稿 token 接受率 $\approx 97\%$,无需独立 draft 模型。
- 全栈开源:权重 + 10T+ tokens 数据 + 训练配方,1M token 上下文仅需 3B 激活参数。
局限性
- 发布节奏:当前仅 Nano 配套完整技术报告;Super/Ultra 数周后发布,白皮书不含其独立评测。
- 白皮书形式:无逐基准完整数字与误差线,第三方独立评测尚未出现。
- 注意力层保真度:仅 2 个 KV head 的 GQA 注意力层承担全对全路由,信息混合能力受限(以 BF16 保精度缓解)。
- 安全与数据审查:10T+ tokens 数据集的合规与安全性有待社区开放审查。
作者展望:未来数月将开源全部权重、预训练/后训练软件与配方、可再分发数据,并发布 Super/Ultra 完整技术报告。
常见问题(FAQ)
Nemotron 3 与标准 MoE 大模型的核心区别是什么?
核心是混合架构:用 Mamba-2 层替换绝大部分 self-attention,生成时 KV Cache 从线性增长变为恒定状态,再以 LatentMoE 潜空间路由弥补精度损失。
为什么 Nemotron 3 不需要 RoPE 就能支持 1M token 上下文?
Mamba-2 的循环状态天然携带隐式位置信息,规避了 RoPE 在超长序列上的分布外外推问题;再配合 CPT 512k、SFT 256k 与长上下文 RL 环境的分阶段训练。
NVFP4 训练为什么损失差能控制在 1% 以内?
E2M1 元素格式 + micro-block 缩放 + RHT + 梯度随机舍入降低了量化噪声,同时网络最后 15%、QKV/潜空间投影保持 BF16,Mamba 输出投影改用 MXFP8,敏感层被单独保护。
MTP 如何同时提升精度与推理速度?
MTP 辅助目标提供更密的训练信号、鼓励多步规划,平均精度提升约 2.4%;其轻量模块又充当投机解码草稿,前 2 个 token 接受率约 97%,无需独立 draft 模型。
Nemotron 3 家族三个模型怎么选?
Nano(30B-A3B)面向低成本高效推理,Super/Ultra 面向更强能力;三者共享同一混合架构与训练流程,推理预算控制机制让用户按 SLA 在精度、延迟、成本之间显式取舍。
Nemotron 3 是否开源?
是。NVIDIA 计划开源全部权重、预训练/后训练软件与配方、可再分发数据(10T+ tokens),Nano 已配套完整技术报告。
参考链接
- Nemotron 3: Efficient and Open Intelligence(arXiv:2512.20856)
- NVIDIA Nemotron(Hugging Face 模型库,权重与项目发布)
- Mamba: Linear-Time Sequence Modeling with Selective State Spaces(arXiv:2312.00752)
- Transformers are SSMs: Generalized Models and Efficient Algorithms(arXiv:2401.03854)
- DeepSeek-V3 Technical Report(arXiv:2412.19437)
- Better & Faster Large Language Models via Multi-token Prediction(arXiv:2304.03273)
- Megatron-LM: Training Multi-Billion Parameter Language Models(arXiv:1909.08053)
- Nemotron H(混合 Mamba-MoE 架构先例,arXiv:2505.22554)
给大家推荐一款自用写文献综述、无虚构文献的 AI:
🌟复旦大学 FudanNLP 团队自研 切问学术
官网:qiewenpaper.com
覆盖3.6 亿篇可溯源真实中英文文献,能自动整合文献观点生成规范综述
还能挖掘研究创新点、复现实验,配合视频教学,新手快速上手文献综述写作
🍀后记🍀
博客的关键词集中在编程、算法、机器人、人工智能、数学等等,持续高质量输出中。
🌸讨论QQ群:白拾的小屋 (750365700)
⭐B站账号:白拾的物理AI组会(活跃于知识区和动画区)
✨GitHub主页:YhbCode000(工程文件)