三亩地 三亩地SAN MU DI · CODE DIARY
ARTICLE DETAIL

日记详情

真实记录编程学习的某一天,欢迎挑你感兴趣的翻一翻。

【arXiv 技术报告 2025】NVIDIA Nemotron 3:高效与开放智能|从大模型高效推理架构视角

【arXiv 技术报告 2025】NVIDIA Nemotron 3:高效与开放智能|从大模型高效推理架构视角

摘要

本文解读 arXiv 技术报告 2025 论文《NVIDIA Nemotron 3: Efficient and Open Intelligence》。该论文提出Nemotron 3 模型家族(Nano / Super / Ultra),通过融合混合 Mamba-Transformer MoE 架构LatentMoE 潜空间路由NVFP4 低精度训练,面向 Agentic AI 场景实现高效开放智能,其特别之处在于用 Mamba-2 的恒定状态替换线性增长的 KV Cache并支持1M token 上下文。实验表明Nano 30B-A3B 推理吞吐达 Qwen3-30B-A3B 的 $3.3$ 倍且精度同级最优,把开源大语言模型的精度-吞吐前沿整体前移,为高效推理与 Agentic AI 部署提供了重要借鉴。

视频讲解:点击观看 B 站视频

  • 摘要
  • 论文基本信息
  • 背景与动机
  • 研究主线:从问题到结论
  • 基准/方法设计
  • 分类全景
  • 方法细节
  • 实验设计与结果
  • 结果对比总结
  • 关键发现
  • 局限性
  • 常见问题(FAQ)
    • Nemotron 3 与标准 MoE 大模型的核心区别是什么?
    • 为什么 Nemotron 3 不需要 RoPE 就能支持 1M token 上下文?
    • NVFP4 训练为什么损失差能控制在 1% 以内?
    • MTP 如何同时提升精度与推理速度?
    • Nemotron 3 家族三个模型怎么选?
    • Nemotron 3 是否开源?
  • 参考链接

论文基本信息

项目内容
标题(英文)NVIDIA Nemotron 3: Efficient and Open Intelligence
标题(中文)NVIDIA Nemotron 3:高效与开放智能
作者NVIDIA Nemotron 团队(公司级白皮书)
机构NVIDIA 应用深度学习研究(Applied Deep Learning Research)
会议arXiv 技术报告 2025
arXivarXiv:2512.20856
项目网站NVIDIA Nemotron(Hugging Face)

背景与动机

Agentic AI(智能体应用)同时要求高精度、高推理吞吐与超长上下文:多步工具调用、长上下文 RAG、多智能体协作都需要模型在生成阶段快速产出且不丢失远距离信息。然而标准 Transformer MoE 的 KV Cache 随序列长度线性增长,长序列下显存与带宽开销急剧膨胀,成为部署成本的核心瓶颈。

既有工作的局限:

  • Mamba / Mamba-2(Gu & Dao,COLM 2024)用恒定大小的递归状态做序列建模,摆脱注意力二次方开销,但纯 SSM 模型在语言建模精度上仍弱于 Transformer;
  • DeepSeek-V3展示了 MTP(多 token 预测)辅助目标的价值,但未改变 KV Cache 线性增长;
  • Qwen3-30B-A3B与 Nemotron 3 Nano 同为 30B-A3B 稠密 Transformer MoE,是直接的对比对象;
  • NVIDIA Nemotron H率先规模化混合 Mamba-MoE(预训练达 3.7T tokens),但未与低精度训练、MTP、超长上下文系统性整合。

关键差异在于:用Mamba-2 层替代大部分 self-attention,生成时 KV Cache 从线性增长变为恒定状态,再以LatentMoE在低维潜空间路由专家来弥补精度损失——这正是"精度-吞吐"双前沿的根源。

从历史视角看(附录 H),混合 SSM-Transformer 从 2023–2024 年 Mamba / Mamba-2 学术原型,到 2024–2025 年 Jamba / Samba / Zamba / Nemotron H 的规模化验证,再到 2025–2026 年 Nemotron 3 进入 1M 上下文 Agentic 旗舰,并在视觉/机器人侧衍生出 VMamba、VideoMamba、RoboMamba 等下游工作;恒定推理成本与免 RoPE 长度外推是这条技术路线持续扩散的根本原因。

从创新模式看(附录 C),Nemotron 3 的三大动作均有量化证据:P2 算子替换——用 Mamba-2 替换绝大部分 self-attention,换来 $3.3\times$ 吞吐(vs Qwen3-30B-A3B)且 RULER 1M 仍达 54.19;P10 异构分解差异化处理——路由专家计算压缩到 $\ell$ 维潜空间,门控/共享专家保留原维度 $d$,同预算消融 5 类任务全胜、MMLU-Pro $+4.57$pp;P15 属性定向预训练目标——MTP 同时服务多步规划与投机解码草稿两个属性,平均精度 $+2.4\%$、前 2 个 token 接受率 $\approx 97\%$。每一项创新都配了同预算消融与 1T–25T tokens 的规模化验证。

研究主线:从问题到结论

图 7:Nemotron 3 研究主线(Mermaid 流程图):Agentic AI 需求 → KV Cache 瓶颈 → 混合 Mamba-MoE 设计 → LatentMoE → 同预算消融 → 精度-吞吐双前沿前移

基准/方法设计

Nemotron 3 是面向Agentic AI的高效开放模型家族,包含Nano / Super / Ultra三个规模档位,把混合 Mamba-Transformer MoELatentMoENVFP4 训练MTP整合进同一训练流程,覆盖推理、多步工具使用、长上下文 RAG、多智能体协作等场景,支持1M token上下文;Nano 30B-A3B 仅需3B 激活参数即可达到同级最高精度。

设计总纲:一切设计围绕同一目标——精度不变前提下削减带宽与通信,把省下的算力转成模型质量。六大关键技术各司其职:

技术组件作用关键细节
混合 Mamba-Transformer MoE恒定状态替代线性 KV CacheMamba-2 层与 MoE 层交错为主,仅保留极少数 self-attention
LatentMoE潜空间路由省带宽token 先投影 $d \to \ell$($\ell \approx d/4$)再路由/计算,专家数与激活数同倍放大
NVFP4 训练原生 FP4 GEMM 提速权重/激活/梯度全程 FP4,GB300 峰值吞吐 $3\times$ FP8
MTP多 token 预测 + 投机解码草稿前 2 个草稿 token 接受率 $\approx 97\%$
长上下文无 RoPE 长度外推CPT 512k + SFT 256k + RL 长上下文环境,支持 1M token
多环境 RL单阶段同时训练数学/代码/指令遵循/工具使用等 9 类环境 + 推理预算控制

图 1:Nemotron 3 混合 Mamba-Transformer MoE:推理吞吐超越同规模 Transformer MoE,同时在长上下文任务上保持 SOTA 精度(arXiv 2512.20856, Figure 2)

分类全景

图 8:Nemotron 3 技术栈分类全景(Mermaid 树状图):混合 Mamba-MoE 架构、LatentMoE 潜空间路由、NVFP4 训练、MTP 多 token 预测、无 RoPE 1M 长上下文、9 类环境多环境 RL

方法细节

混合 Mamba-Transformer MoE 层间结构:MoE 层与 Mamba-2 层交错为主,仅保留极少数 self-attention 层(2 个 KV head 的 GQA 注意力层负责全对全路由),兼顾稀疏扩展与恒定推理成本。

图 2:层间结构:Mamba-2 与 MoE 层交错为主,仅保留极少数 self-attention 层(arXiv 2512.20856, Figure 1)

LatentMoE:token 先投影 $d \to \ell$($\ell \approx d/4$)再路由/计算,专家权重加载与 all-to-all 通信量均降为原来的 $d/\ell$;省下的预算把专家总数 $N$ 与 top-$K$ 同倍放大,8B 消融中从 128 专家/6 激活提升到512 专家/22 激活,精度/字节比显著提升。

图 3:LatentMoE vs 标准 MoE:专家计算与 all-to-all 通信全部下沉到 $\ell$ 维潜空间(arXiv 2512.20856, Figure 3)

NVFP4 数值格式(附录 B):元素格式E2M1,16 元素细粒度 micro-block 缩放 + E4M3 块缩放 + 二级 FP32 全局缩放;权重使用 2D block scaling,wgrad 输入加RHT(Random Hadamard Transform),梯度随机舍入;fprop / dgrad / wgrad 全部使用原生 NVFP4 GEMM(cuBLAS + Transformer Engine),GB300 峰值吞吐达 FP8 的 $3\times$。保精度策略:网络最后 $15\%$、QKV/注意力投影、LatentMoE 潜空间投影、MTP 层保持BF16;Mamba 输出投影改用MXFP8——NVFP4 下该处冲刷归零高达 $40\%$(Nano),MXFP8 后损失差收敛到 $<1\%$。

MTP 多 token 预测:轻量模块预测后续 token,兼作投机解码草稿,无需独立 draft 模型;前 2 个 token 接受率 $\approx 97\%$,加速长文生成的同时提供更密的训练信号。

无 RoPE 长上下文:Mamba 的隐式位置信息天然规避长度外推的分布外问题;通过 CPT 512k + SFT 256k + RL 长上下文环境的分阶段训练,最终支持1M token上下文。

推理预算控制(附录 D):用户指定思考轨迹的最大 token 数 budget,到达预算后追加</think>让模型基于部分思考继续生成;一条精度-效率权衡曲线覆盖从快答到深度推理的全部需求,成本敏感的 Agentic 应用可按 SLA 动态切预算,推理成本不再是黑盒。

图 6:Nano 在不同 token 预算下的精度-效率权衡曲线(arXiv 2512.20856, Figure 10)

实验设计与结果

评测协议:通用评测用 MMLU / MMLU-Pro、代码 HumanEval/MBPP、数学 GSM8K/MATH-500、常识理解;长上下文用 RULER(128k–1M)与 >1M token 仓库级代码 NLL;RL 环境覆盖数学与科学推理、竞赛编程、指令遵循、软件工程、搜索、聊天、工具使用、长上下文共9 类,单阶段同时训练。消融在8B active / 73B total MoE、1T tokens、同超参下进行:Standard MoE($d=4096$、128 专家、6 激活)vs LatentMoE($\ell=1024$、512 专家、22 激活);基线包括 Standard MoE、Qwen3-30B-A3B、Nemotron-Nano-12B-v2、BF16 全精度。

主表(8B active / 1T tokens 同预算消融):

任务Standard MoELatentMoE提升
MMLU-Pro48.3052.87+4.57
MMLU70.1072.11+2.01
Code 平均51.9555.14+3.19
Math 平均78.3280.19+1.87
常识理解平均81.7382.10+0.37
参数量8.09B/72.6B8.02B/72.8B≈ 相同

同预算下 LatentMoE 在全部 5 类任务胜出,MMLU-Pro 提升最大达 +4.57pp。

长上下文优雅退化:RULER 上 MoE 混合模型 128k/256k/512k/1M 得分 74.48/71.67/66.02/54.19,而稠密混合模型 1M 处骤降至 23.43——MoE 外推显著更稳健。

NVFP4 逼近 BF16:训练/验证损失相对差 Nano $<1\%$、8B active $<0.6\%$;量化损失随规模缩小(A3B → A8B),敏感层保精度是关键消融结论,且小损失差不转化为下游评测退化。

图 4:NVFP4 vs BF16 损失差随规模缩小;敏感层保精度显著收窄损失差(arXiv 2512.20856, Figure 6)

多环境 RL:单次 RL 运行内同时优化数学、代码、指令遵循、工具使用等异构环境,配合推理预算控制。

图 5:单次 RL 运行内同时优化多个异构环境:数学、代码、指令遵循、工具使用等(arXiv 2512.20856, Figure 8)

MTP 消融(附录 A,8B MoE):

任务Baseline (8B MoE)+ MTP
MMLU (5-shot)70.0671.26
MMLU-Pro (CoT)45.0547.84
MBPP-Sanitized (3-shot)65.5866.89
ARC-Challenge (25-shot)86.4388.05
RACE (0-shot)84.0285.36
GSM8K (8-shot)82.4984.46

平均提升 $\approx 2.4\%$;MTP 训练信号更密、鼓励多步规划,且草稿 token 与主模型高度一致(前 2 个接受率 $\approx 97\%$)。

结果对比总结

图 9:结果对比总结(Mermaid 流程图):LatentMoE 同预算 5/5 任务全胜(MMLU-Pro 48.30→52.87),Nano 30B-A3B 吞吐 3.3 倍于 Qwen3-30B-A3B,RULER 1M 达 54.19 优雅退化

关键发现

  • LatentMoE 同预算全面胜出:8B active / 73B total、1T tokens 下 5/5 类任务优于 Standard MoE,MMLU-Pro 提升最大(+4.57pp)。
  • 长上下文优雅退化:RULER 1M 得分 54.19(MoE 混合模型),而稠密混合模型仅 23.43,两者差距超过 30 分。
  • NVFP4 逼近 BF16:Nano 训练/验证损失差 $<1\%$、8B active $<0.6\%$,GB300 峰值吞吐达 FP8 的 $3\times$。
  • 推理吞吐 $3.3\times$:Nano 30B-A3B 在 8k in / 16k out 推理负载下吞吐达 Qwen3-30B-A3B 的 $3.3$ 倍,长序列下优势更大。
  • MTP 双赢:8B MoE 消融平均 $+2.4\%$ 精度,前 2 个草稿 token 接受率 $\approx 97\%$,无需独立 draft 模型。
  • 全栈开源:权重 + 10T+ tokens 数据 + 训练配方,1M token 上下文仅需 3B 激活参数。

局限性

  • 发布节奏:当前仅 Nano 配套完整技术报告;Super/Ultra 数周后发布,白皮书不含其独立评测。
  • 白皮书形式:无逐基准完整数字与误差线,第三方独立评测尚未出现。
  • 注意力层保真度:仅 2 个 KV head 的 GQA 注意力层承担全对全路由,信息混合能力受限(以 BF16 保精度缓解)。
  • 安全与数据审查:10T+ tokens 数据集的合规与安全性有待社区开放审查。

作者展望:未来数月将开源全部权重、预训练/后训练软件与配方、可再分发数据,并发布 Super/Ultra 完整技术报告。

常见问题(FAQ)

Nemotron 3 与标准 MoE 大模型的核心区别是什么?

核心是混合架构:用 Mamba-2 层替换绝大部分 self-attention,生成时 KV Cache 从线性增长变为恒定状态,再以 LatentMoE 潜空间路由弥补精度损失。

为什么 Nemotron 3 不需要 RoPE 就能支持 1M token 上下文?

Mamba-2 的循环状态天然携带隐式位置信息,规避了 RoPE 在超长序列上的分布外外推问题;再配合 CPT 512k、SFT 256k 与长上下文 RL 环境的分阶段训练。

NVFP4 训练为什么损失差能控制在 1% 以内?

E2M1 元素格式 + micro-block 缩放 + RHT + 梯度随机舍入降低了量化噪声,同时网络最后 15%、QKV/潜空间投影保持 BF16,Mamba 输出投影改用 MXFP8,敏感层被单独保护。

MTP 如何同时提升精度与推理速度?

MTP 辅助目标提供更密的训练信号、鼓励多步规划,平均精度提升约 2.4%;其轻量模块又充当投机解码草稿,前 2 个 token 接受率约 97%,无需独立 draft 模型。

Nemotron 3 家族三个模型怎么选?

Nano(30B-A3B)面向低成本高效推理,Super/Ultra 面向更强能力;三者共享同一混合架构与训练流程,推理预算控制机制让用户按 SLA 在精度、延迟、成本之间显式取舍。

Nemotron 3 是否开源?

是。NVIDIA 计划开源全部权重、预训练/后训练软件与配方、可再分发数据(10T+ tokens),Nano 已配套完整技术报告。

参考链接

  • Nemotron 3: Efficient and Open Intelligence(arXiv:2512.20856)
  • NVIDIA Nemotron(Hugging Face 模型库,权重与项目发布)
  • Mamba: Linear-Time Sequence Modeling with Selective State Spaces(arXiv:2312.00752)
  • Transformers are SSMs: Generalized Models and Efficient Algorithms(arXiv:2401.03854)
  • DeepSeek-V3 Technical Report(arXiv:2412.19437)
  • Better & Faster Large Language Models via Multi-token Prediction(arXiv:2304.03273)
  • Megatron-LM: Training Multi-Billion Parameter Language Models(arXiv:1909.08053)
  • Nemotron H(混合 Mamba-MoE 架构先例,arXiv:2505.22554)

给大家推荐一款自用写文献综述、无虚构文献的 AI:

🌟复旦大学 FudanNLP 团队自研 切问学术

官网:qiewenpaper.com

覆盖3.6 亿篇可溯源真实中英文文献,能自动整合文献观点生成规范综述

还能挖掘研究创新点、复现实验,配合视频教学,新手快速上手文献综述写作


🍀后记🍀

博客的关键词集中在编程、算法、机器人、人工智能、数学等等,持续高质量输出中。

🌸讨论QQ群:白拾的小屋 (750365700)

⭐B站账号:白拾的物理AI组会(活跃于知识区和动画区)

✨GitHub主页:YhbCode000(工程文件)

← 返回列表