Nemotron 3 Nano:開放高效的 MoE 混合 Mamba-Transformer 智能體推理模型

原始論文:Nemotron 3 Nano: Open, Efficient Mixture-of-Experts Hybrid Mamba-Transformer Model for Agentic Reasoning 作者:NVIDIA(300+ 位貢獻者) arXiv ID:2512.20848v1 日期:2025-12-23 標籤:LLM MoE Mamba Hybrid Architecture Agentic RLHF 開源模型

目錄

1. 引言

Figure 1: Nemotron 3 Nano 與 Qwen3-30B-A3B-Thinking-2507 和 GPT-OSS-20B 的準確率與吞吐量比較,展示同等或更優的準確率

NVIDIA 發布 Nemotron 3 Nano 30B-A3B,一個開源的混合專家 (Mixture-of-Experts, MoE) 語言模型,結合 Mamba 和 Transformer 架構:

  • 31.6B 總參數,每次前向傳播僅激活 3.2B(<10%)
  • 在 25 兆 (trillion) 個文字 token 上預訓練
  • 比同規模競品高 3.3 倍推理吞吐量
  • 支援最長 1M token 上下文
  • 在推理和智能體任務上表現出色

2. 架構與預訓練

2.1 模型架構

Figure 2: Nemotron 3 Nano 層排列模式,展示 Mamba 和 Transformer 的混合結構以及 MoE 層

特性 規格
總層數 52
模型維度 2,688
可路由專家數 128
每次激活專家數 6
混合架構 Mamba-2 + Grouped-Query-Attention
激活函數 Squared ReLU
路由器 可學習 MLP + Sigmoid gating
最大上下文 1M tokens

2.2 預訓練資料

兩階段課程學習 (curriculum learning):

Figure 3: 第一階段預訓練資料混合比例

Figure 4: 第二階段預訓練資料混合比例

  • Phase 1(23.5T tokens):強調多樣性,在 94% 完成點轉換
  • Phase 2(1.5T tokens):聚焦高品質資料

關鍵預訓練資料集:

  • Nemotron-CC-Code-v1:428B 高品質程式碼 token(來自 Common Crawl)
  • Nemotron-CC-v2.1:2.5T 新英文 token(含翻譯來源)
  • Nemotron-Pretraining-Specialized-v1:合成 STEM、數學、科學資料集

訓練超參數:Warmup-Stable-Decay 學習率排程,最大學習率 $10^{-3}$,序列長度 8,192,batch size 3,072(≈25M tokens/batch),DeepSeek 的 aux-loss-free 負載均衡策略。

2.3 長上下文擴展

新增 121B token 的專用階段,混合序列長度(4K 和 512K),同時改善短和長上下文效能。

3. 後訓練

3.1 監督式微調 (SFT)

Figure 5: 使用聊天模板的 prompt 格式範例

Figure 6: Nemotron 3 Nano 的 SFT 資料混合比例

多樣化資料類別,1,800 萬個樣本:

  • 競賽數學(含工具整合推理軌跡)
  • 競賽程式
  • 多輪對話工具使用(LLM 生成的軌跡)
  • Lean 4 形式化證明(300K 範例)
  • 長上下文合成資料(128K-256K 平均長度)
  • 終端自主任務
  • 安全 prompt(含適當拒絕策略)
  • 軟體工程任務(真實 GitHub issues)
  • 科學資料集(物理、化學、生物)

訓練配置:13,000 步,batch size 64,序列打包到 256K,學習率 $5 \times 10^{-5}$,800 步 warmup。

推理控制功能:推理開關(10% 樣本去除推理過程)、token 預算控制(3% 軌跡隨機截斷)、XML 式特殊標籤用於工具呼叫。

3.2 多環境強化學習 (RLVR)

八個訓練環境同時訓練:

  1. 競賽數學(DAPO + SkyWorks)
  2. 競賽程式
  3. STEM 問答(135K 任務)
  4. 結構化 JSON 輸出生成(9K 任務)
  5. 指令遵循變體(46K + 3K 任務)
  6. 長上下文問答(12K 任務,5+ 文件)
  7. 工作場所助手工具使用(690 任務)
  8. 多輪對話銀行智能體(1K 任務)

Figure 7: RL 課程學習中各批次的通過率

Figure 8: 課程取樣與隨機取樣的比較

訓練策略:

  • 高斯取樣策略的課程學習
  • 動態難度調整
  • 128 prompts/步,16 generations/prompt
  • Batch size 2,048(同策略更新)
  • 同步 GRPO + 遮罩重要性採樣
  • 最大生成長度 49K tokens
  • MoE 路由器權重凍結

Figure 9: RLVR 在所有領域上超越或匹配大幅微調的 SFT 模型

3.3 人類回饋強化學習 (RLHF)

生成式獎勵模型 (GenRM):基於 Qwen3-235B-A22B-Thinking-2507 用 GRPO 訓練。

Figure 10: GenRM 在各 benchmark 上的效能改善

創新的長度控制機制:

長度正規化獎勵調整:計算零均值、組內相對長度獎勵以鼓勵簡潔。正規化思考和回答部分的長度,維持組間的零和性質。

品質閘控簡潔獎勵:只對達到頂級品質分數(80th 百分位閾值)的最短回應獎勵,防止為簡短而犧牲品質。

效率最佳化:環形比較策略,將 GenRM 呼叫從 $O(N^2)$ 減到 $O(N)$。結果:30% 冗贅度降低,準確率不損失。

4. 量化

選擇性精度的 FP8 後訓練量化:

Figure 11: 量化配置的消融研究,展示準確率-吞吐量權衡

組件 精度
自注意力層(6/52 層) BF16
前置 Mamba 層 BF16
其餘組件 FP8
KV cache FP8
Mamba Conv1D 層 BF16

結果:相比 BF16 基線約 99% 的中位準確率恢復,顯著吞吐量提升。

5. 實驗結果

基礎模型效能(vs. Qwen3-30B-A3B-Base)

Benchmark Nemotron 3 Nano Qwen3-30B-A3B
MMLU-Pro 65.05 61.71
HumanEval 78.05 70.73
GSM8K 92.34 89.01
MATH 82.88 61.14
RULER@256K 75.44 60.69

後訓練效能

Figure 12: 消融研究,展示量化配置的準確率-吞吐量權衡

Benchmark Nemotron 3 Nano Qwen3-30B-A3B GPT-OSS-20B
MMLU-Pro 78.30 80.90 75.00
AIME25(含工具) 99.17 - 98.7
SWE-Bench 38.76 22.00 34.00
RULER@1M 86.34 77.50 -

推理吞吐量

  • 比 Qwen3-30B-A3B-Thinking-2507 快 3.3 倍
  • 比 GPT-OSS-20B 快 2.2 倍
  • 在 H200 GPU 上測量(8K 輸入/16K 輸出)

6. 結論

Nemotron 3 Nano 證明了 MoE 混合 Mamba-Transformer 架構在激活 <10% 參數的同時能維持競爭力準確率。關鍵創新包括多環境同時 RL 訓練(防止 benchmark 退化)、群組相對長度控制(防止回應膨脹)、課程學習策略(穩定多領域訓練)。

開源發布:模型權重(BF16 和 FP8)、NeMo-Gym/NeMo-RL 框架、預訓練資料集、SFT/RL 資料集合、生成式獎勵模型。

限制:多語言能力不如 Qwen3(MMLU-ProX:59.50 vs. 77.60)、部分智能體 benchmark 改善幅度有限、FP8 量化在某些推理任務上有微小準確率退化。


參考文獻

Gu, A. and Dao, T. Mamba: Linear-Time Sequence Modeling with Selective State Spaces, 2023.

Dao, T. and Gu, A. Transformers are SSMs: Generalized Models and Efficient Algorithms Through Structured State Space Duality. ICML, 2024.

Fedus, W., Zoph, B., and Shazeer, N. Switch Transformers: Scaling to Trillion Parameter Models with Simple and Efficient Sparsity. JMLR, 2022.

Shazeer, N. Fast Transformer Decoding: One Write-Head is All You Need, 2019.

DeepSeek-AI. DeepSeek-V3 Technical Report, 2024.

Yu, Q., et al. DAPO: An Open-Source LLM Reinforcement Learning System at Scale, 2025.

Shao, Z., et al. DeepSeekMath: Pushing the Limits of Mathematical Reasoning with GRPO, 2024.

Ouyang, L., et al. Training Language Models to Follow Instructions with Human Feedback. NeurIPS, 2022.

Yang, A., et al. Qwen3 Technical Report, 2025.

Jain, N., et al. LiveCodeBench: Holistic and Contamination Free Evaluation of LLMs for Code, 2024.

Jimenez, C.E., et al. SWE-bench: Can Language Models Resolve Real-World GitHub Issues? ICLR, 2024.

Hsieh, C., et al. RULER: What's the Real Context Size of Your Long-Context Language Models?, 2024.

NVIDIA. NeMo-Gym: Multi-Environment RL Training Framework, 2025.

NVIDIA. NeMo-RL: Scalable RL Training with Megatron-Core Integration, 2025.


術語對照表

英文 中文
Mixture-of-Experts (MoE) 混合專家
Mamba Mamba(選擇性狀態空間模型)
Hybrid Architecture 混合架構
Grouped-Query-Attention (GQA) 分組查詢注意力
Routable Expert 可路由專家
Activated Parameters 激活參數
Curriculum Learning 課程學習
Multi-Environment RL 多環境強化學習
RLVR (RL from Verifiable Rewards) 可驗證獎勵的強化學習
RLHF (RL from Human Feedback) 人類回饋強化學習
Generative Reward Model (GenRM) 生成式獎勵模型
Length-Normalized Reward 長度正規化獎勵
Quality-Gated Conciseness Bonus 品質閘控簡潔獎勵
Circular Comparison 環形比較
Post-Training Quantization 後訓練量化
Sequence Packing 序列打包
Aux-Loss-Free Load Balancing 無輔助損失的負載均衡
Warmup-Stable-Decay 預熱-穩定-衰減
Agentic Reasoning 智能體推理
Tool-Integrated Reasoning 工具整合推理
← 回到列表
已複製連結