NVIDIA Nemotron 3 Super 120B-A12B
NVIDIA Nemotron 3 Super · 120B A12B · NVIDIA 英伟达 · 发布 2026-03-11 · 当前代
NVIDIA 120B 混合 Mamba-MoE,12B 激活,1M 上下文。
- 类型
- Hybrid(线性 + 全注意力)
- 注意力
- 混合:8 层 GQA 注意力(32 Q / 2 KV,head_dim 128)+ 40 层 Mamba-2 + 40 层 LatentMoE
- 层数
- 88
- 专家
- 512 · 激活 22 + 共享
- 隐藏维
- 4096
- 词表
- 131,072
config hybrid_override_pattern 共 88 层:40 M(Mamba-2,128 头 × 64,state 128)/ 40 E(LatentMoE:512 路由 + 1 共享专家选 22,latent 1024,专家中间维 2688)/ 8 *(注意力),无 RoPE 缩放(theta 1e4,注意力层主要靠 Mamba 提供位置信息)。1 层 MTP(*E)。训练用 NVFP4。config max_position 262,144,官方标称 1M(RULER@1M 91.75)。
类型:Mamba-2 / 注意力 / LatentMoE 混合,120B 总参 / 12B 激活,纯文本。
| 项目 | 数值 |
|---|---|
| 层数 | 88 = 40 Mamba-2 + 40 LatentMoE + 8 注意力(pattern MEMEMEM*E…) |
| 隐藏维 | 4,096 |
| Mamba-2 | 128 头 × head_dim 64,state 128,conv kernel 4,expand 2 |
| 专家 | 512 路由 + 1 共享(中间维 5,376),每 token 选 22,专家中间维 2,688,latent 1,024 |
| 注意力 | 32 Q / 2 KV,head_dim 128,theta 1e4 |
| 词表 | 131,072 |
| 上下文 | 官方 1M(config max_position 262,144) |
| MTP | 1 层(*E) |
config.json 中 model_type: nemotron_h,architectures: NemotronHForCausalLM。
参考:nvidia/NVIDIA-Nemotron-3-Super-120B-A12B-BF16 config.json 与模型卡。
| 精度 | 权重大小 | 说明 |
|---|---|---|
| BF16 | 247 GB | 官方精度 |
| FP8 | 128 GB | |
| Q8 | 128 GB | |
| Q4 | 83 GB | GGUF Q4_K_M 或等效 |
- 消费级 24GB
- 不可行
- 单卡 80GB
- 不可行(UD-Q4_K_M 82.5 GB 已超 80GB;官方 NVFP4 版可跑单 B200 / DGX Spark)
- 8×80GB 节点
- 官方最低 8×H100 BF16;FP8 128 GB 用 2×H100 即可载
KV Cache:仅 8 层注意力有 KV:2 KV 头 × 128 × 2(K/V)× 2 B = 1 KiB/层 → 8 KiB/token(BF16)。40 层 Mamba-2 为固定 SSM 状态(128 头 × 64 × 128,FP32,约 4 MiB/层),每序列约 160 MB 与长度无关。1M 上下文 KV ≈ 8 GB。 ≈ 8 KiB/token
⚠ 能加载 ≠ 能在满上下文 / 高并发下舒服跑。标「估」的数字来自 计算器 公式或社区量化文件大小。
| 精度 | 权重大小 | 参考显存 | 说明 |
|---|---|---|---|
| BF16 | 247 GB | 8×H100 | 官方 safetensors,50 分片(官方最低配置) |
| FP8 | 128 GB | 2×H100 | 官方 NVIDIA-Nemotron-3-Super-120B-A12B-FP8,26 分片 |
| Q8 | 128 GB | 2×H100 | unsloth GGUF Q8_0 |
| Q4 | 82.5 GB | 2×80GB | unsloth GGUF Q4_K_M(超过单张 80GB) |
| NVFP4 | 官方另发 | 1×B200 / DGX Spark | 官方 NVFP4 版本 |
KV Cache:仅 8 层注意力 × 1 KiB = 8 KiB/token;40 层 Mamba-2 状态固定约 160 MB/序列。1M 上下文 KV ≈ 8 GB。
参考配置:
- 24GB / 80GB 单卡:不可行
- 2×H100:FP8 或 Q8 可载,长上下文余量大
- 8×H100:官方 BF16 推荐
警示:vLLM 需 ≥ 0.18.1,Transformers ≥ 5.3;Mamba 状态用 FP32 缓存。
| 配置 | 量化 | 占用 / 显存 | 解码 tok/s | 预填充 tok/s | 最大上下文 |
|---|---|---|---|---|---|
| 4× RTX 3090 24GB消费级 | Q5_K_M估 | 88 GB / 96 GB | 247 | 5325 | 1.0M |
| 4× RTX 4090 24GB消费级 | Q5_K_M估 | 88 GB / 96 GB | 266 | 12375 | 1.0M |
| 4× RTX 5090 32GB消费级 | Q6_K估 | 101 GB / 128 GB | 408 | 15750 | 3.4M |
| 4× L4 24GB工作站 | Q5_K_M估 | 88 GB / 96 GB | 79 | 4500 | 1.0M |
| 2× RTX A6000 48GB工作站 | Q5_K_M估 | 85 GB / 96 GB | 101 | 2888 | 1.3M |
| 2× RTX 6000 Ada 48GB工作站 | Q5_K_M估 | 85 GB / 96 GB | 127 | 3413 | 1.3M |
| 2× L40S 48GB工作站 | Q5_K_M估 | 85 GB / 96 GB | 114 | 3413 | 1.3M |
| RTX PRO 6000 Blackwell 96GB工作站 | Q5_K_M估 | 84 GB / 96 GB | 140 | 4688 | 1.5M |
| 4× A10 24GB数据中心 | Q5_K_M估 | 88 GB / 96 GB | 158 | 4650 | 1.0M |
| 4× A100 40GB数据中心 | FP8 | 133 GB / 160 GB | 284 | 23400 | 6.8M |
| 2× A100 80GB数据中心 | FP8 | 130 GB / 160 GB | 186 | 11700 | 7.4M |
| H20 96GB数据中心 | Q5_K_M估 | 84 GB / 96 GB | 311 | 1388 | 1.5M |
| 2× 昇腾 Ascend 910B 64GB数据中心 | Q6_K估 | 98 GB / 128 GB | 182 | 10500 | 3.7M |
| 2× H100 80GB PCIe数据中心 | FP8 | 130 GB / 160 GB | 183 | 28350 | 7.4M |
| 2× H100 80GB SXM数据中心 | FP8 | 130 GB / 160 GB | 306 | 37088 | 7.4M |
| AMD MI300X 192GB数据中心 | FP8 | 129 GB / 192 GB | 286 | 24506 | 15.7M |
| H200 141GB数据中心 | FP8 | 129 GB / 141 GB | 259 | 18544 | 2.9M |
| B200 192GB数据中心 | FP8 | 129 GB / 192 GB | 432 | 42188 | 15.7M |
| DGX Spark 128GB统一内存 | Q6_K估 | 97 GB / 120 GB | 14 | 1163 | 2.8M |
| Mac M4 Max 128GB统一内存 | Q6_K估 | 97 GB / 120 GB | 28 | 638 | 2.8M |
| Mac Studio M3 Ultra 256GB统一内存 | FP8 | 129 GB / 240 GB | 34 | 1069 | 27.7M |
| Mac Studio M3 Ultra 512GB统一内存 | BF16 | 248 GB / 490 GB | 17 | 1069 | 30.2M |
单流(batch=1)估算:解码 ≈ 显存带宽 × 效率 ÷ 每 token 读取字节(激活参数 × 量化位宽 + KV);预填充 ≈ FP16 算力 × 0.45 ÷ (2 × 激活参数)。多卡按张量并行、带宽求和 × 0.55。实际受引擎、驱动、PCIe 影响,误差 ±30%。反向查:我的卡能跑谁 →
编程LiveCodeBench 81.19、SWE-bench Verified 60.47(OpenHands)/ 59.20(OpenCode)、Terminal-Bench Core 2.0 31.00、SciCode 42.05(官方模型卡)。
推理GPQA 79.23(无工具)/ 82.70(工具)、HLE 18.26 / 22.82(工具)、MMLU-Pro 83.73(官方模型卡)。
数学AIME 2025 90.21(无工具)、HMMT Feb25 93.67 / 94.73(工具)(官方模型卡)。
指令遵循IFBench 72.56、Arena-Hard-V2 73.88、Multi-Challenge 55.23(官方模型卡)。
Agenttau2-bench 均值 61.15(Airline 56.25 / Retail 62.83 / Telecom 64.36)、BrowseComp(搜索)31.28、BIRD 41.80(官方模型卡)。
中文官方支持中文(7 种语言之一),MMLU-ProX 均值 79.36、WMT24++ 86.67(官方模型卡)。
考试型推理强:AIME 2025 90.21(无工具)、HMMT Feb25 93.67 / 94.73(工具)、GPQA 79.23 / 82.70(工具)、MMLU-Pro 83.73。HLE 18.26 / 22.82(工具)中等。工程型推理中游:LiveCodeBench 81.19 高,但 SWE-bench Verified 60.47(OpenHands)、Terminal-Bench Core 2.0 31.00 / hard 25.78、tau2 均值 61.15。长上下文是强项(RULER 256K 96.3、1M 91.75、AA-LCR 58.31)。thinking 可开关。
- 1.AIME 2025 90.2、LiveCodeBench 81.2、GPQA 79.2、RULER@1M 91.75(官方)
- 2.仅 8 层注意力 + 2 KV 头,KV 8 KiB/token,1M 上下文 KV 仅约 8 GB
- 3.Nemotron 开放许可可商用,25T token 预训练数据 / 配方公开度高
- 1.SWE-bench Verified 60.5、Terminal-Bench Core 2.0 31.0、tau2 均值 61.2,工程与 agent 中游
- 2.AA 智能指数 26;HLE 无工具 18.3、Arena-Hard-V2 73.9 低于 gpt-oss-120b
- 3.Mamba-MoE 混合架构需新版 vLLM(≥ 0.18.1)/ TRT-LLM,llama.cpp 支持滞后;Q4 也超 80GB
| 基准 | 分数 | 来源 | 日期 | 证据 |
|---|---|---|---|---|
| Artificial Analysis Intelligence IndexAA 综合指数 | 26 | Artificial Analysis Intelligence Index v3 | 2026-08-28 | 独立复测 |
| SWE-bench Verified真实仓库修 bug | 60.5% | NVIDIA Nemotron 3 Super 模型卡 | 2026-08-28 | 厂商公布 |
| LiveCodeBench竞赛编程 | 81.2% | NVIDIA Nemotron 3 Super 模型卡 | 2026-08-28 | 厂商公布 |
| GPQA Diamond研究生级科学问答 | 79.2% | NVIDIA Nemotron 3 Super 模型卡 | 2026-08-28 | 厂商公布 |
| Humanity's Last Exam人类最后考试 | 18.3% | NVIDIA Nemotron 3 Super 模型卡 | 2026-08-28 | 厂商公布 |
| AIME 2025美国数学邀请赛 | 90.2% | NVIDIA Nemotron 3 Super 模型卡 | 2026-08-28 | 厂商公布 |
| τ²-bench工具调用 agent | 61.2% | NVIDIA Nemotron 3 Super 模型卡 | 2026-08-28 | 厂商公布 |
| Artificial Analysis Intelligence IndexAA 综合指数 | 26 | Artificial Analysis (v4.1.1) | 2026-08-28 | 独立复测 |
| GPQA Diamond研究生级科学问答 | 80% | Artificial Analysis (v4.1.1) | 2026-08-28 | 独立复测 |
| Humanity's Last Exam人类最后考试 | 20.8% | Artificial Analysis (v4.1.1) | 2026-08-28 | 独立复测 |
| SciCode科学计算编程 | 36% | Artificial Analysis (v4.1.1) | 2026-08-28 | 独立复测 |
| Terminal-Bench Hard终端 agent(AA 困难子集) | 28.8% | Artificial Analysis (v4.1.1) | 2026-08-28 | 独立复测 |
| τ²-Bench Telecom工具调用 agent(电信域) | 67.8% | Artificial Analysis (v4.1.1) | 2026-08-28 | 独立复测 |
| IFBench指令遵循 | 71.5% | Artificial Analysis (v4.1.1) | 2026-08-28 | 独立复测 |
| Terminal-Bench终端 agent | 38.6% | Artificial Analysis · Terminal-Bench 2.1 | 2026-08-28 | 独立复测 |
| τ³-Bench Banking工具调用 agent(银行域) | 10.3% | Artificial Analysis · τ³-Bench Banking | 2026-08-28 | 独立复测 |
| LMArena Chinese Elo中文人类偏好 Elo | 1399 | LMArena Text · Chinese (style control) | 2026-08-28 | 独立复测 |
更新 2026-08-28 · 排名供选型参考,基准会饱和、会泄漏、会过时。