开源权重可下推理模型·可关可商用 · NVIDIA Nemotron Open Model License
NVIDIA logo

NVIDIA Nemotron 3 Super 120B-A12B

NVIDIA Nemotron 3 Super · 120B A12B · NVIDIA 英伟达 · 发布 2026-03-11 · 当前代

NVIDIA 120B 混合 Mamba-MoE,12B 激活,1M 上下文。

参数
120B 总 / 12B 激活
HYBRID
上下文
1M
输出 32K
价格 / 1M tok
$0.09 / $0.40
第三方托管常见价(OpenR · 2026-08-28
最低可跑
4× RTX 3090
Q5_K_M · 88 GB · ≈247 tok/s
Arena Elo
AA 综合指数26
2026-08-28
真实仓库修 bug60.5
2026-08-28
GPQA 推理80
2026-08-28
类型
Hybrid(线性 + 全注意力)
注意力
混合:8 层 GQA 注意力(32 Q / 2 KV,head_dim 128)+ 40 层 Mamba-2 + 40 层 LatentMoE
层数
88
专家
512 · 激活 22 + 共享
隐藏维
4096
词表
131,072

config hybrid_override_pattern 共 88 层:40 M(Mamba-2,128 头 × 64,state 128)/ 40 E(LatentMoE:512 路由 + 1 共享专家选 22,latent 1024,专家中间维 2688)/ 8 *(注意力),无 RoPE 缩放(theta 1e4,注意力层主要靠 Mamba 提供位置信息)。1 层 MTP(*E)。训练用 NVFP4。config max_position 262,144,官方标称 1M(RULER@1M 91.75)。

类型:Mamba-2 / 注意力 / LatentMoE 混合,120B 总参 / 12B 激活,纯文本。

项目数值
层数88 = 40 Mamba-2 + 40 LatentMoE + 8 注意力(pattern MEMEMEM*E…)
隐藏维4,096
Mamba-2128 头 × head_dim 64,state 128,conv kernel 4,expand 2
专家512 路由 + 1 共享(中间维 5,376),每 token 选 22,专家中间维 2,688,latent 1,024
注意力32 Q / 2 KV,head_dim 128,theta 1e4
词表131,072
上下文官方 1M(config max_position 262,144)
MTP1 层(*E)

config.jsonmodel_type: nemotron_harchitectures: NemotronHForCausalLM

参考:nvidia/NVIDIA-Nemotron-3-Super-120B-A12B-BF16 config.json 与模型卡。

Token Embedding词表 131,072× 88 层(8 层全注意力)注意力:混合:8 层 GQA 注意力KV 头 2 · head_dim 128路由top-22E1E2E3共享专家512 专家 · 激活 22 · d=4096LM Head120B / 12B 激活实线 = 已公开 · 虚线 = 未披露
精度权重大小说明
BF16247 GB官方精度
FP8128 GB
Q8128 GB
Q483 GBGGUF Q4_K_M 或等效
消费级 24GB
不可行
单卡 80GB
不可行(UD-Q4_K_M 82.5 GB 已超 80GB;官方 NVFP4 版可跑单 B200 / DGX Spark)
8×80GB 节点
官方最低 8×H100 BF16;FP8 128 GB 用 2×H100 即可载

KV Cache:仅 8 层注意力有 KV:2 KV 头 × 128 × 2(K/V)× 2 B = 1 KiB/层 → 8 KiB/token(BF16)。40 层 Mamba-2 为固定 SSM 状态(128 头 × 64 × 128,FP32,约 4 MiB/层),每序列约 160 MB 与长度无关。1M 上下文 KV ≈ 8 GB。8 KiB/token

⚠ 能加载 ≠ 能在满上下文 / 高并发下舒服跑。标「估」的数字来自 计算器 公式或社区量化文件大小。

精度权重大小参考显存说明
BF16247 GB8×H100官方 safetensors,50 分片(官方最低配置)
FP8128 GB2×H100官方 NVIDIA-Nemotron-3-Super-120B-A12B-FP8,26 分片
Q8128 GB2×H100unsloth GGUF Q8_0
Q482.5 GB2×80GBunsloth GGUF Q4_K_M(超过单张 80GB)
NVFP4官方另发1×B200 / DGX Spark官方 NVFP4 版本

KV Cache:仅 8 层注意力 × 1 KiB = 8 KiB/token;40 层 Mamba-2 状态固定约 160 MB/序列。1M 上下文 KV ≈ 8 GB。

参考配置

  • 24GB / 80GB 单卡:不可行
  • 2×H100:FP8 或 Q8 可载,长上下文余量大
  • 8×H100:官方 BF16 推荐

警示:vLLM 需 ≥ 0.18.1,Transformers ≥ 5.3;Mamba 状态用 FP32 缓存。

硬件配置与预估吞吐
最低可跑(8K 上下文)
4 × RTX 3090 24GB
二手 ≈¥5,000 × 4 · 合计 ≈¥20,000 · 消费级
量化
Q5_K_M
解码
247 tok/s
最大上下文
1.0M
推荐配置(≥Q8 · 32K 上下文 · ≥15 tok/s)
Mac Studio M3 Ultra 256GB
≈¥50,000 · 合计 ≈¥50,000 · 统一内存
量化
FP8
解码
34 tok/s
最大上下文
27.7M
配置量化占用 / 显存解码 tok/s预填充 tok/s最大上下文
4× RTX 3090 24GB消费级Q5_K_M88 GB / 96 GB24753251.0M
4× RTX 4090 24GB消费级Q5_K_M88 GB / 96 GB266123751.0M
4× RTX 5090 32GB消费级Q6_K101 GB / 128 GB408157503.4M
4× L4 24GB工作站Q5_K_M88 GB / 96 GB7945001.0M
2× RTX A6000 48GB工作站Q5_K_M85 GB / 96 GB10128881.3M
2× RTX 6000 Ada 48GB工作站Q5_K_M85 GB / 96 GB12734131.3M
2× L40S 48GB工作站Q5_K_M85 GB / 96 GB11434131.3M
RTX PRO 6000 Blackwell 96GB工作站Q5_K_M84 GB / 96 GB14046881.5M
4× A10 24GB数据中心Q5_K_M88 GB / 96 GB15846501.0M
4× A100 40GB数据中心FP8133 GB / 160 GB284234006.8M
2× A100 80GB数据中心FP8130 GB / 160 GB186117007.4M
H20 96GB数据中心Q5_K_M84 GB / 96 GB31113881.5M
2× 昇腾 Ascend 910B 64GB数据中心Q6_K98 GB / 128 GB182105003.7M
2× H100 80GB PCIe数据中心FP8130 GB / 160 GB183283507.4M
2× H100 80GB SXM数据中心FP8130 GB / 160 GB306370887.4M
AMD MI300X 192GB数据中心FP8129 GB / 192 GB2862450615.7M
H200 141GB数据中心FP8129 GB / 141 GB259185442.9M
B200 192GB数据中心FP8129 GB / 192 GB4324218815.7M
DGX Spark 128GB统一内存Q6_K97 GB / 120 GB1411632.8M
Mac M4 Max 128GB统一内存Q6_K97 GB / 120 GB286382.8M
Mac Studio M3 Ultra 256GB统一内存FP8129 GB / 240 GB34106927.7M
Mac Studio M3 Ultra 512GB统一内存BF16248 GB / 490 GB17106930.2M

单流(batch=1)估算:解码 ≈ 显存带宽 × 效率 ÷ 每 token 读取字节(激活参数 × 量化位宽 + KV);预填充 ≈ FP16 算力 × 0.45 ÷ (2 × 激活参数)。多卡按张量并行、带宽求和 × 0.55。实际受引擎、驱动、PCIe 影响,误差 ±30%。反向查:我的卡能跑谁 →

用计算器按你的上下文与并发估算 →

编程LiveCodeBench 81.19、SWE-bench Verified 60.47(OpenHands)/ 59.20(OpenCode)、Terminal-Bench Core 2.0 31.00、SciCode 42.05(官方模型卡)。

推理GPQA 79.23(无工具)/ 82.70(工具)、HLE 18.26 / 22.82(工具)、MMLU-Pro 83.73(官方模型卡)。

数学AIME 2025 90.21(无工具)、HMMT Feb25 93.67 / 94.73(工具)(官方模型卡)。

指令遵循IFBench 72.56、Arena-Hard-V2 73.88、Multi-Challenge 55.23(官方模型卡)。

Agenttau2-bench 均值 61.15(Airline 56.25 / Retail 62.83 / Telecom 64.36)、BrowseComp(搜索)31.28、BIRD 41.80(官方模型卡)。

中文官方支持中文(7 种语言之一),MMLU-ProX 均值 79.36、WMT24++ 86.67(官方模型卡)。

逻辑能力

考试型推理强:AIME 2025 90.21(无工具)、HMMT Feb25 93.67 / 94.73(工具)、GPQA 79.23 / 82.70(工具)、MMLU-Pro 83.73。HLE 18.26 / 22.82(工具)中等。工程型推理中游:LiveCodeBench 81.19 高,但 SWE-bench Verified 60.47(OpenHands)、Terminal-Bench Core 2.0 31.00 / hard 25.78、tau2 均值 61.15。长上下文是强项(RULER 256K 96.3、1M 91.75、AA-LCR 58.31)。thinking 可开关。

亮点
  1. 1.AIME 2025 90.2、LiveCodeBench 81.2、GPQA 79.2、RULER@1M 91.75(官方)
  2. 2.仅 8 层注意力 + 2 KV 头,KV 8 KiB/token,1M 上下文 KV 仅约 8 GB
  3. 3.Nemotron 开放许可可商用,25T token 预训练数据 / 配方公开度高
  1. 1.SWE-bench Verified 60.5、Terminal-Bench Core 2.0 31.0、tau2 均值 61.2,工程与 agent 中游
  2. 2.AA 智能指数 26;HLE 无工具 18.3、Arena-Hard-V2 73.9 低于 gpt-oss-120b
  3. 3.Mamba-MoE 混合架构需新版 vLLM(≥ 0.18.1)/ TRT-LLM,llama.cpp 支持滞后;Q4 也超 80GB
适合:超长上下文 RAG / 文档 agent · 高吞吐推理服务
不适合:24GB 消费卡 · 高难度编程 agent
基准分数来源日期证据
Artificial Analysis Intelligence IndexAA 综合指数26Artificial Analysis Intelligence Index v32026-08-28独立复测
SWE-bench Verified真实仓库修 bug60.5%NVIDIA Nemotron 3 Super 模型卡2026-08-28厂商公布
LiveCodeBench竞赛编程81.2%NVIDIA Nemotron 3 Super 模型卡2026-08-28厂商公布
GPQA Diamond研究生级科学问答79.2%NVIDIA Nemotron 3 Super 模型卡2026-08-28厂商公布
Humanity's Last Exam人类最后考试18.3%NVIDIA Nemotron 3 Super 模型卡2026-08-28厂商公布
AIME 2025美国数学邀请赛90.2%NVIDIA Nemotron 3 Super 模型卡2026-08-28厂商公布
τ²-bench工具调用 agent61.2%NVIDIA Nemotron 3 Super 模型卡2026-08-28厂商公布
Artificial Analysis Intelligence IndexAA 综合指数26Artificial Analysis (v4.1.1)2026-08-28独立复测
GPQA Diamond研究生级科学问答80%Artificial Analysis (v4.1.1)2026-08-28独立复测
Humanity's Last Exam人类最后考试20.8%Artificial Analysis (v4.1.1)2026-08-28独立复测
SciCode科学计算编程36%Artificial Analysis (v4.1.1)2026-08-28独立复测
Terminal-Bench Hard终端 agent(AA 困难子集)28.8%Artificial Analysis (v4.1.1)2026-08-28独立复测
τ²-Bench Telecom工具调用 agent(电信域)67.8%Artificial Analysis (v4.1.1)2026-08-28独立复测
IFBench指令遵循71.5%Artificial Analysis (v4.1.1)2026-08-28独立复测
Terminal-Bench终端 agent38.6%Artificial Analysis · Terminal-Bench 2.12026-08-28独立复测
τ³-Bench Banking工具调用 agent(银行域)10.3%Artificial Analysis · τ³-Bench Banking2026-08-28独立复测
LMArena Chinese Elo中文人类偏好 Elo1399LMArena Text · Chinese (style control)2026-08-28独立复测

更新 2026-08-28 · 排名供选型参考,基准会饱和、会泄漏、会过时。