开源权重可下推理模型·可关可商用 · OpenMDW License Agreement v1.1
NVIDIA logo

NVIDIA Nemotron 3 Ultra 550B-A55B

NVIDIA Nemotron 3 Ultra · NVIDIA · 发布 2026-06-04 · 当前代

NVIDIA 550B 开源旗舰,GPQA 87、LCB 89,1M 上下文。

参数
550B 总 / 55B 激活
HYBRID
上下文
1M
价格 / 1M tok
$0.50 / $2.20
第三方托管常见价(OpenR · 2026-08-28
最低可跑
Mac Studio M3 Ultra
Q6_K · 442 GB · ≈9.1 tok/s
Arena Elo
AA 综合指数38
2026-08-28
真实仓库修 bug70.7
2026-08-28
GPQA 推理86.7
2026-08-28
类型
Hybrid(线性 + 全注意力)
注意力
混合:10 层注意力(64 Q / 2 KV)+ 64 层 Mamba-2 + 54 层 LatentMoE
层数
128
专家
512 · 激活 22 + 共享
隐藏维
8192
词表
131,072

Mamba-2 / 注意力 / LatentMoE 混合 + 多 token 预测。另有 GenRM 奖励模型版。

完善中

Token Embedding词表 131,072× 128 层注意力:混合:10 层注意力KV 头 2 · head_dim 128路由top-22E1E2E3共享专家512 专家 · 激活 22 · d=8192LM Head550B / 55B 激活实线 = 已公开 · 虚线 = 未披露
精度权重大小说明
BF161100 GB官方精度
FP8550 GB
Q8584 GB
Q4319 GBGGUF Q4_K_M 或等效
消费级 24GB
未评估
单卡 80GB
不可行
8×80GB 节点
官方最低 8×B200 / 8×H200 / 16×H100(约 1.5 TB HBM)

⚠ 能加载 ≠ 能在满上下文 / 高并发下舒服跑。标「估」的数字来自 计算器 公式或社区量化文件大小。

完善中

硬件配置与预估吞吐
最低可跑(8K 上下文)
Mac Studio M3 Ultra 512GB
≈¥75,000 · 合计 ≈¥75,000 · 统一内存
量化
Q6_K
解码
9.1 tok/s
最大上下文
390K
推荐配置(≥Q8 · 32K 上下文 · ≥15 tok/s)
8 × A100 80GB
云 ≈$1.5/h × 8 · 合计 ≈¥480,000 · 数据中心
量化
FP8
解码
157 tok/s
最大上下文
1.3M
配置量化占用 / 显存解码 tok/s预填充 tok/s最大上下文
8× L40S 48GB工作站Q4_K_M330 GB / 384 GB1152978443K
4× RTX PRO 6000 Blackwell 96GB工作站Q4_K_M325 GB / 384 GB1204091482K
8× A100 80GB数据中心FP8560 GB / 640 GB162102111.3M
4× H20 96GB数据中心Q4_K_M325 GB / 384 GB2671211482K
8× 昇腾 Ascend 910B 64GB数据中心Q6_K451 GB / 512 GB1569164499K
8× H100 80GB PCIe数据中心FP8560 GB / 640 GB158247421.3M
8× H100 80GB SXM数据中心FP8560 GB / 640 GB265323671.3M
2× AMD MI300X 192GB数据中心Q5_K_M383 GB / 384 GB1491069417K
4× H200 141GB数据中心FP8555 GB / 564 GB19016184147K
2× B200 192GB数据中心Q5_K_M383 GB / 384 GB2261840917K
Mac Studio M3 Ultra 512GB统一内存Q6_K442 GB / 490 GB9.1233390K

单流(batch=1)估算:解码 ≈ 显存带宽 × 效率 ÷ 每 token 读取字节(激活参数 × 量化位宽 + KV);预填充 ≈ FP16 算力 × 0.45 ÷ (2 × 激活参数)。多卡按张量并行、带宽求和 × 0.55。实际受引擎、驱动、PCIe 影响,误差 ±30%。反向查:我的卡能跑谁 →

用计算器按你的上下文与并发估算 →

编程LiveCodeBench v6 89.0、SWE-bench Verified 70.7、Terminal-Bench 2.1 56.4(官方)。

推理GPQA 87.0、MMLU-Pro 86.8(官方)。

AgentTauBench 平均 70.9(官方)。

中文官方支持中文(10 种语言之一)。

逻辑能力

考试型推理强(GPQA 87.0、MMLU-Pro 86.8),工程型推理不错(SWE-bench 70.7、Terminal-Bench 2.1 56.4)。

亮点
  1. 1.GPQA 87.0、LiveCodeBench v6 89.0、SWE-bench Verified 70.7%(官方)
  2. 2.OpenMDW 许可,权重 + 数据 + 配方开放
  3. 3.1M 上下文,混合 Mamba 架构长序列成本低
  1. 1.需 8×B200 或 16×H100 级别,个人 / 小团队不可部署
  2. 2.AA 智能指数 38,低于 Hy3(42)、MiMo-V2.5-Pro(43)
  3. 3.llama.cpp / Ollama 支持依赖社区 GGUF
适合:企业级长时程 agent · 超长上下文代码库分析
不适合:单机部署 · 成本敏感场景
基准分数来源日期证据
Artificial Analysis Intelligence IndexAA 综合指数38Artificial Analysis Intelligence Index v32026-08-28独立复测
SWE-bench Verified真实仓库修 bug70.7%NVIDIA Nemotron 3 Ultra 模型卡2026-08-28厂商公布
LiveCodeBench竞赛编程89%NVIDIA Nemotron 3 Ultra 模型卡2026-08-28厂商公布
GPQA Diamond研究生级科学问答87%NVIDIA Nemotron 3 Ultra 模型卡2026-08-28厂商公布
Terminal-Bench终端 agent56.4%NVIDIA Nemotron 3 Ultra 模型卡2026-08-28厂商公布
Artificial Analysis Intelligence IndexAA 综合指数38Artificial Analysis (v4.1.1)2026-08-28独立复测
GPQA Diamond研究生级科学问答86.7%Artificial Analysis (v4.1.1)2026-08-28独立复测
Humanity's Last Exam人类最后考试28.4%Artificial Analysis (v4.1.1)2026-08-28独立复测
SciCode科学计算编程39.9%Artificial Analysis (v4.1.1)2026-08-28独立复测
Terminal-Bench Hard终端 agent(AA 困难子集)36.4%Artificial Analysis (v4.1.1)2026-08-28独立复测
τ²-Bench Telecom工具调用 agent(电信域)83.3%Artificial Analysis (v4.1.1)2026-08-28独立复测
IFBench指令遵循81.4%Artificial Analysis (v4.1.1)2026-08-28独立复测
Terminal-Bench终端 agent53.9%Artificial Analysis · Terminal-Bench 2.12026-08-28独立复测
τ³-Bench Banking工具调用 agent(银行域)14.2%Artificial Analysis · τ³-Bench Banking2026-08-28独立复测
LMArena Chinese Elo中文人类偏好 Elo1458LMArena Text · Chinese (style control)2026-08-28独立复测

更新 2026-08-28 · 排名供选型参考,基准会饱和、会泄漏、会过时。