开源权重可下推理模型可商用 · Apache-2.0
OpenAI logo

gpt-oss-120b

OpenAI 开源 120B · OpenAI · 发布 2025-08-05 · 当前代

单卡 80GB 跑的 OpenAI 开源推理模型,5B 激活极快。

参数
117B 总 / 5.1B 激活
MOE
上下文
128K
输出 128K
价格 / 1M tok
$0.10 / $0.50
第三方托管常见价(Groq · 2025-12-20
最低可跑
4× RTX 3090
Q8_0 · 69 GB · ≈343 tok/s
Arena Elo1340
2025-12-20
AA 综合指数24
2026-08-28
真实仓库修 bug62.4
2025-12-20
GPQA 推理78.2
2026-08-28
类型
MoE
注意力
GQA(64 Q 头 / 8 KV 头),交替稠密 / 滑窗 128
层数
36
专家
128 · 激活 4
隐藏维
2880
词表
201,088

MoE 权重原生 MXFP4(4.25 bit)。交替全注意力与 128 滑窗层,带 attention sink。Harmony 对话格式,推理强度 low/medium/high。

类型:MoE,116.8B 总 / 5.1B 激活。

  • 36 层,隐藏维 2880,词表 201,088(o200k_harmony)
  • 专家:128 个,每 token 激活 4 个,无共享专家
  • GQA:64 Q 头 / 8 KV 头,head_dim 64
  • 注意力交替:稠密全注意力层 ↔ 128 token 滑窗层;每头带 learned attention sink
  • RoPE + YaRN 到 128K
  • MoE 权重训练后量化为 MXFP4(每参数 4.25 bit)

参考:gpt-oss 模型卡。

Token Embedding词表 201,088× 36 层注意力:GQAKV 头 8 · head_dim 64路由top-4E1E2E3128 专家 · 激活 4 · d=2880LM Head117B / 5.1B 激活实线 = 已公开 · 虚线 = 未披露
精度权重大小说明
BF16暂无
FP8暂无
Q863 GB
Q463 GBGGUF Q4_K_M 或等效
消费级 24GB
不可行(MXFP4 63 GB)
单卡 80GB
MXFP4 63 GB 单卡 H100 可跑,官方目标配置
8×80GB 节点
高并发服务

KV Cache:8 KV 头 × 64 × 2 × 36 层 × 2 B = 72 KiB/token(滑窗层实际更小)。72 KiB/token

⚠ 能加载 ≠ 能在满上下文 / 高并发下舒服跑。标「估」的数字来自 计算器 公式或社区量化文件大小。

精度权重大小参考显存
MXFP4(原生)63 GB80GB 单卡
BF16(反量化)≈ 234 GB4×80GB,无必要

KV Cache:≤ 72 KiB/token,128K 上下文 ≈ 9 GB。

参考配置

  • 24GB:不可行(用 gpt-oss-20b)
  • 80GB H100:MXFP4 + 128K 上下文,官方目标
  • 2×RTX 4090 48GB:社区可行,需 offload
硬件配置与预估吞吐
最低可跑(8K 上下文)
4 × RTX 3090 24GB
二手 ≈¥5,000 × 4 · 合计 ≈¥20,000 · 消费级
量化
Q8_0
解码
343 tok/s
最大上下文
395K
推荐配置(≥Q8 · 32K 上下文 · ≥15 tok/s)
4 × RTX 3090 24GB
二手 ≈¥5,000 × 4 · 合计 ≈¥20,000 · 消费级
量化
Q8_0
解码
263 tok/s
最大上下文
395K
配置量化占用 / 显存解码 tok/s预填充 tok/s最大上下文
4× RTX 3090 24GB消费级Q8_069 GB / 96 GB34312529395K
4× RTX 4090 24GB消费级Q8_069 GB / 96 GB36929118395K
4× RTX 5090 32GB消费级FP8122 GB / 128 GB73037059176K
4× L4 24GB工作站Q8_069 GB / 96 GB11010588395K
2× RTX A6000 48GB工作站Q8_066 GB / 96 GB1416794430K
2× RTX 6000 Ada 48GB工作站Q8_066 GB / 96 GB1768029430K
2× L40S 48GB工作站Q8_066 GB / 96 GB1588029430K
RTX PRO 6000 Blackwell 96GB工作站Q8_065 GB / 96 GB19411029447K
4× A10 24GB数据中心Q8_069 GB / 96 GB22010941395K
2× A100 40GB数据中心Q8_066 GB / 80 GB28527529202K
A100 80GB数据中心Q8_065 GB / 80 GB22113765219K
H20 96GB数据中心Q8_065 GB / 96 GB4333265447K
2× 昇腾 Ascend 910B 64GB数据中心FP8120 GB / 128 GB32624706245K
H100 80GB PCIe数据中心Q8_065 GB / 80 GB21633353219K
H100 80GB SXM数据中心Q8_065 GB / 80 GB36243632219K
AMD MI300X 192GB数据中心FP8118 GB / 192 GB638576622.0M
H200 141GB数据中心FP8118 GB / 141 GB57843632649K
B200 192GB数据中心FP8118 GB / 192 GB963992652.0M
DGX Spark 128GB统一内存FP8118 GB / 120 GB25273551K
Mac M4 Max 128GB统一内存FP8118 GB / 120 GB51150051K
Mac Studio M3 Ultra 256GB统一内存BF16236 GB / 240 GB38251568K
Mac Studio M3 Ultra 512GB统一内存BF16236 GB / 490 GB3825153.5M

单流(batch=1)估算:解码 ≈ 显存带宽 × 效率 ÷ 每 token 读取字节(激活参数 × 量化位宽 + KV);预填充 ≈ FP16 算力 × 0.45 ÷ (2 × 激活参数)。多卡按张量并行、带宽求和 × 0.55。实际受引擎、驱动、PCIe 影响,误差 ±30%。反向查:我的卡能跑谁 →

用计算器按你的上下文与并发估算 →

编程SWE-bench Verified 62.4%、Codeforces 2622(工具,官方)。

推理GPQA Diamond 80.1%、HLE 19.0%(无工具,官方)。

数学AIME 2025 97.9%(工具)、92.5%(无工具,官方)。

Agentτ-bench Retail 67.8%(官方)。

中文弱,中文非重点语言。

逻辑能力

考试型推理相对体量极强(AIME 2025 97.9% 带工具、GPQA 80.1%),得益于 o 系列同源的 RL 配方。工程型推理(SWE-bench 62.4%)中等。reasoning effort 是关键:low 时几乎不思考,high 时思考链可达数万 token。常见问题:英文之外语言的推理质量下降、幻觉多。

亮点
  1. 1.Apache-2.0,OpenAI 六年来首次开放权重
  2. 2.MXFP4 原生 63 GB,单张 H100 / 双 4090 级别即可部署
  3. 3.5.1B 激活,吞吐极高;推理强度三档可调
  1. 1.Harmony 格式必须严格遵守,旧版 chat template 会显著降质
  2. 2.知识广度与多语言弱(训练偏英文、STEM),中文明显不如 Qwen / GLM
  3. 3.幻觉率偏高(官方 PersonQA 幻觉率 49%),事实问答慎用
适合:单卡高吞吐推理服务 · 数学 / STEM 推理 · 英文 agent 原型
不适合:中文为主的产品 · 知识问答 / 事实核查
基准分数来源日期证据
LMArena Text Elo人类偏好 Elo1340LMArena Text (style control)2025-12-20独立复测
SWE-bench Verified真实仓库修 bug62.4%gpt-oss 模型卡2025-12-20厂商公布
GPQA Diamond研究生级科学问答80.1%gpt-oss 模型卡2025-12-20厂商公布
Humanity's Last Exam人类最后考试19%gpt-oss 模型卡2025-12-20厂商公布
AIME 2025美国数学邀请赛92.5%gpt-oss 模型卡2025-12-20厂商公布
τ²-bench工具调用 agent67.8%gpt-oss 模型卡2025-12-20厂商公布
Artificial Analysis Intelligence IndexAA 综合指数24Artificial Analysis (v4.1.1)2026-08-28独立复测
GPQA Diamond研究生级科学问答78.2%Artificial Analysis (v4.1.1)2026-08-28独立复测
Humanity's Last Exam人类最后考试19.6%Artificial Analysis (v4.1.1)2026-08-28独立复测
AIME 2025美国数学邀请赛93.4%Artificial Analysis (v4.1.1)2026-08-28独立复测
LiveCodeBench竞赛编程87.8%Artificial Analysis (v4.1.1)2026-08-28独立复测
SciCode科学计算编程38.9%Artificial Analysis (v4.1.1)2026-08-28独立复测
Terminal-Bench Hard终端 agent(AA 困难子集)23.5%Artificial Analysis (v4.1.1)2026-08-28独立复测
τ²-Bench Telecom工具调用 agent(电信域)65.8%Artificial Analysis (v4.1.1)2026-08-28独立复测
IFBench指令遵循69%Artificial Analysis (v4.1.1)2026-08-28独立复测
Terminal-Bench终端 agent26.2%Artificial Analysis · Terminal-Bench 2.12026-08-28独立复测
τ³-Bench Banking工具调用 agent(银行域)12.8%Artificial Analysis · τ³-Bench Banking2026-08-28独立复测
LMArena Chinese Elo中文人类偏好 Elo1377LMArena Text · Chinese (style control)2026-08-28独立复测

更新 2025-12-20 · 排名供选型参考,基准会饱和、会泄漏、会过时。