gpt-oss-120b
OpenAI 开源 120B · OpenAI · 发布 2025-08-05 · 当前代
单卡 80GB 跑的 OpenAI 开源推理模型,5B 激活极快。
- 类型
- MoE
- 注意力
- GQA(64 Q 头 / 8 KV 头),交替稠密 / 滑窗 128
- 层数
- 36
- 专家
- 128 · 激活 4
- 隐藏维
- 2880
- 词表
- 201,088
MoE 权重原生 MXFP4(4.25 bit)。交替全注意力与 128 滑窗层,带 attention sink。Harmony 对话格式,推理强度 low/medium/high。
类型:MoE,116.8B 总 / 5.1B 激活。
- 36 层,隐藏维 2880,词表 201,088(o200k_harmony)
- 专家:128 个,每 token 激活 4 个,无共享专家
- GQA:64 Q 头 / 8 KV 头,head_dim 64
- 注意力交替:稠密全注意力层 ↔ 128 token 滑窗层;每头带 learned attention sink
- RoPE + YaRN 到 128K
- MoE 权重训练后量化为 MXFP4(每参数 4.25 bit)
参考:gpt-oss 模型卡。
| 精度 | 权重大小 | 说明 |
|---|---|---|
| BF16 | — | 暂无 |
| FP8 | — | 暂无 |
| Q8 | 63 GB | |
| Q4 | 63 GB | GGUF Q4_K_M 或等效 |
- 消费级 24GB
- 不可行(MXFP4 63 GB)
- 单卡 80GB
- MXFP4 63 GB 单卡 H100 可跑,官方目标配置
- 8×80GB 节点
- 高并发服务
KV Cache:8 KV 头 × 64 × 2 × 36 层 × 2 B = 72 KiB/token(滑窗层实际更小)。 ≈ 72 KiB/token
⚠ 能加载 ≠ 能在满上下文 / 高并发下舒服跑。标「估」的数字来自 计算器 公式或社区量化文件大小。
| 精度 | 权重大小 | 参考显存 |
|---|---|---|
| MXFP4(原生) | 63 GB | 80GB 单卡 |
| BF16(反量化) | ≈ 234 GB | 4×80GB,无必要 |
KV Cache:≤ 72 KiB/token,128K 上下文 ≈ 9 GB。
参考配置:
- 24GB:不可行(用 gpt-oss-20b)
- 80GB H100:MXFP4 + 128K 上下文,官方目标
- 2×RTX 4090 48GB:社区可行,需 offload
| 配置 | 量化 | 占用 / 显存 | 解码 tok/s | 预填充 tok/s | 最大上下文 |
|---|---|---|---|---|---|
| 4× RTX 3090 24GB消费级 | Q8_0 | 69 GB / 96 GB | 343 | 12529 | 395K |
| 4× RTX 4090 24GB消费级 | Q8_0 | 69 GB / 96 GB | 369 | 29118 | 395K |
| 4× RTX 5090 32GB消费级 | FP8估 | 122 GB / 128 GB | 730 | 37059 | 176K |
| 4× L4 24GB工作站 | Q8_0 | 69 GB / 96 GB | 110 | 10588 | 395K |
| 2× RTX A6000 48GB工作站 | Q8_0 | 66 GB / 96 GB | 141 | 6794 | 430K |
| 2× RTX 6000 Ada 48GB工作站 | Q8_0 | 66 GB / 96 GB | 176 | 8029 | 430K |
| 2× L40S 48GB工作站 | Q8_0 | 66 GB / 96 GB | 158 | 8029 | 430K |
| RTX PRO 6000 Blackwell 96GB工作站 | Q8_0 | 65 GB / 96 GB | 194 | 11029 | 447K |
| 4× A10 24GB数据中心 | Q8_0 | 69 GB / 96 GB | 220 | 10941 | 395K |
| 2× A100 40GB数据中心 | Q8_0 | 66 GB / 80 GB | 285 | 27529 | 202K |
| A100 80GB数据中心 | Q8_0 | 65 GB / 80 GB | 221 | 13765 | 219K |
| H20 96GB数据中心 | Q8_0 | 65 GB / 96 GB | 433 | 3265 | 447K |
| 2× 昇腾 Ascend 910B 64GB数据中心 | FP8估 | 120 GB / 128 GB | 326 | 24706 | 245K |
| H100 80GB PCIe数据中心 | Q8_0 | 65 GB / 80 GB | 216 | 33353 | 219K |
| H100 80GB SXM数据中心 | Q8_0 | 65 GB / 80 GB | 362 | 43632 | 219K |
| AMD MI300X 192GB数据中心 | FP8估 | 118 GB / 192 GB | 638 | 57662 | 2.0M |
| H200 141GB数据中心 | FP8估 | 118 GB / 141 GB | 578 | 43632 | 649K |
| B200 192GB数据中心 | FP8估 | 118 GB / 192 GB | 963 | 99265 | 2.0M |
| DGX Spark 128GB统一内存 | FP8估 | 118 GB / 120 GB | 25 | 2735 | 51K |
| Mac M4 Max 128GB统一内存 | FP8估 | 118 GB / 120 GB | 51 | 1500 | 51K |
| Mac Studio M3 Ultra 256GB统一内存 | BF16估 | 236 GB / 240 GB | 38 | 2515 | 68K |
| Mac Studio M3 Ultra 512GB统一内存 | BF16估 | 236 GB / 490 GB | 38 | 2515 | 3.5M |
单流(batch=1)估算:解码 ≈ 显存带宽 × 效率 ÷ 每 token 读取字节(激活参数 × 量化位宽 + KV);预填充 ≈ FP16 算力 × 0.45 ÷ (2 × 激活参数)。多卡按张量并行、带宽求和 × 0.55。实际受引擎、驱动、PCIe 影响,误差 ±30%。反向查:我的卡能跑谁 →
编程SWE-bench Verified 62.4%、Codeforces 2622(工具,官方)。
推理GPQA Diamond 80.1%、HLE 19.0%(无工具,官方)。
数学AIME 2025 97.9%(工具)、92.5%(无工具,官方)。
Agentτ-bench Retail 67.8%(官方)。
中文弱,中文非重点语言。
考试型推理相对体量极强(AIME 2025 97.9% 带工具、GPQA 80.1%),得益于 o 系列同源的 RL 配方。工程型推理(SWE-bench 62.4%)中等。reasoning effort 是关键:low 时几乎不思考,high 时思考链可达数万 token。常见问题:英文之外语言的推理质量下降、幻觉多。
- 1.Apache-2.0,OpenAI 六年来首次开放权重
- 2.MXFP4 原生 63 GB,单张 H100 / 双 4090 级别即可部署
- 3.5.1B 激活,吞吐极高;推理强度三档可调
- 1.Harmony 格式必须严格遵守,旧版 chat template 会显著降质
- 2.知识广度与多语言弱(训练偏英文、STEM),中文明显不如 Qwen / GLM
- 3.幻觉率偏高(官方 PersonQA 幻觉率 49%),事实问答慎用
| 基准 | 分数 | 来源 | 日期 | 证据 |
|---|---|---|---|---|
| LMArena Text Elo人类偏好 Elo | 1340 | LMArena Text (style control) | 2025-12-20 | 独立复测 |
| SWE-bench Verified真实仓库修 bug | 62.4% | gpt-oss 模型卡 | 2025-12-20 | 厂商公布 |
| GPQA Diamond研究生级科学问答 | 80.1% | gpt-oss 模型卡 | 2025-12-20 | 厂商公布 |
| Humanity's Last Exam人类最后考试 | 19% | gpt-oss 模型卡 | 2025-12-20 | 厂商公布 |
| AIME 2025美国数学邀请赛 | 92.5% | gpt-oss 模型卡 | 2025-12-20 | 厂商公布 |
| τ²-bench工具调用 agent | 67.8% | gpt-oss 模型卡 | 2025-12-20 | 厂商公布 |
| Artificial Analysis Intelligence IndexAA 综合指数 | 24 | Artificial Analysis (v4.1.1) | 2026-08-28 | 独立复测 |
| GPQA Diamond研究生级科学问答 | 78.2% | Artificial Analysis (v4.1.1) | 2026-08-28 | 独立复测 |
| Humanity's Last Exam人类最后考试 | 19.6% | Artificial Analysis (v4.1.1) | 2026-08-28 | 独立复测 |
| AIME 2025美国数学邀请赛 | 93.4% | Artificial Analysis (v4.1.1) | 2026-08-28 | 独立复测 |
| LiveCodeBench竞赛编程 | 87.8% | Artificial Analysis (v4.1.1) | 2026-08-28 | 独立复测 |
| SciCode科学计算编程 | 38.9% | Artificial Analysis (v4.1.1) | 2026-08-28 | 独立复测 |
| Terminal-Bench Hard终端 agent(AA 困难子集) | 23.5% | Artificial Analysis (v4.1.1) | 2026-08-28 | 独立复测 |
| τ²-Bench Telecom工具调用 agent(电信域) | 65.8% | Artificial Analysis (v4.1.1) | 2026-08-28 | 独立复测 |
| IFBench指令遵循 | 69% | Artificial Analysis (v4.1.1) | 2026-08-28 | 独立复测 |
| Terminal-Bench终端 agent | 26.2% | Artificial Analysis · Terminal-Bench 2.1 | 2026-08-28 | 独立复测 |
| τ³-Bench Banking工具调用 agent(银行域) | 12.8% | Artificial Analysis · τ³-Bench Banking | 2026-08-28 | 独立复测 |
| LMArena Chinese Elo中文人类偏好 Elo | 1377 | LMArena Text · Chinese (style control) | 2026-08-28 | 独立复测 |
更新 2025-12-20 · 排名供选型参考,基准会饱和、会泄漏、会过时。