gpt-oss-20b
OpenAI 开源 20B · OpenAI · 发布 2025-08-05 · 当前代
16GB 显存跑的推理模型,数学能力惊人。
- 类型
- MoE
- 注意力
- GQA(64 Q / 8 KV,head_dim 64),滑窗 128 与全注意力逐层交替
- 层数
- 24
- 专家
- 32 · 激活 4
- 隐藏维
- 2880
- 词表
- 201,088
24 层 = 12 × (滑窗 128 + 全注意力)。32 专家选 4,专家中间维 2880,带 attention sink。YaRN factor 32(原始 4K → 128K),theta 150000。MoE 权重原生 MXFP4,注意力 / 嵌入为 BF16。表内 kv_layers 指 12 层全注意力层。
类型:MoE,20.9B 总参 / 3.6B 激活,纯文本。
| 项目 | 数值 |
|---|---|
| 层数 | 24 = 12 × (滑窗 128 + 全注意力) |
| 隐藏维 | 2,880 |
| 专家 | 32,每 token 选 4,专家中间维 2,880 |
| 注意力 | 64 Q / 8 KV,head_dim 64,attention sink,bias |
| RoPE | YaRN factor 32,原始 4,096,theta 150,000 |
| 词表 | 201,088(o200k_harmony) |
| 上下文 | 131,072 |
| 量化 | MoE 权重 MXFP4,其余 BF16 |
config.json 中 model_type: gpt_oss,quant_method: mxfp4。
参考:openai/gpt-oss-20b config.json 与模型卡(arXiv 2508.10925)。
| 精度 | 权重大小 | 说明 |
|---|---|---|
| BF16 | 14 GB | 官方精度 |
| FP8 | — | 暂无 |
| Q8 | 12 GB | |
| Q4 | 12 GB | GGUF Q4_K_M 或等效 |
- 消费级 24GB
- 官方 MXFP4 13.8 GB(GGUF Q4_K_M 11.6 GB),16GB 卡即可;24GB 卡 128K 上下文单并发
- 单卡 80GB
- 过剩;可高并发
- 8×80GB 节点
- 过剩
KV Cache:只有 12 层全注意力层随长度增长:8 KV 头 × 64 × 2(K/V)× 2 B = 2 KiB/层 → 24 KiB/token(BF16)。12 层滑窗层窗口 128,KV 固定可忽略。128K 上下文 KV ≈ 3 GB。表内「bf16」为 HF 官方 safetensors 13.8 GB(MoE 为 MXFP4、其余 BF16),完全反量化到 BF16 约 42 GB。 ≈ 24 KiB/token
⚠ 能加载 ≠ 能在满上下文 / 高并发下舒服跑。标「估」的数字来自 计算器 公式或社区量化文件大小。
| 精度 | 权重大小 | 参考显存 | 说明 |
|---|---|---|---|
| MXFP4(官方) | 13.8 GB | 16GB | HF safetensors 3 分片 13.76 GB;unsloth GGUF F16 同为 13.8 GB |
| Q8 | 12.1 GB | 16GB | unsloth GGUF Q8_0 |
| Q4 | 11.6 GB | 16GB | unsloth GGUF Q4_K_M |
| 全 BF16 反量化 | ≈42 GB | 80GB | 按 20.9B × 2 B 估算,无官方文件 |
KV Cache:12 层全注意力层 × 2 KiB = 24 KiB/token;滑窗层固定可忽略。128K 上下文 KV ≈ 3 GB。
参考配置:
- 16GB 卡 / Mac:MXFP4 全量可跑
- RTX 4090 24GB:128K 上下文单并发
- 80GB:高并发
警示:MXFP4 只有 Hopper / Blackwell 原生支持,其他 GPU 会在加载时反量化到 BF16(约 42 GB)或需用 GGUF。
| 配置 | 量化 | 占用 / 显存 | 解码 tok/s | 预填充 tok/s | 最大上下文 |
|---|---|---|---|---|---|
| 2× RTX 3060 12GB消费级 | BF16 | 16 GB / 24 GB | 54 | 3125 | 333K |
| RTX 4060 Ti 16GB消费级 | BF16 | 15 GB / 16 GB | 25 | 1375 | 43K |
| RTX 3090 24GB消费级 | BF16 | 15 GB / 24 GB | 82 | 4438 | 384K |
| RTX 4070 Ti Super 16GB消费级 | BF16 | 15 GB / 16 GB | 59 | 2750 | 43K |
| RTX 5070 Ti 16GB消费级 | BF16 | 15 GB / 16 GB | 79 | 5500 | 43K |
| RTX 4080 Super 16GB消费级 | BF16 | 15 GB / 16 GB | 65 | 3250 | 43K |
| RTX 5080 16GB消费级 | BF16 | 15 GB / 16 GB | 84 | 7000 | 43K |
| RTX 4090 24GB消费级 | BF16 | 15 GB / 24 GB | 89 | 10313 | 384K |
| RTX 5090 32GB消费级 | BF16 | 15 GB / 32 GB | 157 | 13125 | 725K |
| L4 24GB工作站 | BF16 | 15 GB / 24 GB | 26 | 3750 | 384K |
| RTX A6000 48GB工作站 | BF16 | 15 GB / 48 GB | 67 | 4813 | 1.4M |
| RTX 6000 Ada 48GB工作站 | BF16 | 15 GB / 48 GB | 84 | 5688 | 1.4M |
| L40S 48GB工作站 | BF16 | 15 GB / 48 GB | 76 | 5688 | 1.4M |
| RTX PRO 6000 Blackwell 96GB工作站 | BF16 | 15 GB / 96 GB | 157 | 15625 | 3.4M |
| A10 24GB数据中心 | BF16 | 15 GB / 24 GB | 53 | 3875 | 384K |
| A100 40GB数据中心 | BF16 | 15 GB / 40 GB | 137 | 19500 | 1.0M |
| A100 80GB数据中心 | BF16 | 15 GB / 80 GB | 179 | 19500 | 2.7M |
| H20 96GB数据中心 | BF16 | 15 GB / 96 GB | 351 | 4625 | 3.4M |
| 昇腾 Ascend 910B 64GB数据中心 | BF16 | 15 GB / 64 GB | 141 | 17500 | 2.0M |
| H100 80GB PCIe数据中心 | BF16 | 15 GB / 80 GB | 176 | 47250 | 2.7M |
| H100 80GB SXM数据中心 | BF16 | 15 GB / 80 GB | 294 | 61813 | 2.7M |
| AMD MI300X 192GB数据中心 | BF16 | 15 GB / 192 GB | 465 | 81688 | 7.4M |
| H200 141GB数据中心 | BF16 | 15 GB / 141 GB | 422 | 61813 | 5.3M |
| B200 192GB数据中心 | BF16 | 15 GB / 192 GB | 703 | 140625 | 7.4M |
| Mac M4 Pro 64GB统一内存 | BF16 | 15 GB / 56 GB | 18 | 1063 | 1.7M |
| DGX Spark 128GB统一内存 | BF16 | 15 GB / 120 GB | 18 | 3875 | 4.4M |
| Mac M4 Max 128GB统一内存 | BF16 | 15 GB / 120 GB | 37 | 2125 | 4.4M |
| Mac Studio M3 Ultra 256GB统一内存 | BF16 | 15 GB / 240 GB | 55 | 3563 | 9.4M |
| Mac Studio M3 Ultra 512GB统一内存 | BF16 | 15 GB / 490 GB | 55 | 3563 | 19.8M |
单流(batch=1)估算:解码 ≈ 显存带宽 × 效率 ÷ 每 token 读取字节(激活参数 × 量化位宽 + KV);预填充 ≈ FP16 算力 × 0.45 ÷ (2 × 激活参数)。多卡按张量并行、带宽求和 × 0.55。实际受引擎、驱动、PCIe 影响,误差 ±30%。反向查:我的卡能跑谁 →
编程SWE-bench Verified 60.7、Codeforces Elo 2230、Aider Polyglot 34.2(OpenAI 模型卡 arXiv 2508.10925,high)。
推理GPQA Diamond 71.5(无工具)/ 74.2(工具)、HLE 10.9 / 17.3(工具)(OpenAI 模型卡)。
数学AIME 2025 91.7(无工具)/ 98.7(工具)、AIME 2024 92.1 / 96.0(OpenAI 模型卡)。
知识MMLU 85.3、MMMLU 75.7、HealthBench 42.5(OpenAI 模型卡)。
Agenttau-bench Retail 54.8、Airline 38.0(OpenAI 模型卡)。
中文中文弱,MMMLU 75.7,不建议中文产品主力。
考试型推理相对体量极强:AIME 2025 91.7(无工具)/ 98.7(工具)、AIME 2024 92.1、GPQA Diamond 71.5、Codeforces 2230(模型卡,high 档)。HLE 10.9 / 17.3(工具)显示前沿知识浅。工程型推理中等:SWE-bench Verified 60.7、tau-bench Retail 54.8 / Airline 38.0。reasoning 低档时推理链很短,分数明显下滑。
- 1.官方 MXFP4 13.8 GB,16GB 卡 / 笔记本可跑,仅 12 层全注意力 KV 24 KiB/token
- 2.AIME 2025 91.7(无工具)/ 98.7(工具)、GPQA 71.5,考试型推理远超体量
- 3.Apache-2.0,reasoning 三档可调,SWE-bench Verified 60.7
- 1.知识与中文弱(MMLU 85.3、MMMLU 75.7),HLE 无工具仅 10.9
- 2.幻觉率高,tau-bench Airline 38.0、Aider Polyglot 34.2,agent 稳定性一般
- 3.Harmony 格式要求严格,chat template 不对会明显掉分
| 基准 | 分数 | 来源 | 日期 | 证据 |
|---|---|---|---|---|
| LMArena Text Elo人类偏好 Elo | 1300 | LMArena Text (style control) | 2025-12-20 | 独立复测 |
| SWE-bench Verified真实仓库修 bug | 60.7% | gpt-oss 模型卡 | 2025-12-20 | 厂商公布 |
| GPQA Diamond研究生级科学问答 | 71.5% | gpt-oss 模型卡 | 2025-12-20 | 厂商公布 |
| Humanity's Last Exam人类最后考试 | 10.9% | gpt-oss 模型卡 | 2025-12-20 | 厂商公布 |
| AIME 2025美国数学邀请赛 | 91.7% | gpt-oss 模型卡 | 2025-12-20 | 厂商公布 |
| Artificial Analysis Intelligence IndexAA 综合指数 | 15 | Artificial Analysis (v4.1.1) | 2026-08-28 | 独立复测 |
| GPQA Diamond研究生级科学问答 | 68.8% | Artificial Analysis (v4.1.1) | 2026-08-28 | 独立复测 |
| Humanity's Last Exam人类最后考试 | 11% | Artificial Analysis (v4.1.1) | 2026-08-28 | 独立复测 |
| AIME 2025美国数学邀请赛 | 89.3% | Artificial Analysis (v4.1.1) | 2026-08-28 | 独立复测 |
| LiveCodeBench竞赛编程 | 77.7% | Artificial Analysis (v4.1.1) | 2026-08-28 | 独立复测 |
| SciCode科学计算编程 | 34.4% | Artificial Analysis (v4.1.1) | 2026-08-28 | 独立复测 |
| Terminal-Bench Hard终端 agent(AA 困难子集) | 10.6% | Artificial Analysis (v4.1.1) | 2026-08-28 | 独立复测 |
| τ²-Bench Telecom工具调用 agent(电信域) | 60.2% | Artificial Analysis (v4.1.1) | 2026-08-28 | 独立复测 |
| IFBench指令遵循 | 65.1% | Artificial Analysis (v4.1.1) | 2026-08-28 | 独立复测 |
| Terminal-Bench终端 agent | 13.9% | Artificial Analysis · Terminal-Bench 2.1 | 2026-08-28 | 独立复测 |
| τ³-Bench Banking工具调用 agent(银行域) | 7% | Artificial Analysis · τ³-Bench Banking | 2026-08-28 | 独立复测 |
| LMArena Chinese Elo中文人类偏好 Elo | 1350 | LMArena Text · Chinese (style control) | 2026-08-28 | 独立复测 |
更新 2026-08-28 · 排名供选型参考,基准会饱和、会泄漏、会过时。