开源权重可下推理模型单卡可跑可商用 · Apache-2.0
OpenAI logo

gpt-oss-20b

OpenAI 开源 20B · OpenAI · 发布 2025-08-05 · 当前代

16GB 显存跑的推理模型,数学能力惊人。

参数
20.9B 总 / 3.6B 激活
MOE
上下文
128K
价格 / 1M tok
$0.05 / $0.20
第三方托管常见价(OpenR · 2025-12-20
最低可跑
RTX 4060 Ti
BF16 · 15 GB · ≈25 tok/s
Arena Elo1300
2025-12-20
AA 综合指数15
2026-08-28
真实仓库修 bug60.7
2025-12-20
GPQA 推理68.8
2026-08-28
类型
MoE
注意力
GQA(64 Q / 8 KV,head_dim 64),滑窗 128 与全注意力逐层交替
层数
24
专家
32 · 激活 4
隐藏维
2880
词表
201,088

24 层 = 12 × (滑窗 128 + 全注意力)。32 专家选 4,专家中间维 2880,带 attention sink。YaRN factor 32(原始 4K → 128K),theta 150000。MoE 权重原生 MXFP4,注意力 / 嵌入为 BF16。表内 kv_layers 指 12 层全注意力层。

类型:MoE,20.9B 总参 / 3.6B 激活,纯文本。

项目数值
层数24 = 12 × (滑窗 128 + 全注意力)
隐藏维2,880
专家32,每 token 选 4,专家中间维 2,880
注意力64 Q / 8 KV,head_dim 64,attention sink,bias
RoPEYaRN factor 32,原始 4,096,theta 150,000
词表201,088(o200k_harmony)
上下文131,072
量化MoE 权重 MXFP4,其余 BF16

config.jsonmodel_type: gpt_ossquant_method: mxfp4

参考:openai/gpt-oss-20b config.json 与模型卡(arXiv 2508.10925)。

Token Embedding词表 201,088× 24 层(12 层全注意力)注意力:GQAKV 头 8 · head_dim 64路由top-4E1E2E332 专家 · 激活 4 · d=2880LM Head20.9B / 3.6B 激活实线 = 已公开 · 虚线 = 未披露
精度权重大小说明
BF1614 GB官方精度
FP8暂无
Q812 GB
Q412 GBGGUF Q4_K_M 或等效
消费级 24GB
官方 MXFP4 13.8 GB(GGUF Q4_K_M 11.6 GB),16GB 卡即可;24GB 卡 128K 上下文单并发
单卡 80GB
过剩;可高并发
8×80GB 节点
过剩

KV Cache:只有 12 层全注意力层随长度增长:8 KV 头 × 64 × 2(K/V)× 2 B = 2 KiB/层 → 24 KiB/token(BF16)。12 层滑窗层窗口 128,KV 固定可忽略。128K 上下文 KV ≈ 3 GB。表内「bf16」为 HF 官方 safetensors 13.8 GB(MoE 为 MXFP4、其余 BF16),完全反量化到 BF16 约 42 GB。24 KiB/token

⚠ 能加载 ≠ 能在满上下文 / 高并发下舒服跑。标「估」的数字来自 计算器 公式或社区量化文件大小。

精度权重大小参考显存说明
MXFP4(官方)13.8 GB16GBHF safetensors 3 分片 13.76 GB;unsloth GGUF F16 同为 13.8 GB
Q812.1 GB16GBunsloth GGUF Q8_0
Q411.6 GB16GBunsloth GGUF Q4_K_M
全 BF16 反量化≈42 GB80GB按 20.9B × 2 B 估算,无官方文件

KV Cache:12 层全注意力层 × 2 KiB = 24 KiB/token;滑窗层固定可忽略。128K 上下文 KV ≈ 3 GB。

参考配置

  • 16GB 卡 / Mac:MXFP4 全量可跑
  • RTX 4090 24GB:128K 上下文单并发
  • 80GB:高并发

警示:MXFP4 只有 Hopper / Blackwell 原生支持,其他 GPU 会在加载时反量化到 BF16(约 42 GB)或需用 GGUF。

硬件配置与预估吞吐
最低可跑(8K 上下文)
RTX 4060 Ti 16GB
≈¥3,500 · 合计 ≈¥3,500 · 消费级
量化
BF16
解码
25 tok/s
最大上下文
43K
推荐配置(≥Q8 · 32K 上下文 · ≥15 tok/s)
RTX 4060 Ti 16GB
≈¥3,500 · 合计 ≈¥3,500 · 消费级
量化
BF16
解码
23 tok/s
最大上下文
43K
配置量化占用 / 显存解码 tok/s预填充 tok/s最大上下文
2× RTX 3060 12GB消费级BF1616 GB / 24 GB543125333K
RTX 4060 Ti 16GB消费级BF1615 GB / 16 GB25137543K
RTX 3090 24GB消费级BF1615 GB / 24 GB824438384K
RTX 4070 Ti Super 16GB消费级BF1615 GB / 16 GB59275043K
RTX 5070 Ti 16GB消费级BF1615 GB / 16 GB79550043K
RTX 4080 Super 16GB消费级BF1615 GB / 16 GB65325043K
RTX 5080 16GB消费级BF1615 GB / 16 GB84700043K
RTX 4090 24GB消费级BF1615 GB / 24 GB8910313384K
RTX 5090 32GB消费级BF1615 GB / 32 GB15713125725K
L4 24GB工作站BF1615 GB / 24 GB263750384K
RTX A6000 48GB工作站BF1615 GB / 48 GB6748131.4M
RTX 6000 Ada 48GB工作站BF1615 GB / 48 GB8456881.4M
L40S 48GB工作站BF1615 GB / 48 GB7656881.4M
RTX PRO 6000 Blackwell 96GB工作站BF1615 GB / 96 GB157156253.4M
A10 24GB数据中心BF1615 GB / 24 GB533875384K
A100 40GB数据中心BF1615 GB / 40 GB137195001.0M
A100 80GB数据中心BF1615 GB / 80 GB179195002.7M
H20 96GB数据中心BF1615 GB / 96 GB35146253.4M
昇腾 Ascend 910B 64GB数据中心BF1615 GB / 64 GB141175002.0M
H100 80GB PCIe数据中心BF1615 GB / 80 GB176472502.7M
H100 80GB SXM数据中心BF1615 GB / 80 GB294618132.7M
AMD MI300X 192GB数据中心BF1615 GB / 192 GB465816887.4M
H200 141GB数据中心BF1615 GB / 141 GB422618135.3M
B200 192GB数据中心BF1615 GB / 192 GB7031406257.4M
Mac M4 Pro 64GB统一内存BF1615 GB / 56 GB1810631.7M
DGX Spark 128GB统一内存BF1615 GB / 120 GB1838754.4M
Mac M4 Max 128GB统一内存BF1615 GB / 120 GB3721254.4M
Mac Studio M3 Ultra 256GB统一内存BF1615 GB / 240 GB5535639.4M
Mac Studio M3 Ultra 512GB统一内存BF1615 GB / 490 GB55356319.8M

单流(batch=1)估算:解码 ≈ 显存带宽 × 效率 ÷ 每 token 读取字节(激活参数 × 量化位宽 + KV);预填充 ≈ FP16 算力 × 0.45 ÷ (2 × 激活参数)。多卡按张量并行、带宽求和 × 0.55。实际受引擎、驱动、PCIe 影响,误差 ±30%。反向查:我的卡能跑谁 →

用计算器按你的上下文与并发估算 →

编程SWE-bench Verified 60.7、Codeforces Elo 2230、Aider Polyglot 34.2(OpenAI 模型卡 arXiv 2508.10925,high)。

推理GPQA Diamond 71.5(无工具)/ 74.2(工具)、HLE 10.9 / 17.3(工具)(OpenAI 模型卡)。

数学AIME 2025 91.7(无工具)/ 98.7(工具)、AIME 2024 92.1 / 96.0(OpenAI 模型卡)。

知识MMLU 85.3、MMMLU 75.7、HealthBench 42.5(OpenAI 模型卡)。

Agenttau-bench Retail 54.8、Airline 38.0(OpenAI 模型卡)。

中文中文弱,MMMLU 75.7,不建议中文产品主力。

逻辑能力

考试型推理相对体量极强:AIME 2025 91.7(无工具)/ 98.7(工具)、AIME 2024 92.1、GPQA Diamond 71.5、Codeforces 2230(模型卡,high 档)。HLE 10.9 / 17.3(工具)显示前沿知识浅。工程型推理中等:SWE-bench Verified 60.7、tau-bench Retail 54.8 / Airline 38.0。reasoning 低档时推理链很短,分数明显下滑。

亮点
  1. 1.官方 MXFP4 13.8 GB,16GB 卡 / 笔记本可跑,仅 12 层全注意力 KV 24 KiB/token
  2. 2.AIME 2025 91.7(无工具)/ 98.7(工具)、GPQA 71.5,考试型推理远超体量
  3. 3.Apache-2.0,reasoning 三档可调,SWE-bench Verified 60.7
  1. 1.知识与中文弱(MMLU 85.3、MMMLU 75.7),HLE 无工具仅 10.9
  2. 2.幻觉率高,tau-bench Airline 38.0、Aider Polyglot 34.2,agent 稳定性一般
  3. 3.Harmony 格式要求严格,chat template 不对会明显掉分
适合:本地推理助手 · 边缘 STEM 推理
不适合:中文产品 · 知识问答
基准分数来源日期证据
LMArena Text Elo人类偏好 Elo1300LMArena Text (style control)2025-12-20独立复测
SWE-bench Verified真实仓库修 bug60.7%gpt-oss 模型卡2025-12-20厂商公布
GPQA Diamond研究生级科学问答71.5%gpt-oss 模型卡2025-12-20厂商公布
Humanity's Last Exam人类最后考试10.9%gpt-oss 模型卡2025-12-20厂商公布
AIME 2025美国数学邀请赛91.7%gpt-oss 模型卡2025-12-20厂商公布
Artificial Analysis Intelligence IndexAA 综合指数15Artificial Analysis (v4.1.1)2026-08-28独立复测
GPQA Diamond研究生级科学问答68.8%Artificial Analysis (v4.1.1)2026-08-28独立复测
Humanity's Last Exam人类最后考试11%Artificial Analysis (v4.1.1)2026-08-28独立复测
AIME 2025美国数学邀请赛89.3%Artificial Analysis (v4.1.1)2026-08-28独立复测
LiveCodeBench竞赛编程77.7%Artificial Analysis (v4.1.1)2026-08-28独立复测
SciCode科学计算编程34.4%Artificial Analysis (v4.1.1)2026-08-28独立复测
Terminal-Bench Hard终端 agent(AA 困难子集)10.6%Artificial Analysis (v4.1.1)2026-08-28独立复测
τ²-Bench Telecom工具调用 agent(电信域)60.2%Artificial Analysis (v4.1.1)2026-08-28独立复测
IFBench指令遵循65.1%Artificial Analysis (v4.1.1)2026-08-28独立复测
Terminal-Bench终端 agent13.9%Artificial Analysis · Terminal-Bench 2.12026-08-28独立复测
τ³-Bench Banking工具调用 agent(银行域)7%Artificial Analysis · τ³-Bench Banking2026-08-28独立复测
LMArena Chinese Elo中文人类偏好 Elo1350LMArena Text · Chinese (style control)2026-08-28独立复测

更新 2026-08-28 · 排名供选型参考,基准会饱和、会泄漏、会过时。