开源权重可下推理模型·可关单卡可跑已被替代可商用 · Apache-2.0
Alibaba logo

Qwen3-32B

通义千问 3 · 32B · Alibaba 阿里巴巴 · 发布 2025-04-29 · 已被替代Qwen3.8-27B

单卡 24GB 能跑的 Dense 全能型,混合思考可开关。

参数
32.8B
DENSE
上下文
128K
输出 32K
价格 / 1M tok
$0.10 / $0.30
第三方托管常见价(DeepI · 2025-12-20
最低可跑
RTX 3090
Q4_K_M · 23 GB · ≈29 tok/s
Arena Elo1360
2025-12-20
AA 综合指数
竞赛编程65.7
2025-12-20
GPQA 推理68.4
2025-12-20
类型
Dense
注意力
GQA(64 Q 头 / 8 KV 头)
层数
64
隐藏维
5120
词表
151,936

Dense 模型;原生 32K,YaRN 至 128K。混合思考:/think 与 /no_think 软开关。

类型:Dense Transformer,32.8B 参数(含 embedding),31.2B 非 embedding。

  • 64 层,隐藏维 5120,词表 151,936
  • GQA:64 Query 头 / 8 KV 头,head_dim 128;QK-Norm
  • 上下文:原生 32,768;YaRN factor 4 到 131,072
  • Tied embeddings:否

参考:Qwen3 技术报告。

Token Embedding词表 151,936× 64 层注意力:GQAKV 头 8 · head_dim 128Dense FFN隐藏维 5120Dense:每个 token 经过全部参数LM Head32.8B实线 = 已公开 · 虚线 = 未披露
精度权重大小说明
BF1666 GB官方精度
FP833 GB
Q835 GB
Q420 GBGGUF Q4_K_M 或等效
消费级 24GB
Q4_K_M 19.8 GB 可加载,留 ~4 GB 给 KV,约 8–16K 上下文
单卡 80GB
BF16 65.6 GB 单卡可跑,KV 余量约 14 GB
8×80GB 节点
过剩;用于高并发服务

KV Cache:8 KV 头 × 128 × 2 × 64 层 × 2 B = 256 KiB/token。32K 上下文 ≈ 8 GB。256 KiB/token

⚠ 能加载 ≠ 能在满上下文 / 高并发下舒服跑。标「估」的数字来自 计算器 公式或社区量化文件大小。

精度权重大小参考显存说明
BF1665.6 GB80GB 单卡官方 safetensors
FP8≈ 33 GB48GB官方 FP8 版
Q834.8 GB48GBGGUF Q8_0
Q419.8 GB24GBGGUF Q4_K_M

KV Cache:256 KiB/token(BF16)。

参考配置

  • RTX 4090 24GB:Q4_K_M,上下文 8–16K,单并发
  • A100/H100 80GB:BF16,32K 上下文,中等并发
  • 8×80GB:高并发服务
硬件配置与预估吞吐
最低可跑(8K 上下文)
RTX 3090 24GB
二手 ≈¥5,000 · 合计 ≈¥5,000 · 消费级
量化
Q4_K_M
解码
29 tok/s
最大上下文
12K
推荐配置(≥Q8 · 32K 上下文 · ≥15 tok/s)
2 × RTX 3090 24GB
二手 ≈¥5,000 × 2 · 合计 ≈¥10,000 · 消费级
量化
FP8
解码
28 tok/s
最大上下文
101K
配置量化占用 / 显存解码 tok/s预填充 tok/s最大上下文
2× RTX 4060 Ti 16GB消费级Q6_K31 GB / 32 GB1130213K
RTX 3090 24GB消费级Q4_K_M23 GB / 24 GB2948712K
2× RTX 4070 Ti Super 16GB消费级Q6_K31 GB / 32 GB2660413K
2× RTX 5070 Ti 16GB消费级Q6_K31 GB / 32 GB35120713K
2× RTX 4080 Super 16GB消费级Q6_K31 GB / 32 GB2971313K
2× RTX 5080 16GB消费级Q6_K31 GB / 32 GB37153713K
RTX 4090 24GB消费级Q4_K_M23 GB / 24 GB31113212K
RTX 5090 32GB消费级Q6_K29 GB / 32 GB41144118K
L4 24GB工作站Q4_K_M23 GB / 24 GB9.241212K
RTX A6000 48GB工作站FP835 GB / 48 GB15528110K
RTX 6000 Ada 48GB工作站FP835 GB / 48 GB18624110K
L40S 48GB工作站FP835 GB / 48 GB17624110K
RTX PRO 6000 Blackwell 96GB工作站BF1669 GB / 96 GB171715117K
A10 24GB数据中心Q4_K_M23 GB / 24 GB1842512K
A100 40GB数据中心FP835 GB / 40 GB30214046K
A100 80GB数据中心BF1669 GB / 80 GB20214053K
H20 96GB数据中心BF1669 GB / 96 GB38508117K
昇腾 Ascend 910B 64GB数据中心FP835 GB / 64 GB311921238K
H100 80GB PCIe数据中心BF1669 GB / 80 GB19518653K
H100 80GB SXM数据中心BF1669 GB / 80 GB32678453K
AMD MI300X 192GB数据中心BF1669 GB / 192 GB518966501K
H200 141GB数据中心BF1669 GB / 141 GB466784297K
B200 192GB数据中心BF1669 GB / 192 GB7715434501K
Mac M4 Pro 64GB统一内存FP835 GB / 56 GB4.0117174K
DGX Spark 128GB统一内存BF1669 GB / 120 GB2.0425213K
Mac M4 Max 128GB统一内存BF1669 GB / 120 GB4.0233213K
Mac Studio M3 Ultra 256GB统一内存BF1669 GB / 240 GB6.0391693K
Mac Studio M3 Ultra 512GB统一内存BF1669 GB / 490 GB6.03911.7M

单流(batch=1)估算:解码 ≈ 显存带宽 × 效率 ÷ 每 token 读取字节(激活参数 × 量化位宽 + KV);预填充 ≈ FP16 算力 × 0.45 ÷ (2 × 激活参数)。多卡按张量并行、带宽求和 × 0.55。实际受引擎、驱动、PCIe 影响,误差 ±30%。反向查:我的卡能跑谁 →

用计算器按你的上下文与并发估算 →

编程LiveCodeBench v5 ~65%(思考,官方);日常代码可用。

推理GPQA Diamond 68.4%(思考,官方)。

数学AIME 2025 72.9%(思考,官方)。

AgentBFCL-v3 70.3%(官方)。

中文中文顶级的 32B 档。

逻辑能力

开启思考后考试型推理接近 2025 年初的 o1 水平(AIME 2025 72.9%),关闭思考则退化为常规 32B 指令模型。Dense 结构让它在多轮对话与指令遵循上比 30B-A3B 更稳,但吞吐慢 3–4 倍。常见问题:思考模式对简单问题也会展开长链。

亮点
  1. 1.Q4 量化 19.8 GB,RTX 4090 / 3090 单卡可跑
  2. 2.同一权重 /think 与 /no_think 切换,无需两套模型
  3. 3.Apache-2.0,微调生态最完整的 30B 档之一
  1. 1.原生上下文 32K,128K 需 YaRN 且会略降短文本质量
  2. 2.24GB 卡上 Q4 只剩 ~4 GB 给 KV,长对话会 OOM
  3. 3.已被 2507 系列 MoE 小模型(30B-A3B)在多数榜上超过,但 Dense 仍更稳
适合:单卡本地部署 · 私有化微调底座 · 中英双语通用助手
不适合:高吞吐批量(用 30B-A3B) · 超长文档
基准分数来源日期证据
LMArena Text Elo人类偏好 Elo1360LMArena Text (style control)2025-12-20独立复测
LiveCodeBench竞赛编程65.7%Qwen3 技术报告2025-12-20厂商公布
GPQA Diamond研究生级科学问答68.4%Qwen3 技术报告2025-12-20厂商公布
AIME 2025美国数学邀请赛72.9%Qwen3 技术报告2025-12-20厂商公布

更新 2025-12-20 · 排名供选型参考,基准会饱和、会泄漏、会过时。