开源权重可下推理模型·可关单卡可跑已被替代可商用 · Apache-2.0
Alibaba logo

Qwen3-8B

通义千问 3 · 8B · Alibaba 阿里巴巴 · 发布 2025-04-29 · 已被替代Qwen3.8-27B

8B 里带思考模式的全能选手,本地部署首选之一。

参数
8.2B
DENSE
上下文
128K
输出 32K
价格 / 1M tok
$0.04 / $0.14
第三方托管常见价(DeepI · 2026-08-28
最低可跑
RTX 3060
FP8 · 10.0 GB · ≈27 tok/s
Arena Elo
AA 综合指数
竞赛编程57.5
2025-05-14
GPQA 推理62
2025-05-14
类型
Dense
注意力
GQA(32 Q 头 / 8 KV 头)+ QK-Norm
层数
36
隐藏维
4096
词表
151,936

混合思考;原生 32K,YaRN 至 128K。

完善中

Token Embedding词表 151,936× 36 层注意力:GQAKV 头 8 · head_dim 128Dense FFN隐藏维 4096Dense:每个 token 经过全部参数LM Head8.2B实线 = 已公开 · 虚线 = 未披露
精度权重大小说明
BF1616 GB官方精度
FP88.2 GB
Q88.7 GB
Q45.0 GBGGUF Q4_K_M 或等效
消费级 24GB
BF16 16.4 GB 单卡可跑 32K;Q4 5 GB 留大量 KV
单卡 80GB
高并发
8×80GB 节点
过剩

KV Cache:144 KiB/token。144 KiB/token

⚠ 能加载 ≠ 能在满上下文 / 高并发下舒服跑。标「估」的数字来自 计算器 公式或社区量化文件大小。

完善中

硬件配置与预估吞吐
最低可跑(8K 上下文)
RTX 3060 12GB
≈¥2,000 · 合计 ≈¥2,000 · 消费级
量化
FP8
解码
27 tok/s
最大上下文
37K
推荐配置(≥Q8 · 32K 上下文 · ≥15 tok/s)
RTX 3060 12GB
≈¥2,000 · 合计 ≈¥2,000 · 消费级
量化
FP8
解码
22 tok/s
最大上下文
37K
配置量化占用 / 显存解码 tok/s预填充 tok/s最大上下文
RTX 3060 12GB消费级FP810.0 GB / 12 GB2768637K
RTX 4060 Ti 16GB消费级FP810.0 GB / 16 GB2160494K
RTX 3090 24GB消费级BF1619 GB / 24 GB35194846K
RTX 4070 Ti Super 16GB消费级FP810.0 GB / 16 GB50120794K
RTX 5070 Ti 16GB消费级FP810.0 GB / 16 GB66241594K
RTX 4080 Super 16GB消费级FP810.0 GB / 16 GB54142794K
RTX 5080 16GB消费级FP810.0 GB / 16 GB71307394K
RTX 4090 24GB消费级BF1619 GB / 24 GB37452746K
RTX 5090 32GB消费级BF1619 GB / 32 GB665762102K
L4 24GB工作站BF1619 GB / 24 GB11164646K
RTX A6000 48GB工作站BF1619 GB / 48 GB282113216K
RTX 6000 Ada 48GB工作站BF1619 GB / 48 GB352497216K
L40S 48GB工作站BF1619 GB / 48 GB322497216K
RTX PRO 6000 Blackwell 96GB工作站BF1619 GB / 96 GB666860558K
A10 24GB数据中心BF1619 GB / 24 GB22170146K
A100 40GB数据中心BF1619 GB / 40 GB578561159K
A100 80GB数据中心BF1619 GB / 80 GB758561444K
H20 96GB数据中心BF1619 GB / 96 GB1482030558K
昇腾 Ascend 910B 64GB数据中心BF1619 GB / 64 GB597683330K
H100 80GB PCIe数据中心BF1619 GB / 80 GB7420744444K
H100 80GB SXM数据中心BF1619 GB / 80 GB12427137444K
AMD MI300X 192GB数据中心BF1619 GB / 192 GB196358631.2M
H200 141GB数据中心BF1619 GB / 141 GB17727137878K
B200 192GB数据中心BF1619 GB / 192 GB295617381.2M
Mac M4 Pro 64GB统一内存BF1619 GB / 56 GB7.8466273K
DGX Spark 128GB统一内存BF1619 GB / 120 GB7.81701728K
Mac M4 Max 128GB统一内存BF1619 GB / 120 GB16933728K
Mac Studio M3 Ultra 256GB统一内存BF1619 GB / 240 GB2315641.5M
Mac Studio M3 Ultra 512GB统一内存BF1619 GB / 490 GB2315643.3M

单流(batch=1)估算:解码 ≈ 显存带宽 × 效率 ÷ 每 token 读取字节(激活参数 × 量化位宽 + KV);预填充 ≈ FP16 算力 × 0.45 ÷ (2 × 激活参数)。多卡按张量并行、带宽求和 × 0.55。实际受引擎、驱动、PCIe 影响,误差 ±30%。反向查:我的卡能跑谁 →

用计算器按你的上下文与并发估算 →

编程LiveCodeBench v5 57.5%(思考,技术报告)。

推理GPQA Diamond 62.0%(思考,技术报告)。

数学AIME 2025 67.3%(思考,技术报告)。

中文中文好。

逻辑能力

思考模式:AIME 2025 67.3%、GPQA 62.0%、LiveCodeBench v5 57.5%(Qwen3 技术报告)。8B 中推理最强档,但知识型任务仍受限。

亮点
  1. 1.思考模式下数学 / 代码超过 Qwen2.5-14B 乃至部分 32B
  2. 2.Apache-2.0,消费卡 BF16 直接跑
  3. 3.119 语言,工具调用与 MCP 生态完善
  1. 1.思考链长,8B 吞吐优势被抵消
  2. 2.原生 32K,128K 需 YaRN 且质量下降
  3. 3.知识量受尺寸限制,幻觉多
适合:本地 / 边缘推理助手 · 微调底座
不适合:知识密集问答 · 高并发低延迟
基准分数来源日期证据
LiveCodeBench竞赛编程57.5%Qwen3 技术报告表17(思考模式,LiveCodeBench v5)2025-05-14厂商公布
GPQA Diamond研究生级科学问答62%Qwen3 技术报告表17(思考模式,LiveCodeBench v5)2025-05-14厂商公布
AIME 2025美国数学邀请赛67.3%Qwen3 技术报告表17(思考模式,LiveCodeBench v5)2025-05-14厂商公布

更新 2026-08-28 · 排名供选型参考,基准会饱和、会泄漏、会过时。