开源权重可下已被替代限制许可 · Tongyi Qianwen License
Qwen1.5-72B
通义千问 1.5 · 72B · Alibaba 阿里巴巴 · 发布 2024-02-05 · 已被替代 → Qwen2.5-72B
Qwen 系列进入 HF 主线的第一代 72B,中文开源当年最强。
参数
72.3B
DENSE
上下文
32K
价格 / 1M tok
自建
无官方 API
最低可跑
4× RTX 3090
FP8 · 87 GB · ≈25 tok/s
Arena Elo—
AA 综合指数—
代码—
GPQA 推理—
架构简图
- 类型
- Dense
- 注意力
- MHA(64 头,无 GQA)
- 层数
- 80
- 隐藏维
- 8192
- 词表
- 152,064
仍用 MHA,KV 缓存极大;上下文 32K;首个并入 HF transformers 的 Qwen 版本。
完善中
| 精度 | 权重大小 | 说明 |
|---|---|---|
| BF16 | 145 GB | 官方精度 |
| FP8 | — | 暂无 |
| Q8 | 77 GB | |
| Q4 | 44 GB | GGUF Q4_K_M 或等效 |
- 消费级 24GB
- 不可行
- 单卡 80GB
- Q4 权重可放,但 KV 巨大只能短上下文
- 8×80GB 节点
- BF16 + 长上下文
KV Cache:MHA:64×128×2×80×2 B = 2.5 MiB/token,32K 上下文要 80 GB KV! ≈ 2560 KiB/token
⚠ 能加载 ≠ 能在满上下文 / 高并发下舒服跑。标「估」的数字来自 计算器 公式或社区量化文件大小。
完善中
硬件配置与预估吞吐
最低可跑(8K 上下文)
4 × RTX 3090 24GB
二手 ≈¥5,000 × 4 · 合计 ≈¥20,000 · 消费级
量化
FP8
解码
25 tok/s
最大上下文
15K
推荐配置(≥Q8 · 32K 上下文 · ≥15 tok/s)
4 × RTX 5090 32GB
≈¥16,000 × 4 · 合计 ≈¥64,000 · 消费级
量化
FP8
解码
34 tok/s
最大上下文
41K
| 配置 | 量化 | 占用 / 显存 | 解码 tok/s | 预填充 tok/s | 最大上下文 |
|---|---|---|---|---|---|
| 4× RTX 3090 24GB消费级 | FP8估 | 87 GB / 96 GB | 25 | 884 | 15K |
| 4× RTX 4090 24GB消费级 | FP8估 | 87 GB / 96 GB | 27 | 2054 | 15K |
| 4× RTX 5090 32GB消费级 | FP8估 | 87 GB / 128 GB | 47 | 2614 | 41K |
| 4× L4 24GB工作站 | FP8估 | 87 GB / 96 GB | 7.9 | 747 | 15K |
| 2× RTX A6000 48GB工作站 | FP8估 | 85 GB / 96 GB | 10 | 479 | 17K |
| 2× RTX 6000 Ada 48GB工作站 | FP8估 | 85 GB / 96 GB | 13 | 566 | 17K |
| 2× L40S 48GB工作站 | FP8估 | 85 GB / 96 GB | 11 | 566 | 17K |
| RTX PRO 6000 Blackwell 96GB工作站 | FP8估 | 84 GB / 96 GB | 14 | 778 | 18K |
| 4× A10 24GB数据中心 | FP8估 | 87 GB / 96 GB | 16 | 772 | 15K |
| 2× A100 40GB数据中心 | Q5_K_M估 | 72 GB / 80 GB | 24 | 1942 | 11K |
| A100 80GB数据中心 | Q6_K估 | 79 GB / 80 GB | 17 | 971 | 8K |
| H20 96GB数据中心 | FP8估 | 84 GB / 96 GB | 31 | 230 | 18K |
| 2× 昇腾 Ascend 910B 64GB数据中心 | FP8估 | 85 GB / 128 GB | 21 | 1743 | 43K |
| H100 80GB PCIe数据中心 | Q6_K估 | 79 GB / 80 GB | 16 | 2353 | 8K |
| H100 80GB SXM数据中心 | Q6_K估 | 79 GB / 80 GB | 27 | 3078 | 8K |
| AMD MI300X 192GB数据中心 | BF16 | 166 GB / 192 GB | 21 | 4067 | 18K |
| H200 141GB数据中心 | FP8估 | 84 GB / 141 GB | 38 | 3078 | 54K |
| B200 192GB数据中心 | BF16 | 166 GB / 192 GB | 31 | 7002 | 18K |
| DGX Spark 128GB统一内存 | FP8估 | 84 GB / 120 GB | 1.6 | 193 | 37K |
| Mac M4 Max 128GB统一内存 | FP8估 | 84 GB / 120 GB | 3.3 | 106 | 37K |
| Mac Studio M3 Ultra 256GB统一内存 | BF16 | 166 GB / 240 GB | 2.5 | 177 | 38K |
| Mac Studio M3 Ultra 512GB统一内存 | BF16 | 166 GB / 490 GB | 2.5 | 177 | 138K |
单流(batch=1)估算:解码 ≈ 显存带宽 × 效率 ÷ 每 token 读取字节(激活参数 × 量化位宽 + KV);预填充 ≈ FP16 算力 × 0.45 ÷ (2 × 激活参数)。多卡按张量并行、带宽求和 × 0.55。实际受引擎、驱动、PCIe 影响,误差 ±30%。反向查:我的卡能跑谁 →
可用维度不足 3 个,不绘制雷达图
数学GSM8K 79.5%(官方)。
知识MMLU 77.5%(官方)。
中文C-Eval 84.1%(官方),当年中文开源最强。
逻辑能力
2024 年初开源一线:MMLU 77.5%、GSM8K 79.5%(官方基座)。无 CoT 训练,复杂推理弱。
亮点
- 1.2024 年初中文开源综合第一,Arena 开源前列
- 2.全尺寸(0.5B–72B)统一模板,生态起步
- 3.32K 上下文,词表 152K 中文效率高
坑
- 1.MHA 无 GQA,KV 每 token 2.5 MiB,长文本显存爆炸
- 2.自有许可,月活 1 亿以上需授权
- 3.Qwen2 起改用 GQA 且更强,无理由再用 1.5
适合:历史对照
不适合:长上下文 · 新项目
暂无带来源的分数。
更新 2026-08-28 · 排名供选型参考,基准会饱和、会泄漏、会过时。