开源权重可下已被替代限制许可 · Tongyi Qianwen License
Qwen2-72B
通义千问 2 · 72B · Alibaba 阿里巴巴 · 发布 2024-06-06 · 已被替代 → Qwen2.5-72B
2024 年中期开源榜首之一,Qwen 全面转 GQA + 128K。
参数
72.7B
DENSE
上下文
128K
价格 / 1M tok
自建
无官方 API
最低可跑
4× RTX 3090
FP8 · 79 GB · ≈28 tok/s
Arena Elo—
AA 综合指数—
代码—
GPQA 推理—
架构简图
- 类型
- Dense
- 注意力
- GQA(64 Q 头 / 8 KV 头)
- 层数
- 80
- 隐藏维
- 8192
- 词表
- 152,064
Qwen 首次全系 GQA;上下文 128K(YaRN);27 语言。
完善中
| 精度 | 权重大小 | 说明 |
|---|---|---|
| BF16 | 145 GB | 官方精度 |
| FP8 | — | 暂无 |
| Q8 | 77 GB | |
| Q4 | 47 GB | GGUF Q4_K_M 或等效 |
- 消费级 24GB
- Q4_K_M 47.4 GB 需 2×24GB
- 单卡 80GB
- Q4 单卡 80GB;BF16 2×80GB
- 8×80GB 节点
- BF16 高并发
KV Cache:320 KiB/token。 ≈ 320 KiB/token
⚠ 能加载 ≠ 能在满上下文 / 高并发下舒服跑。标「估」的数字来自 计算器 公式或社区量化文件大小。
完善中
硬件配置与预估吞吐
最低可跑(8K 上下文)
4 × RTX 3090 24GB
二手 ≈¥5,000 × 4 · 合计 ≈¥20,000 · 消费级
量化
FP8
解码
28 tok/s
最大上下文
118K
推荐配置(≥Q8 · 32K 上下文 · ≥15 tok/s)
4 × RTX 3090 24GB
二手 ≈¥5,000 × 4 · 合计 ≈¥20,000 · 消费级
量化
FP8
解码
26 tok/s
最大上下文
118K
| 配置 | 量化 | 占用 / 显存 | 解码 tok/s | 预填充 tok/s | 最大上下文 |
|---|---|---|---|---|---|
| 4× RTX 3090 24GB消费级 | FP8估 | 79 GB / 96 GB | 28 | 879 | 118K |
| 4× RTX 4090 24GB消费级 | FP8估 | 79 GB / 96 GB | 30 | 2043 | 118K |
| 2× RTX 5090 32GB消费级 | Q6_K估 | 63 GB / 64 GB | 32 | 1300 | 11K |
| 4× L4 24GB工作站 | FP8估 | 79 GB / 96 GB | 8.9 | 743 | 118K |
| 2× RTX A6000 48GB工作站 | FP8估 | 76 GB / 96 GB | 11 | 477 | 134K |
| 2× RTX 6000 Ada 48GB工作站 | FP8估 | 76 GB / 96 GB | 14 | 563 | 134K |
| 2× L40S 48GB工作站 | FP8估 | 76 GB / 96 GB | 13 | 563 | 134K |
| RTX PRO 6000 Blackwell 96GB工作站 | FP8估 | 75 GB / 96 GB | 16 | 774 | 141K |
| 4× A10 24GB数据中心 | FP8估 | 79 GB / 96 GB | 18 | 768 | 118K |
| 2× A100 40GB数据中心 | FP8估 | 76 GB / 80 GB | 23 | 1931 | 31K |
| A100 80GB数据中心 | FP8估 | 75 GB / 80 GB | 18 | 966 | 39K |
| H20 96GB数据中心 | FP8估 | 75 GB / 96 GB | 35 | 229 | 141K |
| 昇腾 Ascend 910B 64GB数据中心 | Q6_K估 | 62 GB / 64 GB | 17 | 867 | 15K |
| H100 80GB PCIe数据中心 | FP8估 | 75 GB / 80 GB | 18 | 2340 | 39K |
| H100 80GB SXM数据中心 | FP8估 | 75 GB / 80 GB | 29 | 3061 | 39K |
| AMD MI300X 192GB数据中心 | BF16 | 149 GB / 192 GB | 23 | 4045 | 145K |
| H200 141GB数据中心 | FP8估 | 75 GB / 141 GB | 42 | 3061 | 429K |
| B200 192GB数据中心 | BF16 | 149 GB / 192 GB | 35 | 6964 | 145K |
| Mac M4 Pro 64GB统一内存 | Q5_K_M估 | 54 GB / 56 GB | 2.6 | 53 | 15K |
| DGX Spark 128GB统一内存 | FP8估 | 75 GB / 120 GB | 1.8 | 192 | 295K |
| Mac M4 Max 128GB统一内存 | FP8估 | 75 GB / 120 GB | 3.7 | 105 | 295K |
| Mac Studio M3 Ultra 256GB统一内存 | BF16 | 149 GB / 240 GB | 2.8 | 176 | 299K |
| Mac Studio M3 Ultra 512GB统一内存 | BF16 | 149 GB / 490 GB | 2.8 | 176 | 1.1M |
单流(batch=1)估算:解码 ≈ 显存带宽 × 效率 ÷ 每 token 读取字节(激活参数 × 量化位宽 + KV);预填充 ≈ FP16 算力 × 0.45 ÷ (2 × 激活参数)。多卡按张量并行、带宽求和 × 0.55。实际受引擎、驱动、PCIe 影响,误差 ±30%。反向查:我的卡能跑谁 →
可用维度不足 3 个,不绘制雷达图
编程HumanEval 86.0%(官方 Instruct)。
数学MATH 59.7%(官方 Instruct)。
知识MMLU 82.3%(官方基座)。
中文C-Eval 91.0%(官方)。
逻辑能力
非推理模型一线:MMLU 82.3%(基座)、MATH 59.7%、HumanEval 86.0%(Instruct,官方)。
亮点
- 1.发布时 Open LLM Leaderboard 第一,超过 Llama 3 70B
- 2.128K 上下文,Needle 测试全绿
- 3.72B 仍保留自有许可,其余尺寸 Apache-2.0
坑
- 1.72B 许可非 Apache(1 亿月活限制)
- 2.无推理模式,代码与数学被 2.5 大幅刷新
- 3.官方 3 个月后即被 Qwen2.5 取代
适合:历史对照 / 已有部署
不适合:新项目(直接用 2.5 / 3)
暂无带来源的分数。
更新 2026-08-28 · 排名供选型参考,基准会饱和、会泄漏、会过时。