Qwen2.5-72B
通义千问 2.5 · 72B · Alibaba 阿里巴巴 · 发布 2024-09-19 · 已被替代 → Qwen3-235B-A22B-Thinking-2507
2024 下半年开源 Dense 王者,无数微调与蒸馏的底座。
- 类型
- Dense
- 注意力
- GQA(64 Q 头 / 8 KV 头)
- 层数
- 80
- 隐藏维
- 8192
- 词表
- 152,064
18T token 预训练;128K 上下文(YaRN),最大输出 8K;结构与 Qwen2-72B 相同。
类型:Dense Transformer,72.7B 参数(70.0B 非 embedding)。
- 80 层,隐藏维 8192,FFN 29,568,词表 152,064
- GQA:64 Query 头 / 8 KV 头,head_dim 128;QKV bias
- RoPE θ=1e6;原生 32K,YaRN factor 4 → 131,072
- 与 Qwen2-72B 结构相同,差异全在数据与训练
参考:Qwen2.5 技术报告(arXiv 2412.15115)。
| 精度 | 权重大小 | 说明 |
|---|---|---|
| BF16 | 145 GB | 官方精度 |
| FP8 | — | 暂无 |
| Q8 | 77 GB | |
| Q4 | 47 GB | GGUF Q4_K_M 或等效 |
- 消费级 24GB
- Q4_K_M 47.4 GB 需 2×24GB;单卡只能 IQ2 级
- 单卡 80GB
- Q4 / FP8 单卡 80GB 可跑 32K;BF16 2×80GB
- 8×80GB 节点
- BF16 高并发服务
KV Cache:8×128×2×80×2 B = 320 KiB/token;32K 上下文约 10 GB。 ≈ 320 KiB/token
⚠ 能加载 ≠ 能在满上下文 / 高并发下舒服跑。标「估」的数字来自 计算器 公式或社区量化文件大小。
| 精度 | 权重大小 | 参考硬件 | 说明 |
|---|---|---|---|
| BF16 | 145.4 GB | 2×80GB | 官方 safetensors |
| Q8 | ≈ 77 GB | 80GB 单卡 | GGUF Q8_0 |
| Q4 | 47.4 GB | 2×24GB / 80GB | GGUF Q4_K_M(官方 + bartowski) |
| AWQ/GPTQ int4 | ≈ 41 GB | 48GB | 官方量化版 |
KV Cache:320 KiB/token(BF16)。
参考配置:
- 2×RTX 4090:Q4_K_M 拆分,上下文 8–16K
- A100/H100 80GB:官方 AWQ / FP8,32K 上下文
- 2×80GB:BF16
| 配置 | 量化 | 占用 / 显存 | 解码 tok/s | 预填充 tok/s | 最大上下文 |
|---|---|---|---|---|---|
| 4× RTX 3090 24GB消费级 | FP8估 | 79 GB / 96 GB | 28 | 879 | 118K |
| 4× RTX 4090 24GB消费级 | FP8估 | 79 GB / 96 GB | 30 | 2043 | 118K |
| 2× RTX 5090 32GB消费级 | Q6_K估 | 63 GB / 64 GB | 32 | 1300 | 11K |
| 4× L4 24GB工作站 | FP8估 | 79 GB / 96 GB | 8.9 | 743 | 118K |
| 2× RTX A6000 48GB工作站 | FP8估 | 76 GB / 96 GB | 11 | 477 | 134K |
| 2× RTX 6000 Ada 48GB工作站 | FP8估 | 76 GB / 96 GB | 14 | 563 | 134K |
| 2× L40S 48GB工作站 | FP8估 | 76 GB / 96 GB | 13 | 563 | 134K |
| RTX PRO 6000 Blackwell 96GB工作站 | FP8估 | 75 GB / 96 GB | 16 | 774 | 141K |
| 4× A10 24GB数据中心 | FP8估 | 79 GB / 96 GB | 18 | 768 | 118K |
| 2× A100 40GB数据中心 | FP8估 | 76 GB / 80 GB | 23 | 1931 | 31K |
| A100 80GB数据中心 | FP8估 | 75 GB / 80 GB | 18 | 966 | 39K |
| H20 96GB数据中心 | FP8估 | 75 GB / 96 GB | 35 | 229 | 141K |
| 昇腾 Ascend 910B 64GB数据中心 | Q6_K估 | 62 GB / 64 GB | 17 | 867 | 15K |
| H100 80GB PCIe数据中心 | FP8估 | 75 GB / 80 GB | 18 | 2340 | 39K |
| H100 80GB SXM数据中心 | FP8估 | 75 GB / 80 GB | 29 | 3061 | 39K |
| AMD MI300X 192GB数据中心 | BF16 | 149 GB / 192 GB | 23 | 4045 | 145K |
| H200 141GB数据中心 | FP8估 | 75 GB / 141 GB | 42 | 3061 | 429K |
| B200 192GB数据中心 | BF16 | 149 GB / 192 GB | 35 | 6964 | 145K |
| Mac M4 Pro 64GB统一内存 | Q5_K_M估 | 54 GB / 56 GB | 2.6 | 53 | 15K |
| DGX Spark 128GB统一内存 | FP8估 | 75 GB / 120 GB | 1.8 | 192 | 295K |
| Mac M4 Max 128GB统一内存 | FP8估 | 75 GB / 120 GB | 3.7 | 105 | 295K |
| Mac Studio M3 Ultra 256GB统一内存 | BF16 | 149 GB / 240 GB | 2.8 | 176 | 299K |
| Mac Studio M3 Ultra 512GB统一内存 | BF16 | 149 GB / 490 GB | 2.8 | 176 | 1.1M |
单流(batch=1)估算:解码 ≈ 显存带宽 × 效率 ÷ 每 token 读取字节(激活参数 × 量化位宽 + KV);预填充 ≈ FP16 算力 × 0.45 ÷ (2 × 激活参数)。多卡按张量并行、带宽求和 × 0.55。实际受引擎、驱动、PCIe 影响,误差 ±30%。反向查:我的卡能跑谁 →
编程LiveCodeBench 55.5%、HumanEval 86.6%(官方)。
推理GPQA 49.0%(官方)。
数学MATH 83.1%(官方)。
知识MMLU-Pro 71.1%(官方)。
Agent工具调用 Hermes 格式,Qwen-Agent 支持。
中文中文顶级,长期作为中文开源基准。
非推理模型顶级:MATH 83.1%、GPQA 49.0%、LiveCodeBench 55.5%、MMLU-Pro 71.1%(官方)。逻辑清晰、指令遵循极稳,多轮与结构化输出可靠;但没有内在的长思考能力,竞赛题会自信地给错答案。
- 1.发布时综合超越 Llama 3.1 405B(官方多项基准)
- 2.18T token 预训练,数学 / 代码专项数据注入
- 3.DeepSeek-R1 蒸馏、大量学术工作的默认底座
- 1.72B 用 Qwen License(1 亿月活限制),32B 及以下才是 Apache
- 2.无思考模式,2025 年推理榜落后于 Qwen3 / R1
- 3.最大输出仅 8K,长生成需改配置
| 基准 | 分数 | 来源 | 日期 | 证据 |
|---|---|---|---|---|
| LiveCodeBench竞赛编程 | 55.5% | Qwen2.5 技术报告表6(LiveCodeBench 2305-2409;GPQA 未标注 Diamond) | 2024-09-19 | 厂商公布 |
| GPQA Diamond研究生级科学问答 | 49% | Qwen2.5 技术报告表6(LiveCodeBench 2305-2409;GPQA 未标注 Diamond) | 2024-09-19 | 厂商公布 |
更新 2026-08-28 · 排名供选型参考,基准会饱和、会泄漏、会过时。