开源权重可下已被替代限制许可 · Qwen License
Alibaba logo

Qwen2.5-72B

通义千问 2.5 · 72B · Alibaba 阿里巴巴 · 发布 2024-09-19 · 已被替代Qwen3-235B-A22B-Thinking-2507

2024 下半年开源 Dense 王者,无数微调与蒸馏的底座。

参数
72.7B
DENSE
上下文
128K
输出 8K
价格 / 1M tok
$0.13 / $0.40
第三方托管常见价(DeepI · 2026-08-28
最低可跑
4× RTX 3090
FP8 · 79 GB · ≈28 tok/s
Arena Elo
AA 综合指数
竞赛编程55.5
2024-09-19
GPQA 推理49
2024-09-19
类型
Dense
注意力
GQA(64 Q 头 / 8 KV 头)
层数
80
隐藏维
8192
词表
152,064

18T token 预训练;128K 上下文(YaRN),最大输出 8K;结构与 Qwen2-72B 相同。

类型:Dense Transformer,72.7B 参数(70.0B 非 embedding)。

  • 80 层,隐藏维 8192,FFN 29,568,词表 152,064
  • GQA:64 Query 头 / 8 KV 头,head_dim 128;QKV bias
  • RoPE θ=1e6;原生 32K,YaRN factor 4 → 131,072
  • 与 Qwen2-72B 结构相同,差异全在数据与训练

参考:Qwen2.5 技术报告(arXiv 2412.15115)。

Token Embedding词表 152,064× 80 层注意力:GQAKV 头 8 · head_dim 128Dense FFN隐藏维 8192Dense:每个 token 经过全部参数LM Head72.7B实线 = 已公开 · 虚线 = 未披露
精度权重大小说明
BF16145 GB官方精度
FP8暂无
Q877 GB
Q447 GBGGUF Q4_K_M 或等效
消费级 24GB
Q4_K_M 47.4 GB 需 2×24GB;单卡只能 IQ2 级
单卡 80GB
Q4 / FP8 单卡 80GB 可跑 32K;BF16 2×80GB
8×80GB 节点
BF16 高并发服务

KV Cache:8×128×2×80×2 B = 320 KiB/token;32K 上下文约 10 GB。320 KiB/token

⚠ 能加载 ≠ 能在满上下文 / 高并发下舒服跑。标「估」的数字来自 计算器 公式或社区量化文件大小。

精度权重大小参考硬件说明
BF16145.4 GB2×80GB官方 safetensors
Q8≈ 77 GB80GB 单卡GGUF Q8_0
Q447.4 GB2×24GB / 80GBGGUF Q4_K_M(官方 + bartowski)
AWQ/GPTQ int4≈ 41 GB48GB官方量化版

KV Cache:320 KiB/token(BF16)。

参考配置

  • 2×RTX 4090:Q4_K_M 拆分,上下文 8–16K
  • A100/H100 80GB:官方 AWQ / FP8,32K 上下文
  • 2×80GB:BF16
硬件配置与预估吞吐
最低可跑(8K 上下文)
4 × RTX 3090 24GB
二手 ≈¥5,000 × 4 · 合计 ≈¥20,000 · 消费级
量化
FP8
解码
28 tok/s
最大上下文
118K
推荐配置(≥Q8 · 32K 上下文 · ≥15 tok/s)
4 × RTX 3090 24GB
二手 ≈¥5,000 × 4 · 合计 ≈¥20,000 · 消费级
量化
FP8
解码
26 tok/s
最大上下文
118K
配置量化占用 / 显存解码 tok/s预填充 tok/s最大上下文
4× RTX 3090 24GB消费级FP879 GB / 96 GB28879118K
4× RTX 4090 24GB消费级FP879 GB / 96 GB302043118K
2× RTX 5090 32GB消费级Q6_K63 GB / 64 GB32130011K
4× L4 24GB工作站FP879 GB / 96 GB8.9743118K
2× RTX A6000 48GB工作站FP876 GB / 96 GB11477134K
2× RTX 6000 Ada 48GB工作站FP876 GB / 96 GB14563134K
2× L40S 48GB工作站FP876 GB / 96 GB13563134K
RTX PRO 6000 Blackwell 96GB工作站FP875 GB / 96 GB16774141K
4× A10 24GB数据中心FP879 GB / 96 GB18768118K
2× A100 40GB数据中心FP876 GB / 80 GB23193131K
A100 80GB数据中心FP875 GB / 80 GB1896639K
H20 96GB数据中心FP875 GB / 96 GB35229141K
昇腾 Ascend 910B 64GB数据中心Q6_K62 GB / 64 GB1786715K
H100 80GB PCIe数据中心FP875 GB / 80 GB18234039K
H100 80GB SXM数据中心FP875 GB / 80 GB29306139K
AMD MI300X 192GB数据中心BF16149 GB / 192 GB234045145K
H200 141GB数据中心FP875 GB / 141 GB423061429K
B200 192GB数据中心BF16149 GB / 192 GB356964145K
Mac M4 Pro 64GB统一内存Q5_K_M54 GB / 56 GB2.65315K
DGX Spark 128GB统一内存FP875 GB / 120 GB1.8192295K
Mac M4 Max 128GB统一内存FP875 GB / 120 GB3.7105295K
Mac Studio M3 Ultra 256GB统一内存BF16149 GB / 240 GB2.8176299K
Mac Studio M3 Ultra 512GB统一内存BF16149 GB / 490 GB2.81761.1M

单流(batch=1)估算:解码 ≈ 显存带宽 × 效率 ÷ 每 token 读取字节(激活参数 × 量化位宽 + KV);预填充 ≈ FP16 算力 × 0.45 ÷ (2 × 激活参数)。多卡按张量并行、带宽求和 × 0.55。实际受引擎、驱动、PCIe 影响,误差 ±30%。反向查:我的卡能跑谁 →

用计算器按你的上下文与并发估算 →
可用维度不足 3 个,不绘制雷达图

编程LiveCodeBench 55.5%、HumanEval 86.6%(官方)。

推理GPQA 49.0%(官方)。

数学MATH 83.1%(官方)。

知识MMLU-Pro 71.1%(官方)。

Agent工具调用 Hermes 格式,Qwen-Agent 支持。

中文中文顶级,长期作为中文开源基准。

逻辑能力

非推理模型顶级:MATH 83.1%、GPQA 49.0%、LiveCodeBench 55.5%、MMLU-Pro 71.1%(官方)。逻辑清晰、指令遵循极稳,多轮与结构化输出可靠;但没有内在的长思考能力,竞赛题会自信地给错答案。

亮点
  1. 1.发布时综合超越 Llama 3.1 405B(官方多项基准)
  2. 2.18T token 预训练,数学 / 代码专项数据注入
  3. 3.DeepSeek-R1 蒸馏、大量学术工作的默认底座
  1. 1.72B 用 Qwen License(1 亿月活限制),32B 及以下才是 Apache
  2. 2.无思考模式,2025 年推理榜落后于 Qwen3 / R1
  3. 3.最大输出仅 8K,长生成需改配置
适合:中英双语通用私有化 · 微调 / 蒸馏底座 · 结构化输出与工具调用
不适合:竞赛数学 / 深度代码 agent · 单张 24GB 卡
基准分数来源日期证据
LiveCodeBench竞赛编程55.5%Qwen2.5 技术报告表6(LiveCodeBench 2305-2409;GPQA 未标注 Diamond)2024-09-19厂商公布
GPQA Diamond研究生级科学问答49%Qwen2.5 技术报告表6(LiveCodeBench 2305-2409;GPQA 未标注 Diamond)2024-09-19厂商公布

更新 2026-08-28 · 排名供选型参考,基准会饱和、会泄漏、会过时。