开源权重可下推理模型·可关已被替代可商用 · MIT

GLM-4.5-Air
智谱 GLM-4.5 Air · Z.ai 智谱 · 发布 2025-07-28 · 已被替代 → GLM-5.3-Flash
单卡 80GB 可跑的 agent 编程 MoE,MIT 许可。
参数
106B 总 / 12B 激活
MOE
上下文
128K
输出 94K
价格 / 1M tok
$0.20 / $1.10
Z.ai 开放平台 · 2025-12-20
最低可跑
4× RTX 3090
Q6_K · 91 GB · ≈185 tok/s
Arena Elo1380
2025-12-20
AA 综合指数—
真实仓库修 bug57.6
2025-12-20
GPQA 推理75
2025-12-20
架构简图
- 类型
- MoE
- 注意力
- GQA(96 Q / 8 KV)
- 层数
- 46
- 专家
- 128 · 激活 8 + 共享
- 隐藏维
- 4096
- 词表
- 未披露
完善中
| 精度 | 权重大小 | 说明 |
|---|---|---|
| BF16 | 220 GB估 | 官方精度 |
| FP8 | 110 GB估 | |
| Q8 | — | 暂无 |
| Q4 | 65 GB估 | GGUF Q4_K_M 或等效 |
- 消费级 24GB
- 未评估
- 单卡 80GB
- Q4 65 GB 单卡可跑
- 8×80GB 节点
- BF16
⚠ 能加载 ≠ 能在满上下文 / 高并发下舒服跑。标「估」的数字来自 计算器 公式或社区量化文件大小。
完善中
硬件配置与预估吞吐
最低可跑(8K 上下文)
4 × RTX 3090 24GB
二手 ≈¥5,000 × 4 · 合计 ≈¥20,000 · 消费级
量化
Q6_K
解码
185 tok/s
最大上下文
36K
推荐配置(≥Q8 · 32K 上下文 · ≥15 tok/s)
Mac M4 Max 128GB
≈¥35,000 · 合计 ≈¥35,000 · 统一内存
量化
FP8
解码
18 tok/s
最大上下文
98K
| 配置 | 量化 | 占用 / 显存 | 解码 tok/s | 预填充 tok/s | 最大上下文 |
|---|---|---|---|---|---|
| 4× RTX 3090 24GB消费级 | Q6_K估 | 91 GB / 96 GB | 185 | 5325 | 36K |
| 4× RTX 4090 24GB消费级 | Q6_K估 | 91 GB / 96 GB | 199 | 12375 | 36K |
| 4× RTX 5090 32GB消费级 | FP8 | 116 GB / 128 GB | 309 | 15750 | 147K |
| 4× L4 24GB工作站 | Q6_K估 | 91 GB / 96 GB | 59 | 4500 | 36K |
| 2× RTX A6000 48GB工作站 | Q6_K估 | 89 GB / 96 GB | 76 | 2888 | 49K |
| 2× RTX 6000 Ada 48GB工作站 | Q6_K估 | 89 GB / 96 GB | 95 | 3413 | 49K |
| 2× L40S 48GB工作站 | Q6_K估 | 89 GB / 96 GB | 85 | 3413 | 49K |
| RTX PRO 6000 Blackwell 96GB工作站 | Q6_K估 | 87 GB / 96 GB | 105 | 4688 | 56K |
| 4× A10 24GB数据中心 | Q6_K估 | 91 GB / 96 GB | 118 | 4650 | 36K |
| 2× A100 40GB数据中心 | Q5_K_M估 | 77 GB / 80 GB | 174 | 11700 | 25K |
| A100 80GB数据中心 | Q5_K_M估 | 76 GB / 80 GB | 135 | 5850 | 31K |
| H20 96GB数据中心 | Q6_K估 | 87 GB / 96 GB | 233 | 1388 | 56K |
| 2× 昇腾 Ascend 910B 64GB数据中心 | FP8 | 113 GB / 128 GB | 138 | 10500 | 174K |
| H100 80GB PCIe数据中心 | Q5_K_M估 | 76 GB / 80 GB | 132 | 14175 | 31K |
| H100 80GB SXM数据中心 | Q5_K_M估 | 76 GB / 80 GB | 222 | 18544 | 31K |
| AMD MI300X 192GB数据中心 | FP8 | 112 GB / 192 GB | 270 | 24506 | 899K |
| H200 141GB数据中心 | FP8 | 112 GB / 141 GB | 244 | 18544 | 332K |
| B200 192GB数据中心 | FP8 | 112 GB / 192 GB | 407 | 42188 | 899K |
| DGX Spark 128GB统一内存 | FP8 | 112 GB / 120 GB | 11 | 1163 | 98K |
| Mac M4 Max 128GB统一内存 | FP8 | 112 GB / 120 GB | 21 | 638 | 98K |
| Mac Studio M3 Ultra 256GB统一内存 | BF16 | 223 GB / 240 GB | 16 | 1069 | 105K |
| Mac Studio M3 Ultra 512GB统一内存 | BF16 | 223 GB / 490 GB | 16 | 1069 | 1.5M |
单流(batch=1)估算:解码 ≈ 显存带宽 × 效率 ÷ 每 token 读取字节(激活参数 × 量化位宽 + KV);预填充 ≈ FP16 算力 × 0.45 ÷ (2 × 激活参数)。多卡按张量并行、带宽求和 × 0.55。实际受引擎、驱动、PCIe 影响,误差 ±30%。反向查:我的卡能跑谁 →
完善中
逻辑能力
工程型推理为主,思考可开关;考试型中上。
亮点
- 1.Q4 约 65 GB,单卡 80GB 或 Mac 128GB 可跑
- 2.SWE-bench Verified 57.6%(官方)
- 3.MIT
坑
- 1.24GB 卡不可行
- 2.知识广度一般
- 3.GLM-4.6 未出 Air 版(截至数据日期)
适合:单卡 agent 编程服务
不适合:消费级 24GB
| 基准 | 分数 | 来源 | 日期 | 证据 |
|---|---|---|---|---|
| LMArena Text Elo人类偏好 Elo | 1380 | LMArena Text (style control) | 2025-12-20 | 独立复测 |
| SWE-bench Verified真实仓库修 bug | 57.6% | GLM-4.5 模型卡 | 2025-12-20 | 厂商公布 |
| GPQA Diamond研究生级科学问答 | 75% | GLM-4.5 模型卡 | 2025-12-20 | 厂商公布 |
| AIME 2025美国数学邀请赛 | 89.4% | GLM-4.5 模型卡 | 2025-12-20 | 厂商公布 |
| τ²-bench工具调用 agent | 68% | GLM-4.5 模型卡 | 2025-12-20 | 厂商公布 |
更新 2025-12-20 · 排名供选型参考,基准会饱和、会泄漏、会过时。