
GLM-5.2
智谱 GLM-5.2 · Z.ai 智谱 · 发布 2026-06-16 · 当前代
MIT 许可、1M 上下文的 744B 开源编程旗舰。
- 类型
- MoE
- 注意力
- MLA + DSA 稀疏注意力(64 头,IndexShare 索引器)
- 层数
- 78
- 专家
- 256 · 激活 8 + 共享
- 隐藏维
- 6144
- 词表
- 154,880
官方 GitHub 标注 744B-A40B(HF 自动计数 753B 含 MTP 层)。MLA:kv_lora_rank 512 + RoPE 64,每层 KV 潜向量 576 维,这里按「1 KV 头 × 288」等价表示。DSA 稀疏注意力每 token 只取 top-2048 索引;IndexShare 让每 4 层共用一个索引器。前 3 层 Dense MLP,其余 256 路由专家 + 1 共享,MoE 中间维 2048;含 1 层 MTP。
类型:MoE,744B 总 / 40B 激活(HF 计数 753B 含 MTP)。
- 78 层(前 3 层 Dense MLP)+ 1 层 MTP,隐藏维 6144,词表 154,880
- 专家:256 路由 + 1 共享,每 token 激活 8 个,MoE 中间维 2048,sigmoid 路由(noaux_tc)
- 注意力:MLA,64 头,q_lora 2048 / kv_lora 512,qk_nope 192 + RoPE 64,v_head 256
- DSA 稀疏注意力:每 token 通过 32 头索引器选 top-2048 位置;IndexShare 让每 4 层共用 1 个索引器(full/shared 交替),1M 上下文下每 token FLOPs 降 2.9×
- 上下文 1,048,576,RoPE theta 8e6
- MTP 层改进后投机解码接受长度提升最多 20%
参考:GLM-5 技术报告(arXiv 2602.15763)、IndexShare(arXiv 2603.12201)。
| 精度 | 权重大小 | 说明 |
|---|---|---|
| BF16 | 1507 GB估 | 官方精度 |
| FP8 | 753 GB估 | |
| Q8 | 801 GB估 | |
| Q4 | 432 GB估 | GGUF Q4_K_M 或等效 |
- 消费级 24GB
- 不可行
- 单卡 80GB
- 不可行
- 8×80GB 节点
- BF16 1.5 TB 需 16×H100 或 16×H200;FP8 753 GB 可 8×H200(KV 余量约 370 GB),8×H100 FP8 极紧
KV Cache:MLA:576 维 × 2 B × 78 层 ≈ 88 KiB/token。1M 上下文单请求 KV ≈ 88 GB;DSA 只降低计算不减 KV 存储。 ≈ 88 KiB/token
⚠ 能加载 ≠ 能在满上下文 / 高并发下舒服跑。标「估」的数字来自 计算器 公式或社区量化文件大小。
| 精度 | 权重大小 | 参考显存 |
|---|---|---|
| BF16 | 1,507 GB(官方文件) | 16×H100 / 16×H200 |
| FP8 | ≈ 753 GB(zai-org/GLM-5.2-FP8) | 8×H200 |
| Q4 | ≈ 432 GB(估) | 8×80GB |
KV Cache:MLA ≈ 88 KiB/token。128K 上下文单请求 ≈ 11 GB,1M ≈ 88 GB。
参考配置:
- 24GB / 80GB:不可行
- 8×H100 80GB:FP8 权重后仅剩 ~90 GB 给 KV,长上下文并发受限
- 8×H200 141GB:FP8 舒适
- 16×H100:BF16
| 配置 | 量化 | 占用 / 显存 | 解码 tok/s | 预填充 tok/s | 最大上下文 |
|---|---|---|---|---|---|
| 8× RTX PRO 6000 Blackwell 96GB工作站 | FP8 | 763 GB / 768 GB | 195 | 11250 | 126K |
| 8× A100 80GB数据中心 | Q6_K估 | 605 GB / 640 GB | 274 | 14040 | 410K |
| 8× H20 96GB数据中心 | FP8 | 763 GB / 768 GB | 436 | 3330 | 126K |
| 8× 昇腾 Ascend 910B 64GB数据中心 | Q4_K_M | 442 GB / 512 GB | 294 | 12600 | 819K |
| 8× H100 80GB PCIe数据中心 | Q6_K估 | 605 GB / 640 GB | 269 | 34020 | 410K |
| 8× H100 80GB SXM数据中心 | Q6_K估 | 605 GB / 640 GB | 450 | 44505 | 410K |
| 4× AMD MI300X 192GB数据中心 | FP8 | 758 GB / 768 GB | 289 | 29408 | 237K |
| 4× H200 141GB数据中心 | Q5_K_M估 | 519 GB / 564 GB | 373 | 22253 | 533K |
| 4× B200 192GB数据中心 | FP8 | 758 GB / 768 GB | 436 | 50625 | 237K |
| Mac Studio M3 Ultra 512GB统一内存 | Q4_K_M | 434 GB / 490 GB | 17 | 321 | 661K |
单流(batch=1)估算:解码 ≈ 显存带宽 × 效率 ÷ 每 token 读取字节(激活参数 × 量化位宽 + KV);预填充 ≈ FP16 算力 × 0.45 ÷ (2 × 激活参数)。多卡按张量并行、带宽求和 × 0.55。实际受引擎、驱动、PCIe 影响,误差 ±30%。反向查:我的卡能跑谁 →
编程SWE-bench Pro 62.1、Terminal-Bench 2.1 81.0(Terminus-2)/ 82.7(最佳 harness)、DeepSWE 46.2、NL2Repo 48.9(官方)。
推理GPQA Diamond 91.2、HLE 40.5、HLE(工具)54.7(官方)。
数学AIME 2026 99.2、HMMT Feb 2026 92.5、IMOAnswerBench 91.0(官方)。
AgentMCP-Atlas 76.8、Tool-Decathlon 48.2、FrontierSWE 74.4(官方)。
中文中文顶级。
工程型推理是主打:SWE-bench Pro 62.1、Terminal-Bench 2.1 81.0、FrontierSWE 74.4,官方对标 Claude Opus 4.8 / GPT-5.5 且在部分 agent 编程基准持平。考试型推理也到顶级(AIME 2026 99.2、GPQA 91.2、HLE 40.5 / 带工具 54.7)。思考不可关;reasoning_effort=max 时输出很长。常见问题:SWE-Marathon 这类超长任务仅 13.0,长时间自主任务仍明显落后闭源。
- 1.MIT 许可,744B/40B 激活,无地区限制,商用无附加条件
- 2.官方 1M「无损」上下文;IndexShare 稀疏注意力让 1M 长度下每 token FLOPs 降 2.9×
- 3.SWE-bench Pro 62.1、Terminal-Bench 2.1 81.0(Terminus-2),发布时为开源最高
- 1.744B 体量,FP8 也要 8×H200 级别,自建门槛比 GLM-4.6 翻倍
- 2.思考默认开启且 API 已不支持关闭(只能调 reasoning_effort low/high/max),简单任务 token 消耗大
- 3.API 价 $1.4/$4.4,是 GLM-4.6 的 2 倍以上;长上下文 KV 存储不因 DSA 而减少
| 基准 | 分数 | 来源 | 日期 | 证据 |
|---|---|---|---|---|
| LMArena Text Elo人类偏好 Elo | 1472 | LMArena Text (style control) | 2026-08-28 | 独立复测 |
| Artificial Analysis Intelligence IndexAA 综合指数 | 53 | Artificial Analysis Intelligence Index v3 | 2026-08-28 | 独立复测 |
| GPQA Diamond研究生级科学问答 | 91.2% | GLM-5.2 模型卡 | 2026-08-28 | 厂商公布 |
| Humanity's Last Exam人类最后考试 | 40.5% | GLM-5.2 模型卡 | 2026-08-28 | 厂商公布 |
| Terminal-Bench终端 agent | 81% | GLM-5.2 模型卡 | 2026-08-28 | 厂商公布 |
| Artificial Analysis Intelligence IndexAA 综合指数 | 53 | Artificial Analysis (v4.1.1) | 2026-08-28 | 独立复测 |
| GPQA Diamond研究生级科学问答 | 89.5% | Artificial Analysis (v4.1.1) | 2026-08-28 | 独立复测 |
| Humanity's Last Exam人类最后考试 | 41.1% | Artificial Analysis (v4.1.1) | 2026-08-28 | 独立复测 |
| SciCode科学计算编程 | 50.5% | Artificial Analysis (v4.1.1) | 2026-08-28 | 独立复测 |
| Terminal-Bench Hard终端 agent(AA 困难子集) | 50.8% | Artificial Analysis (v4.1.1) | 2026-08-28 | 独立复测 |
| τ²-Bench Telecom工具调用 agent(电信域) | 99.1% | Artificial Analysis (v4.1.1) | 2026-08-28 | 独立复测 |
| IFBench指令遵循 | 73.3% | Artificial Analysis (v4.1.1) | 2026-08-28 | 独立复测 |
| Terminal-Bench终端 agent | 77.9% | Artificial Analysis · Terminal-Bench 2.1 | 2026-08-28 | 独立复测 |
| τ³-Bench Banking工具调用 agent(银行域) | 34.6% | Artificial Analysis · τ³-Bench Banking | 2026-08-28 | 独立复测 |
| LMArena Chinese Elo中文人类偏好 Elo | 1515 | LMArena Text · Chinese (style control) | 2026-08-28 | 独立复测 |
更新 2026-08-28 · 排名供选型参考,基准会饱和、会泄漏、会过时。