开源权重可下推理模型可商用 · MIT
Z.ai logo

GLM-5.2

智谱 GLM-5.2 · Z.ai 智谱 · 发布 2026-06-16 · 当前代

MIT 许可、1M 上下文的 744B 开源编程旗舰。

参数
744B 总 / 40B 激活
MOE
上下文
1M
输出 128K
价格 / 1M tok
$1.40 / $4.40
Z.ai 开放平台 · 2026-08-28
最低可跑
Mac Studio M3 Ultra
Q4_K_M · 434 GB · ≈17 tok/s
Arena Elo1472
2026-08-28
AA 综合指数53
2026-08-28
代码
GPQA 推理89.5
2026-08-28
类型
MoE
注意力
MLA + DSA 稀疏注意力(64 头,IndexShare 索引器)
层数
78
专家
256 · 激活 8 + 共享
隐藏维
6144
词表
154,880

官方 GitHub 标注 744B-A40B(HF 自动计数 753B 含 MTP 层)。MLA:kv_lora_rank 512 + RoPE 64,每层 KV 潜向量 576 维,这里按「1 KV 头 × 288」等价表示。DSA 稀疏注意力每 token 只取 top-2048 索引;IndexShare 让每 4 层共用一个索引器。前 3 层 Dense MLP,其余 256 路由专家 + 1 共享,MoE 中间维 2048;含 1 层 MTP。

类型:MoE,744B 总 / 40B 激活(HF 计数 753B 含 MTP)。

  • 78 层(前 3 层 Dense MLP)+ 1 层 MTP,隐藏维 6144,词表 154,880
  • 专家:256 路由 + 1 共享,每 token 激活 8 个,MoE 中间维 2048,sigmoid 路由(noaux_tc)
  • 注意力:MLA,64 头,q_lora 2048 / kv_lora 512,qk_nope 192 + RoPE 64,v_head 256
  • DSA 稀疏注意力:每 token 通过 32 头索引器选 top-2048 位置;IndexShare 让每 4 层共用 1 个索引器(full/shared 交替),1M 上下文下每 token FLOPs 降 2.9×
  • 上下文 1,048,576,RoPE theta 8e6
  • MTP 层改进后投机解码接受长度提升最多 20%

参考:GLM-5 技术报告(arXiv 2602.15763)、IndexShare(arXiv 2603.12201)。

Token Embedding词表 154,880× 78 层注意力:MLA + DSA 稀疏注意力KV 头 1 · head_dim 288路由top-8E1E2E3共享专家256 专家 · 激活 8 · d=6144LM Head744B / 40B 激活实线 = 已公开 · 虚线 = 未披露
精度权重大小说明
BF161507 GB官方精度
FP8753 GB
Q8801 GB
Q4432 GBGGUF Q4_K_M 或等效
消费级 24GB
不可行
单卡 80GB
不可行
8×80GB 节点
BF16 1.5 TB 需 16×H100 或 16×H200;FP8 753 GB 可 8×H200(KV 余量约 370 GB),8×H100 FP8 极紧

KV Cache:MLA:576 维 × 2 B × 78 层 ≈ 88 KiB/token。1M 上下文单请求 KV ≈ 88 GB;DSA 只降低计算不减 KV 存储。88 KiB/token

⚠ 能加载 ≠ 能在满上下文 / 高并发下舒服跑。标「估」的数字来自 计算器 公式或社区量化文件大小。

精度权重大小参考显存
BF161,507 GB(官方文件)16×H100 / 16×H200
FP8≈ 753 GB(zai-org/GLM-5.2-FP8)8×H200
Q4≈ 432 GB(估)8×80GB

KV Cache:MLA ≈ 88 KiB/token。128K 上下文单请求 ≈ 11 GB,1M ≈ 88 GB。

参考配置

  • 24GB / 80GB:不可行
  • 8×H100 80GB:FP8 权重后仅剩 ~90 GB 给 KV,长上下文并发受限
  • 8×H200 141GB:FP8 舒适
  • 16×H100:BF16
硬件配置与预估吞吐
最低可跑(8K 上下文)
Mac Studio M3 Ultra 512GB
≈¥75,000 · 合计 ≈¥75,000 · 统一内存
量化
Q4_K_M
解码
17 tok/s
最大上下文
661K
推荐配置(≥Q8 · 32K 上下文 · ≥15 tok/s)
8 × RTX PRO 6000 Blackwell 96GB
≈¥70,000 × 8 · 合计 ≈¥560,000 · 工作站
量化
FP8
解码
190 tok/s
最大上下文
126K
配置量化占用 / 显存解码 tok/s预填充 tok/s最大上下文
8× RTX PRO 6000 Blackwell 96GB工作站FP8763 GB / 768 GB19511250126K
8× A100 80GB数据中心Q6_K605 GB / 640 GB27414040410K
8× H20 96GB数据中心FP8763 GB / 768 GB4363330126K
8× 昇腾 Ascend 910B 64GB数据中心Q4_K_M442 GB / 512 GB29412600819K
8× H100 80GB PCIe数据中心Q6_K605 GB / 640 GB26934020410K
8× H100 80GB SXM数据中心Q6_K605 GB / 640 GB45044505410K
4× AMD MI300X 192GB数据中心FP8758 GB / 768 GB28929408237K
4× H200 141GB数据中心Q5_K_M519 GB / 564 GB37322253533K
4× B200 192GB数据中心FP8758 GB / 768 GB43650625237K
Mac Studio M3 Ultra 512GB统一内存Q4_K_M434 GB / 490 GB17321661K

单流(batch=1)估算:解码 ≈ 显存带宽 × 效率 ÷ 每 token 读取字节(激活参数 × 量化位宽 + KV);预填充 ≈ FP16 算力 × 0.45 ÷ (2 × 激活参数)。多卡按张量并行、带宽求和 × 0.55。实际受引擎、驱动、PCIe 影响,误差 ±30%。反向查:我的卡能跑谁 →

用计算器按你的上下文与并发估算 →

编程SWE-bench Pro 62.1、Terminal-Bench 2.1 81.0(Terminus-2)/ 82.7(最佳 harness)、DeepSWE 46.2、NL2Repo 48.9(官方)。

推理GPQA Diamond 91.2、HLE 40.5、HLE(工具)54.7(官方)。

数学AIME 2026 99.2、HMMT Feb 2026 92.5、IMOAnswerBench 91.0(官方)。

AgentMCP-Atlas 76.8、Tool-Decathlon 48.2、FrontierSWE 74.4(官方)。

中文中文顶级。

逻辑能力

工程型推理是主打:SWE-bench Pro 62.1、Terminal-Bench 2.1 81.0、FrontierSWE 74.4,官方对标 Claude Opus 4.8 / GPT-5.5 且在部分 agent 编程基准持平。考试型推理也到顶级(AIME 2026 99.2、GPQA 91.2、HLE 40.5 / 带工具 54.7)。思考不可关;reasoning_effort=max 时输出很长。常见问题:SWE-Marathon 这类超长任务仅 13.0,长时间自主任务仍明显落后闭源。

亮点
  1. 1.MIT 许可,744B/40B 激活,无地区限制,商用无附加条件
  2. 2.官方 1M「无损」上下文;IndexShare 稀疏注意力让 1M 长度下每 token FLOPs 降 2.9×
  3. 3.SWE-bench Pro 62.1、Terminal-Bench 2.1 81.0(Terminus-2),发布时为开源最高
  1. 1.744B 体量,FP8 也要 8×H200 级别,自建门槛比 GLM-4.6 翻倍
  2. 2.思考默认开启且 API 已不支持关闭(只能调 reasoning_effort low/high/max),简单任务 token 消耗大
  3. 3.API 价 $1.4/$4.4,是 GLM-4.6 的 2 倍以上;长上下文 KV 存储不因 DSA 而减少
适合:编程 agent 后端(Claude Code / ZCode / OpenCode) · 整库级 1M 上下文代码理解 · 自建替代 Opus 级编程服务
不适合:单机 / 单节点 80GB 部署(用 GLM-5.3-Flash) · 多模态输入(用 GLM-5.3-Flash 或 GLM-5V 系列) · 对成本敏感的简单对话
基准分数来源日期证据
LMArena Text Elo人类偏好 Elo1472LMArena Text (style control)2026-08-28独立复测
Artificial Analysis Intelligence IndexAA 综合指数53Artificial Analysis Intelligence Index v32026-08-28独立复测
GPQA Diamond研究生级科学问答91.2%GLM-5.2 模型卡2026-08-28厂商公布
Humanity's Last Exam人类最后考试40.5%GLM-5.2 模型卡2026-08-28厂商公布
Terminal-Bench终端 agent81%GLM-5.2 模型卡2026-08-28厂商公布
Artificial Analysis Intelligence IndexAA 综合指数53Artificial Analysis (v4.1.1)2026-08-28独立复测
GPQA Diamond研究生级科学问答89.5%Artificial Analysis (v4.1.1)2026-08-28独立复测
Humanity's Last Exam人类最后考试41.1%Artificial Analysis (v4.1.1)2026-08-28独立复测
SciCode科学计算编程50.5%Artificial Analysis (v4.1.1)2026-08-28独立复测
Terminal-Bench Hard终端 agent(AA 困难子集)50.8%Artificial Analysis (v4.1.1)2026-08-28独立复测
τ²-Bench Telecom工具调用 agent(电信域)99.1%Artificial Analysis (v4.1.1)2026-08-28独立复测
IFBench指令遵循73.3%Artificial Analysis (v4.1.1)2026-08-28独立复测
Terminal-Bench终端 agent77.9%Artificial Analysis · Terminal-Bench 2.12026-08-28独立复测
τ³-Bench Banking工具调用 agent(银行域)34.6%Artificial Analysis · τ³-Bench Banking2026-08-28独立复测
LMArena Chinese Elo中文人类偏好 Elo1515LMArena Text · Chinese (style control)2026-08-28独立复测

更新 2026-08-28 · 排名供选型参考,基准会饱和、会泄漏、会过时。