
GLM-5.3-Flash
智谱 GLM-5.3-Flash · Z.ai 智谱 · 发布 2026-08-26 · 当前代
320B/18B 混合注意力多模态开源模型,价格极低。
- 类型
- Hybrid(线性 + 全注意力)
- 注意力
- KDA 线性注意力 34 层 + DSA 稀疏 MLA 11 层(3:1 交错)
- 层数
- 45
- 专家
- 288 · 激活 8 + 共享
- 隐藏维
- 4096
- 词表
- 154,880
glm5_next 混合架构:45 层 = 34 层 KDA(Kimi Delta Attention,64 头 × 128)+ 11 层 DeepSeek 稀疏注意力(MLA,kv_lora_rank 512,q_lora_rank 1536,qk/v head_dim 256,无 RoPE 维,indexer 32 头 top-k 2048)。前 3 层 Dense MLP,其余 288 路由专家 + 1 共享专家选 8,专家中间维 2048,sigmoid 无辅助损失路由。mHC 超连接(hc_mult 4)。1 层 MTP 头。视觉编码器 24 层、hidden 1024、patch 14。表内 kv_heads / head_dim 指 11 层 DSA 层的 MLA 潜向量。config 最大位置 1,048,576,官方评测按 300K 报告。
类型:MoE + 混合注意力(KDA 线性 / DSA 稀疏 MLA),320B 总参 / 18B 激活,原生多模态。
| 项目 | 数值 |
|---|---|
| 层数 | 45 = 11 × (3 × KDA → MoE + 1 × DSA → MoE) |
| 隐藏维 | 4,096 |
| Dense 层 | 前 3 层 Dense MLP(中间维 12,288) |
| 专家 | 288 路由 + 1 共享,每 token 选 8,专家中间维 2,048 |
| DSA 层(11 层) | MLA:kv_lora_rank 512、q_lora_rank 1536,64 头,qk/v head_dim 256,无 RoPE 分量;indexer 32 头 × 128,top-k 2048 |
| KDA 层(34 层) | 64 头 × head_dim 128,short conv kernel 4 |
| 超连接 | mHC(hc_mult 4,Sinkhorn 20 轮) |
| 词表 | 154,880 |
| 上下文 | config 1,048,576;官方评测按 300K |
| MTP | 1 层 |
| 视觉编码器 | 24 层,hidden 1024,patch 14,spatial merge 2 |
config.json 中 architectures: Glm5NextForConditionalGeneration,model_type: glm5_next_text。
参考:zai-org/GLM-5.3-Flash config.json。
| 精度 | 权重大小 | 说明 |
|---|---|---|
| BF16 | 640 GB | 官方精度 |
| FP8 | 328 GB | |
| Q8 | — | 暂无 |
| Q4 | 200 GB | GGUF Q4_K_M 或等效 |
- 消费级 24GB
- 不可行(最小 UD-IQ1_S 也有 93 GB)
- 单卡 80GB
- 不可行(UD-IQ1_S 93 GB / UD-IQ4_XS 157 GB 均超单卡)
- 8×80GB 节点
- 官方 FP8 328 GB:4×H100 起步,8×H100 舒适并可用满 1M 上下文(KV 很小)
KV Cache:仅 11 层 DSA 层存 KV:MLA 潜向量 512 维(无 RoPE 分量)× 2 B = 1 KiB/层 → 11 KiB/token。34 层 KDA 为固定大小递归状态(64 头 × 128 × 128),与长度无关。1M 上下文 KV ≈ 11 GB。 ≈ 11 KiB/token
⚠ 能加载 ≠ 能在满上下文 / 高并发下舒服跑。标「估」的数字来自 计算器 公式或社区量化文件大小。
| 精度 | 权重大小 | 参考显存 | 说明 |
|---|---|---|---|
| FP8 | 328 GB | 4–8×H100 | 官方 safetensors,62 分片(BF16 / F8_E4M3 混合) |
| BF16 | ≈640 GB | 8×H200+ | 按 320B × 2 B 估算,官方未发布 |
| Q4 | 200 GB | 3×80GB | unsloth UD-Q4_K_XL;UD-IQ4_XS 157 GB |
| 低比特 | 93–148 GB | 2×80GB | unsloth UD-IQ1_S 93.1 / UD-Q2_K_XL 109 / UD-Q3_K_XL 148 |
KV Cache:仅 11 层 DSA 层产生 KV,MLA 潜向量 512 维 × 2 B = 1 KiB/层,共 11 KiB/token;34 层 KDA 为固定递归状态。1M 上下文 KV ≈ 11 GB,是同级模型中最省的。
参考配置:
- 24GB / 80GB 单卡:不可行
- 4×H100:官方 FP8 最低配置
- 8×H100:FP8 高并发 + 1M 上下文
警示:权重体积远大于「Flash」之名;视觉 token 另占显存。
| 配置 | 量化 | 占用 / 显存 | 解码 tok/s | 预填充 tok/s | 最大上下文 |
|---|---|---|---|---|---|
| 8× L40S 48GB工作站 | FP8 | 338 GB / 384 GB | 211 | 9100 | 8.4M |
| 4× RTX PRO 6000 Blackwell 96GB工作站 | FP8 | 333 GB / 384 GB | 218 | 12500 | 9.3M |
| 8× A100 40GB数据中心 | Q6_K估 | 266 GB / 320 GB | 472 | 31200 | 4.9M |
| 4× A100 80GB数据中心 | Q6_K估 | 261 GB / 320 GB | 310 | 15600 | 5.4M |
| 4× H20 96GB数据中心 | FP8 | 333 GB / 384 GB | 488 | 3700 | 9.3M |
| 4× 昇腾 Ascend 910B 64GB数据中心 | Q5_K_M估 | 226 GB / 256 GB | 281 | 14000 | 2.8M |
| 4× H100 80GB PCIe数据中心 | Q6_K估 | 261 GB / 320 GB | 304 | 37800 | 5.4M |
| 4× H100 80GB SXM数据中心 | Q6_K估 | 261 GB / 320 GB | 509 | 49450 | 5.4M |
| 2× AMD MI300X 192GB数据中心 | FP8 | 330 GB / 384 GB | 323 | 32675 | 9.7M |
| 2× H200 141GB数据中心 | Q6_K估 | 258 GB / 282 GB | 364 | 24725 | 2.1M |
| 2× B200 192GB数据中心 | FP8 | 330 GB / 384 GB | 488 | 56250 | 9.7M |
| 2× DGX Spark 128GB统一内存 | Q5_K_M估 | 223 GB / 240 GB | 22 | 1550 | 1.5M |
| Mac Studio M3 Ultra 256GB统一内存 | Q5_K_M估 | 222 GB / 240 GB | 33 | 713 | 1.6M |
| Mac Studio M3 Ultra 512GB统一内存 | FP8 | 329 GB / 490 GB | 23 | 713 | 29.2M |
单流(batch=1)估算:解码 ≈ 显存带宽 × 效率 ÷ 每 token 读取字节(激活参数 × 量化位宽 + KV);预填充 ≈ FP16 算力 × 0.45 ÷ (2 × 激活参数)。多卡按张量并行、带宽求和 × 0.55。实际受引擎、驱动、PCIe 影响,误差 ±30%。反向查:我的卡能跑谁 →
编程Terminal-Bench 2.1 84.3、DeepSWE v1.1 63.4(官方模型卡 bench_53)。
推理HLE(带工具)55.3(官方模型卡);无工具 HLE、GPQA 未披露。
数学AIME 官方未披露。
AgentAgents' Last Exam 26.3、AutomationBench v1.0.6 48.8、GDPVal-AA v2 1773(官方模型卡)。
多模态原生图像输入(24 层视觉编码器);MMMU 等官方数值未披露。
中文智谱系中文顶级。
工程型推理强:Terminal-Bench 2.1 84.3、DeepSWE v1.1 63.4、AutomationBench 48.8、Agents' Last Exam 26.3,均高于 GLM-5.2(81.0 / 46.2 / 26.2 / 20.4),逼近 Claude Opus 4.8 与 GPT-5.6 Terra 的档位。HLE(带工具)55.3。GDPVal-AA v2 1773 为本表最高。考试型基准(GPQA、AIME)官方未披露,无法评估纯数学推理。LMArena 1469、AA 指数 57 为第三方口径。
- 1.MIT 许可,Terminal-Bench 2.1 84.3、DeepSWE 63.4 超过 GLM-5.2,官方称价格仅其 1/10
- 2.KDA 线性 + DSA 稀疏 3:1 混合,KV 仅 11 KiB/token,1M 上下文 KV ≈ 11 GB
- 3.GLM-5 系列首个原生多模态(30T 多模态语料新底座);曾以 Ox Alpha 匿名上线 OpenRouter
- 1.320B 总参数,官方 FP8 328 GB,最低 4×H100;社区 1-bit 量化也有 93 GB,单卡无解
- 2.架构新(glm5_next:KDA + DSA + mHC),需 SGLang / vLLM / Transformers 最新版,llama.cpp 仅 Unsloth 动态量化
- 3.刚发布,官方只给 6 项 agent 类基准,GPQA / AIME / SWE-bench Verified / MMMU 等常用榜未披露
| 基准 | 分数 | 来源 | 日期 | 证据 |
|---|---|---|---|---|
| LMArena Text Elo人类偏好 Elo | 1469 | LMArena Text (style control) | 2026-08-28 | 独立复测 |
| Artificial Analysis Intelligence IndexAA 综合指数 | 57 | Artificial Analysis Intelligence Index v3 | 2026-08-28 | 独立复测 |
| Terminal-Bench终端 agent | 84.3% | GLM-5.3-Flash 模型卡 | 2026-08-28 | 厂商公布 |
| Artificial Analysis Intelligence IndexAA 综合指数 | 57 | Artificial Analysis (v4.1.1) | 2026-08-28 | 独立复测 |
| GPQA Diamond研究生级科学问答 | 91.2% | Artificial Analysis (v4.1.1) | 2026-08-28 | 独立复测 |
| Humanity's Last Exam人类最后考试 | 39.9% | Artificial Analysis (v4.1.1) | 2026-08-28 | 独立复测 |
| SciCode科学计算编程 | 46.1% | Artificial Analysis (v4.1.1) | 2026-08-28 | 独立复测 |
| Terminal-Bench终端 agent | 84.3% | Artificial Analysis · Terminal-Bench 2.1 | 2026-08-28 | 独立复测 |
| τ³-Bench Banking工具调用 agent(银行域) | 47.2% | Artificial Analysis · τ³-Bench Banking | 2026-08-28 | 独立复测 |
更新 2026-08-28 · 排名供选型参考,基准会饱和、会泄漏、会过时。