开源权重可下推理模型多模态可商用 · MIT
Z.ai logo

GLM-5.3-Flash

智谱 GLM-5.3-Flash · Z.ai 智谱 · 发布 2026-08-26 · 当前代

320B/18B 混合注意力多模态开源模型,价格极低。

参数
320B 总 / 18B 激活
HYBRID
上下文
1M
价格 / 1M tok
$0.07 / $0.25
Z.ai 开放平台 · 2026-08-28
最低可跑
Mac Studio M3 Ultra
Q5_K_M · 222 GB · ≈33 tok/s
Arena Elo1469
2026-08-28
AA 综合指数57
2026-08-28
代码
GPQA 推理91.2
2026-08-28
类型
Hybrid(线性 + 全注意力)
注意力
KDA 线性注意力 34 层 + DSA 稀疏 MLA 11 层(3:1 交错)
层数
45
专家
288 · 激活 8 + 共享
隐藏维
4096
词表
154,880

glm5_next 混合架构:45 层 = 34 层 KDA(Kimi Delta Attention,64 头 × 128)+ 11 层 DeepSeek 稀疏注意力(MLA,kv_lora_rank 512,q_lora_rank 1536,qk/v head_dim 256,无 RoPE 维,indexer 32 头 top-k 2048)。前 3 层 Dense MLP,其余 288 路由专家 + 1 共享专家选 8,专家中间维 2048,sigmoid 无辅助损失路由。mHC 超连接(hc_mult 4)。1 层 MTP 头。视觉编码器 24 层、hidden 1024、patch 14。表内 kv_heads / head_dim 指 11 层 DSA 层的 MLA 潜向量。config 最大位置 1,048,576,官方评测按 300K 报告。

类型:MoE + 混合注意力(KDA 线性 / DSA 稀疏 MLA),320B 总参 / 18B 激活,原生多模态。

项目数值
层数45 = 11 × (3 × KDA → MoE + 1 × DSA → MoE)
隐藏维4,096
Dense 层前 3 层 Dense MLP(中间维 12,288)
专家288 路由 + 1 共享,每 token 选 8,专家中间维 2,048
DSA 层(11 层)MLA:kv_lora_rank 512、q_lora_rank 1536,64 头,qk/v head_dim 256,无 RoPE 分量;indexer 32 头 × 128,top-k 2048
KDA 层(34 层)64 头 × head_dim 128,short conv kernel 4
超连接mHC(hc_mult 4,Sinkhorn 20 轮)
词表154,880
上下文config 1,048,576;官方评测按 300K
MTP1 层
视觉编码器24 层,hidden 1024,patch 14,spatial merge 2

config.jsonarchitectures: Glm5NextForConditionalGenerationmodel_type: glm5_next_text

参考:zai-org/GLM-5.3-Flash config.json。

Token Embedding词表 154,880× 45 层注意力:KDA 线性注意力 34 层 + DSA 稀疏 MLA 11 层KV 头 1 · head_dim 256路由top-8E1E2E3共享专家288 专家 · 激活 8 · d=4096LM Head320B / 18B 激活实线 = 已公开 · 虚线 = 未披露
精度权重大小说明
BF16640 GB官方精度
FP8328 GB
Q8暂无
Q4200 GBGGUF Q4_K_M 或等效
消费级 24GB
不可行(最小 UD-IQ1_S 也有 93 GB)
单卡 80GB
不可行(UD-IQ1_S 93 GB / UD-IQ4_XS 157 GB 均超单卡)
8×80GB 节点
官方 FP8 328 GB:4×H100 起步,8×H100 舒适并可用满 1M 上下文(KV 很小)

KV Cache:仅 11 层 DSA 层存 KV:MLA 潜向量 512 维(无 RoPE 分量)× 2 B = 1 KiB/层 → 11 KiB/token。34 层 KDA 为固定大小递归状态(64 头 × 128 × 128),与长度无关。1M 上下文 KV ≈ 11 GB。11 KiB/token

⚠ 能加载 ≠ 能在满上下文 / 高并发下舒服跑。标「估」的数字来自 计算器 公式或社区量化文件大小。

精度权重大小参考显存说明
FP8328 GB4–8×H100官方 safetensors,62 分片(BF16 / F8_E4M3 混合)
BF16≈640 GB8×H200+按 320B × 2 B 估算,官方未发布
Q4200 GB3×80GBunsloth UD-Q4_K_XL;UD-IQ4_XS 157 GB
低比特93–148 GB2×80GBunsloth UD-IQ1_S 93.1 / UD-Q2_K_XL 109 / UD-Q3_K_XL 148

KV Cache:仅 11 层 DSA 层产生 KV,MLA 潜向量 512 维 × 2 B = 1 KiB/层,共 11 KiB/token;34 层 KDA 为固定递归状态。1M 上下文 KV ≈ 11 GB,是同级模型中最省的。

参考配置

  • 24GB / 80GB 单卡:不可行
  • 4×H100:官方 FP8 最低配置
  • 8×H100:FP8 高并发 + 1M 上下文

警示:权重体积远大于「Flash」之名;视觉 token 另占显存。

硬件配置与预估吞吐
最低可跑(8K 上下文)
Mac Studio M3 Ultra 256GB
≈¥50,000 · 合计 ≈¥50,000 · 统一内存
量化
Q5_K_M
解码
33 tok/s
最大上下文
1.6M
推荐配置(≥Q8 · 32K 上下文 · ≥15 tok/s)
Mac Studio M3 Ultra 512GB
≈¥75,000 · 合计 ≈¥75,000 · 统一内存
量化
FP8
解码
23 tok/s
最大上下文
29.2M
配置量化占用 / 显存解码 tok/s预填充 tok/s最大上下文
8× L40S 48GB工作站FP8338 GB / 384 GB21191008.4M
4× RTX PRO 6000 Blackwell 96GB工作站FP8333 GB / 384 GB218125009.3M
8× A100 40GB数据中心Q6_K266 GB / 320 GB472312004.9M
4× A100 80GB数据中心Q6_K261 GB / 320 GB310156005.4M
4× H20 96GB数据中心FP8333 GB / 384 GB48837009.3M
4× 昇腾 Ascend 910B 64GB数据中心Q5_K_M226 GB / 256 GB281140002.8M
4× H100 80GB PCIe数据中心Q6_K261 GB / 320 GB304378005.4M
4× H100 80GB SXM数据中心Q6_K261 GB / 320 GB509494505.4M
2× AMD MI300X 192GB数据中心FP8330 GB / 384 GB323326759.7M
2× H200 141GB数据中心Q6_K258 GB / 282 GB364247252.1M
2× B200 192GB数据中心FP8330 GB / 384 GB488562509.7M
2× DGX Spark 128GB统一内存Q5_K_M223 GB / 240 GB2215501.5M
Mac Studio M3 Ultra 256GB统一内存Q5_K_M222 GB / 240 GB337131.6M
Mac Studio M3 Ultra 512GB统一内存FP8329 GB / 490 GB2371329.2M

单流(batch=1)估算:解码 ≈ 显存带宽 × 效率 ÷ 每 token 读取字节(激活参数 × 量化位宽 + KV);预填充 ≈ FP16 算力 × 0.45 ÷ (2 × 激活参数)。多卡按张量并行、带宽求和 × 0.55。实际受引擎、驱动、PCIe 影响,误差 ±30%。反向查:我的卡能跑谁 →

用计算器按你的上下文与并发估算 →

编程Terminal-Bench 2.1 84.3、DeepSWE v1.1 63.4(官方模型卡 bench_53)。

推理HLE(带工具)55.3(官方模型卡);无工具 HLE、GPQA 未披露。

数学AIME 官方未披露。

AgentAgents' Last Exam 26.3、AutomationBench v1.0.6 48.8、GDPVal-AA v2 1773(官方模型卡)。

多模态原生图像输入(24 层视觉编码器);MMMU 等官方数值未披露。

中文智谱系中文顶级。

逻辑能力

工程型推理强:Terminal-Bench 2.1 84.3、DeepSWE v1.1 63.4、AutomationBench 48.8、Agents' Last Exam 26.3,均高于 GLM-5.2(81.0 / 46.2 / 26.2 / 20.4),逼近 Claude Opus 4.8 与 GPT-5.6 Terra 的档位。HLE(带工具)55.3。GDPVal-AA v2 1773 为本表最高。考试型基准(GPQA、AIME)官方未披露,无法评估纯数学推理。LMArena 1469、AA 指数 57 为第三方口径。

亮点
  1. 1.MIT 许可,Terminal-Bench 2.1 84.3、DeepSWE 63.4 超过 GLM-5.2,官方称价格仅其 1/10
  2. 2.KDA 线性 + DSA 稀疏 3:1 混合,KV 仅 11 KiB/token,1M 上下文 KV ≈ 11 GB
  3. 3.GLM-5 系列首个原生多模态(30T 多模态语料新底座);曾以 Ox Alpha 匿名上线 OpenRouter
  1. 1.320B 总参数,官方 FP8 328 GB,最低 4×H100;社区 1-bit 量化也有 93 GB,单卡无解
  2. 2.架构新(glm5_next:KDA + DSA + mHC),需 SGLang / vLLM / Transformers 最新版,llama.cpp 仅 Unsloth 动态量化
  3. 3.刚发布,官方只给 6 项 agent 类基准,GPQA / AIME / SWE-bench Verified / MMMU 等常用榜未披露
适合:低成本编程 agent · 多模态 + 长上下文的自建服务
不适合:单卡部署 · 需要成熟生态的微调
基准分数来源日期证据
LMArena Text Elo人类偏好 Elo1469LMArena Text (style control)2026-08-28独立复测
Artificial Analysis Intelligence IndexAA 综合指数57Artificial Analysis Intelligence Index v32026-08-28独立复测
Terminal-Bench终端 agent84.3%GLM-5.3-Flash 模型卡2026-08-28厂商公布
Artificial Analysis Intelligence IndexAA 综合指数57Artificial Analysis (v4.1.1)2026-08-28独立复测
GPQA Diamond研究生级科学问答91.2%Artificial Analysis (v4.1.1)2026-08-28独立复测
Humanity's Last Exam人类最后考试39.9%Artificial Analysis (v4.1.1)2026-08-28独立复测
SciCode科学计算编程46.1%Artificial Analysis (v4.1.1)2026-08-28独立复测
Terminal-Bench终端 agent84.3%Artificial Analysis · Terminal-Bench 2.12026-08-28独立复测
τ³-Bench Banking工具调用 agent(银行域)47.2%Artificial Analysis · τ³-Bench Banking2026-08-28独立复测

更新 2026-08-28 · 排名供选型参考,基准会饱和、会泄漏、会过时。