Gemma 4 31B
谷歌 Gemma 4 · 31B · Google 谷歌 · 发布 2026-04-02 · 当前代
Apache 2.0 的单卡 Dense 旗舰,带思考模式,256K 上下文。
- 类型
- Dense
- 注意力
- GQA(32 Q 头 / 16 KV 头,head_dim 256),5:1 局部滑窗(1024) : 全局
- 层数
- 60
- 隐藏维
- 5376
- 词表
- 262,144
60 层中 12 层全局注意力(每 6 层 1 层,末层为全局),其余 1024 token 滑窗。中间层维 21504。视觉编码器约 550M。最大位置 262,144。
类型:Dense,30.7B 参数(含约 550M 视觉编码器)。
- 60 层,隐藏维 5376,中间层维 21504,词表 262,144
- GQA:32 Q 头 / 16 KV 头,head_dim 256
- 注意力交替:5 层局部滑窗(1024)→ 1 层全局,共 12 层全局,末层固定全局
- 上下文 256K(max_position_embeddings 262,144)
- 多模态:图像 / 视频输入;31B 不含音频
- 思考模式:系统提示中加
<|think|>开启 - 原生系统提示、函数调用、结构化 JSON 输出
- 多 token 预测(MTP)草稿模型可用于投机解码
参考:HF config.json(google/gemma-4-31B-it)、Gemma 4 技术报告(arXiv 2607.02770)。
| 精度 | 权重大小 | 说明 |
|---|---|---|
| BF16 | 61 GB | 官方精度 |
| FP8 | 35 GB | |
| Q8 | 33 GB | |
| Q4 | 18 GB | GGUF Q4_K_M 或等效 |
- 消费级 24GB
- 官方 QAT Q4_0 17.5 GB(社区 Q4_K_M 18.3 GB)+ 视觉,剩余约 5 GB 给 KV,约 16–24K 上下文;长上下文需 Q3 或卸载
- 单卡 80GB
- BF16 61.4 GB + 64K 上下文 KV 约 12 GB,可行;FP8 34.9 GB 可跑满 256K
- 8×80GB 节点
- 过剩
KV Cache:全局层 12 × 16 KV 头 × 256 × 2 × 2 B = 192 KiB/token;局部层 KV 上限 1024 token,可忽略。128K 上下文 ≈ 24 GB,比 Gemma 3 27B 高 4 倍以上(head_dim 翻倍)。 ≈ 192 KiB/token
⚠ 能加载 ≠ 能在满上下文 / 高并发下舒服跑。标「估」的数字来自 计算器 公式或社区量化文件大小。
| 精度 | 权重大小 | 来源 | 参考显存 |
|---|---|---|---|
| BF16 | 61.4 GB | 30.7B × 2 / GGUF BF16 | 80GB |
| SFP8 | 34.9 GB | 官方文档 | 48GB |
| Q8_0 | 32.6 GB | 社区 GGUF | 48GB |
| Q4_0 (QAT) | 17.5 GB | 官方文档 | 24GB |
| Q4_K_M | 18.3 GB | unsloth GGUF | 24GB |
KV Cache:全局层 12 × 16 × 256 × 2 × 2 B = 192 KiB/token。32K ≈ 6 GB,128K ≈ 24 GB,256K ≈ 48 GB。
参考配置:
- 24GB:Q4 QAT + 16–24K 上下文;再长需 KV 量化或 Q3
- 80GB:BF16 + 64K,或 FP8 + 256K
- 官方提供 QAT 版(GGUF / 未量化 QAT / compressed-tensors),Q4 质量损失小于社区后量化
| 配置 | 量化 | 占用 / 显存 | 解码 tok/s | 预填充 tok/s | 最大上下文 |
|---|---|---|---|---|---|
| 2× RTX 3060 12GB消费级 | Q4_K_M | 21 GB / 24 GB | 20 | 366 | 22K |
| 2× RTX 4060 Ti 16GB消费级 | Q6_K估 | 28 GB / 32 GB | 12 | 322 | 27K |
| RTX 3090 24GB消费级 | Q5_K_M估 | 24 GB / 24 GB | 27 | 520 | 9K |
| 2× RTX 4070 Ti Super 16GB消费级 | Q6_K估 | 28 GB / 32 GB | 28 | 645 | 27K |
| 2× RTX 5070 Ti 16GB消费级 | Q6_K估 | 28 GB / 32 GB | 38 | 1290 | 27K |
| 2× RTX 4080 Super 16GB消费级 | Q6_K估 | 28 GB / 32 GB | 31 | 762 | 27K |
| 2× RTX 5080 16GB消费级 | Q6_K估 | 28 GB / 32 GB | 40 | 1642 | 27K |
| RTX 4090 24GB消费级 | Q5_K_M估 | 24 GB / 24 GB | 29 | 1209 | 9K |
| RTX 5090 32GB消费级 | Q6_K估 | 27 GB / 32 GB | 45 | 1539 | 33K |
| L4 24GB工作站 | Q5_K_M估 | 24 GB / 24 GB | 8.6 | 440 | 9K |
| RTX A6000 48GB工作站 | FP8 | 37 GB / 48 GB | 16 | 564 | 127K |
| RTX 6000 Ada 48GB工作站 | FP8 | 37 GB / 48 GB | 20 | 667 | 127K |
| L40S 48GB工作站 | FP8 | 37 GB / 48 GB | 18 | 667 | 127K |
| RTX PRO 6000 Blackwell 96GB工作站 | BF16 | 64 GB / 96 GB | 18 | 1832 | 178K |
| A10 24GB数据中心 | Q5_K_M估 | 24 GB / 24 GB | 17 | 454 | 9K |
| A100 40GB数据中心 | FP8 | 37 GB / 40 GB | 32 | 2287 | 42K |
| A100 80GB数据中心 | BF16 | 64 GB / 80 GB | 21 | 2287 | 93K |
| H20 96GB数据中心 | BF16 | 64 GB / 96 GB | 41 | 542 | 178K |
| 昇腾 Ascend 910B 64GB数据中心 | FP8 | 37 GB / 64 GB | 33 | 2052 | 298K |
| H100 80GB PCIe数据中心 | BF16 | 64 GB / 80 GB | 21 | 5541 | 93K |
| H100 80GB SXM数据中心 | BF16 | 64 GB / 80 GB | 35 | 7248 | 93K |
| AMD MI300X 192GB数据中心 | BF16 | 64 GB / 192 GB | 55 | 9579 | 690K |
| H200 141GB数据中心 | BF16 | 64 GB / 141 GB | 50 | 7248 | 418K |
| B200 192GB数据中心 | BF16 | 64 GB / 192 GB | 83 | 16490 | 690K |
| Mac M4 Pro 64GB统一内存 | FP8 | 37 GB / 56 GB | 4.3 | 125 | 212K |
| DGX Spark 128GB统一内存 | BF16 | 64 GB / 120 GB | 2.2 | 454 | 306K |
| Mac M4 Max 128GB统一内存 | BF16 | 64 GB / 120 GB | 4.3 | 249 | 306K |
| Mac Studio M3 Ultra 256GB统一内存 | BF16 | 64 GB / 240 GB | 6.5 | 418 | 946K |
| Mac Studio M3 Ultra 512GB统一内存 | BF16 | 64 GB / 490 GB | 6.5 | 418 | 2.2M |
单流(batch=1)估算:解码 ≈ 显存带宽 × 效率 ÷ 每 token 读取字节(激活参数 × 量化位宽 + KV);预填充 ≈ FP16 算力 × 0.45 ÷ (2 × 激活参数)。多卡按张量并行、带宽求和 × 0.55。实际受引擎、驱动、PCIe 影响,误差 ±30%。反向查:我的卡能跑谁 →
编程LiveCodeBench v6 80.0%、Codeforces Elo 2150(官方模型卡)。
推理GPQA Diamond 84.3%、HLE 19.5%(无工具)、BBEH 74.4%(官方)。
数学AIME 2026 89.2%(无工具,官方)。
Agenttau2-bench 三项均值 76.9%(官方)。
多模态MMMU Pro(视觉)76.9%、MATH-Vision 85.6%(官方)。
中文MMMLU 88.4%,140+ 语言训练,中文可用。
带 <|think|> 开关的推理模型。考试型推理在开源同档领先:GPQA 84.3%、AIME 2026 89.2%、MMLU Pro 85.2%。工程型推理:LiveCodeBench v6 80.0%、Codeforces 2150,tau2-bench 均值 76.9%,agent 可用。弱项:HLE 19.5%,长上下文 MRCR v2 128K 66.4%,长程检索一般。
- 1.Apache 2.0 许可,告别 Gemma 自定义条款,可商用闭包
- 2.GPQA 84.3%、AIME 2026 89.2%、LiveCodeBench v6 80.0%,Arena 1451 开源前三
- 3.256K 上下文 + 图像 / 视频输入 + 函数调用,官方 QAT Q4 版 17.5 GB
- 1.head_dim 256,全局层 KV 192 KiB/token,24GB 卡上长上下文比 Gemma 3 更吃紧
- 2.HLE 无工具仅 19.5%,前沿知识题距闭源旗舰差距大
- 3.31B 不支持音频输入(仅 E2B / E4B 有)
| 基准 | 分数 | 来源 | 日期 | 证据 |
|---|---|---|---|---|
| LMArena Text Elo人类偏好 Elo | 1451 | LMArena Text (style control) | 2026-08-28 | 独立复测 |
| Artificial Analysis Intelligence IndexAA 综合指数 | 30 | Artificial Analysis Intelligence Index v3 | 2026-08-28 | 独立复测 |
| LiveCodeBench竞赛编程 | 80% | Gemma 4 官方模型卡 | 2026-08-28 | 厂商公布 |
| GPQA Diamond研究生级科学问答 | 84.3% | Gemma 4 官方模型卡 | 2026-08-28 | 厂商公布 |
| Humanity's Last Exam人类最后考试 | 19.5% | Gemma 4 官方模型卡 | 2026-08-28 | 厂商公布 |
| τ²-bench工具调用 agent | 76.9% | Gemma 4 官方模型卡 | 2026-08-28 | 厂商公布 |
| MMMU多模态理解 | 76.9% | Gemma 4 官方模型卡 | 2026-08-28 | 厂商公布 |
| Artificial Analysis Intelligence IndexAA 综合指数 | 30 | Artificial Analysis (v4.1.1) | 2026-08-28 | 独立复测 |
| GPQA Diamond研究生级科学问答 | 85.7% | Artificial Analysis (v4.1.1) | 2026-08-28 | 独立复测 |
| Humanity's Last Exam人类最后考试 | 23.6% | Artificial Analysis (v4.1.1) | 2026-08-28 | 独立复测 |
| SciCode科学计算编程 | 43.4% | Artificial Analysis (v4.1.1) | 2026-08-28 | 独立复测 |
| Terminal-Bench Hard终端 agent(AA 困难子集) | 36.4% | Artificial Analysis (v4.1.1) | 2026-08-28 | 独立复测 |
| τ²-Bench Telecom工具调用 agent(电信域) | 59.9% | Artificial Analysis (v4.1.1) | 2026-08-28 | 独立复测 |
| MMMU-Pro多模态理解(Pro) | 73.4% | Artificial Analysis (v4.1.1) | 2026-08-28 | 独立复测 |
| IFBench指令遵循 | 75.6% | Artificial Analysis (v4.1.1) | 2026-08-28 | 独立复测 |
| Terminal-Bench终端 agent | 43.4% | Artificial Analysis · Terminal-Bench 2.1 | 2026-08-28 | 独立复测 |
| τ³-Bench Banking工具调用 agent(银行域) | 14.8% | Artificial Analysis · τ³-Bench Banking | 2026-08-28 | 独立复测 |
| LMArena Chinese Elo中文人类偏好 Elo | 1476 | LMArena Text · Chinese (style control) | 2026-08-28 | 独立复测 |
更新 2026-08-28 · 排名供选型参考,基准会饱和、会泄漏、会过时。