开源权重可下推理模型·可关多模态单卡可跑可商用 · Apache 2.0
Google logo

Gemma 4 31B

谷歌 Gemma 4 · 31B · Google 谷歌 · 发布 2026-04-02 · 当前代

Apache 2.0 的单卡 Dense 旗舰,带思考模式,256K 上下文。

参数
30.7B
DENSE
上下文
256K
输出 32K
价格 / 1M tok
免费层
Google AI 定价页( · 2026-08-28
最低可跑
2× RTX 3060
Q4_K_M · 21 GB · ≈20 tok/s
Arena Elo1451
2026-08-28
AA 综合指数30
2026-08-28
竞赛编程80
2026-08-28
GPQA 推理85.7
2026-08-28
类型
Dense
注意力
GQA(32 Q 头 / 16 KV 头,head_dim 256),5:1 局部滑窗(1024) : 全局
层数
60
隐藏维
5376
词表
262,144

60 层中 12 层全局注意力(每 6 层 1 层,末层为全局),其余 1024 token 滑窗。中间层维 21504。视觉编码器约 550M。最大位置 262,144。

类型:Dense,30.7B 参数(含约 550M 视觉编码器)。

  • 60 层,隐藏维 5376,中间层维 21504,词表 262,144
  • GQA:32 Q 头 / 16 KV 头,head_dim 256
  • 注意力交替:5 层局部滑窗(1024)→ 1 层全局,共 12 层全局,末层固定全局
  • 上下文 256K(max_position_embeddings 262,144)
  • 多模态:图像 / 视频输入;31B 不含音频
  • 思考模式:系统提示中加 <|think|> 开启
  • 原生系统提示、函数调用、结构化 JSON 输出
  • 多 token 预测(MTP)草稿模型可用于投机解码

参考:HF config.json(google/gemma-4-31B-it)、Gemma 4 技术报告(arXiv 2607.02770)。

Token Embedding词表 262,144× 60 层(12 层全注意力)注意力:GQAKV 头 16 · head_dim 256Dense FFN隐藏维 5376Dense:每个 token 经过全部参数LM Head30.7B实线 = 已公开 · 虚线 = 未披露
精度权重大小说明
BF1661 GB官方精度
FP835 GB
Q833 GB
Q418 GBGGUF Q4_K_M 或等效
消费级 24GB
官方 QAT Q4_0 17.5 GB(社区 Q4_K_M 18.3 GB)+ 视觉,剩余约 5 GB 给 KV,约 16–24K 上下文;长上下文需 Q3 或卸载
单卡 80GB
BF16 61.4 GB + 64K 上下文 KV 约 12 GB,可行;FP8 34.9 GB 可跑满 256K
8×80GB 节点
过剩

KV Cache:全局层 12 × 16 KV 头 × 256 × 2 × 2 B = 192 KiB/token;局部层 KV 上限 1024 token,可忽略。128K 上下文 ≈ 24 GB,比 Gemma 3 27B 高 4 倍以上(head_dim 翻倍)。192 KiB/token

⚠ 能加载 ≠ 能在满上下文 / 高并发下舒服跑。标「估」的数字来自 计算器 公式或社区量化文件大小。

精度权重大小来源参考显存
BF1661.4 GB30.7B × 2 / GGUF BF1680GB
SFP834.9 GB官方文档48GB
Q8_032.6 GB社区 GGUF48GB
Q4_0 (QAT)17.5 GB官方文档24GB
Q4_K_M18.3 GBunsloth GGUF24GB

KV Cache:全局层 12 × 16 × 256 × 2 × 2 B = 192 KiB/token。32K ≈ 6 GB,128K ≈ 24 GB,256K ≈ 48 GB。

参考配置

  • 24GB:Q4 QAT + 16–24K 上下文;再长需 KV 量化或 Q3
  • 80GB:BF16 + 64K,或 FP8 + 256K
  • 官方提供 QAT 版(GGUF / 未量化 QAT / compressed-tensors),Q4 质量损失小于社区后量化
硬件配置与预估吞吐
最低可跑(8K 上下文)
2 × RTX 3060 12GB
≈¥2,000 × 2 · 合计 ≈¥4,000 · 消费级
量化
Q4_K_M
解码
20 tok/s
最大上下文
22K
推荐配置(≥Q8 · 32K 上下文 · ≥15 tok/s)
2 × RTX 3090 24GB
二手 ≈¥5,000 × 2 · 合计 ≈¥10,000 · 消费级
量化
FP8
解码
30 tok/s
最大上下文
114K
配置量化占用 / 显存解码 tok/s预填充 tok/s最大上下文
2× RTX 3060 12GB消费级Q4_K_M21 GB / 24 GB2036622K
2× RTX 4060 Ti 16GB消费级Q6_K28 GB / 32 GB1232227K
RTX 3090 24GB消费级Q5_K_M24 GB / 24 GB275209K
2× RTX 4070 Ti Super 16GB消费级Q6_K28 GB / 32 GB2864527K
2× RTX 5070 Ti 16GB消费级Q6_K28 GB / 32 GB38129027K
2× RTX 4080 Super 16GB消费级Q6_K28 GB / 32 GB3176227K
2× RTX 5080 16GB消费级Q6_K28 GB / 32 GB40164227K
RTX 4090 24GB消费级Q5_K_M24 GB / 24 GB2912099K
RTX 5090 32GB消费级Q6_K27 GB / 32 GB45153933K
L4 24GB工作站Q5_K_M24 GB / 24 GB8.64409K
RTX A6000 48GB工作站FP837 GB / 48 GB16564127K
RTX 6000 Ada 48GB工作站FP837 GB / 48 GB20667127K
L40S 48GB工作站FP837 GB / 48 GB18667127K
RTX PRO 6000 Blackwell 96GB工作站BF1664 GB / 96 GB181832178K
A10 24GB数据中心Q5_K_M24 GB / 24 GB174549K
A100 40GB数据中心FP837 GB / 40 GB32228742K
A100 80GB数据中心BF1664 GB / 80 GB21228793K
H20 96GB数据中心BF1664 GB / 96 GB41542178K
昇腾 Ascend 910B 64GB数据中心FP837 GB / 64 GB332052298K
H100 80GB PCIe数据中心BF1664 GB / 80 GB21554193K
H100 80GB SXM数据中心BF1664 GB / 80 GB35724893K
AMD MI300X 192GB数据中心BF1664 GB / 192 GB559579690K
H200 141GB数据中心BF1664 GB / 141 GB507248418K
B200 192GB数据中心BF1664 GB / 192 GB8316490690K
Mac M4 Pro 64GB统一内存FP837 GB / 56 GB4.3125212K
DGX Spark 128GB统一内存BF1664 GB / 120 GB2.2454306K
Mac M4 Max 128GB统一内存BF1664 GB / 120 GB4.3249306K
Mac Studio M3 Ultra 256GB统一内存BF1664 GB / 240 GB6.5418946K
Mac Studio M3 Ultra 512GB统一内存BF1664 GB / 490 GB6.54182.2M

单流(batch=1)估算:解码 ≈ 显存带宽 × 效率 ÷ 每 token 读取字节(激活参数 × 量化位宽 + KV);预填充 ≈ FP16 算力 × 0.45 ÷ (2 × 激活参数)。多卡按张量并行、带宽求和 × 0.55。实际受引擎、驱动、PCIe 影响,误差 ±30%。反向查:我的卡能跑谁 →

用计算器按你的上下文与并发估算 →

编程LiveCodeBench v6 80.0%、Codeforces Elo 2150(官方模型卡)。

推理GPQA Diamond 84.3%、HLE 19.5%(无工具)、BBEH 74.4%(官方)。

数学AIME 2026 89.2%(无工具,官方)。

Agenttau2-bench 三项均值 76.9%(官方)。

多模态MMMU Pro(视觉)76.9%、MATH-Vision 85.6%(官方)。

中文MMMLU 88.4%,140+ 语言训练,中文可用。

逻辑能力

带 <|think|> 开关的推理模型。考试型推理在开源同档领先:GPQA 84.3%、AIME 2026 89.2%、MMLU Pro 85.2%。工程型推理:LiveCodeBench v6 80.0%、Codeforces 2150,tau2-bench 均值 76.9%,agent 可用。弱项:HLE 19.5%,长上下文 MRCR v2 128K 66.4%,长程检索一般。

亮点
  1. 1.Apache 2.0 许可,告别 Gemma 自定义条款,可商用闭包
  2. 2.GPQA 84.3%、AIME 2026 89.2%、LiveCodeBench v6 80.0%,Arena 1451 开源前三
  3. 3.256K 上下文 + 图像 / 视频输入 + 函数调用,官方 QAT Q4 版 17.5 GB
  1. 1.head_dim 256,全局层 KV 192 KiB/token,24GB 卡上长上下文比 Gemma 3 更吃紧
  2. 2.HLE 无工具仅 19.5%,前沿知识题距闭源旗舰差距大
  3. 3.31B 不支持音频输入(仅 E2B / E4B 有)
适合:单卡私有化推理助手 · 需要宽松许可的商业产品 · 多语言 / 视觉问答
不适合:前沿知识问答(HLE 类) · 24GB 卡上 100K+ 上下文
基准分数来源日期证据
LMArena Text Elo人类偏好 Elo1451LMArena Text (style control)2026-08-28独立复测
Artificial Analysis Intelligence IndexAA 综合指数30Artificial Analysis Intelligence Index v32026-08-28独立复测
LiveCodeBench竞赛编程80%Gemma 4 官方模型卡2026-08-28厂商公布
GPQA Diamond研究生级科学问答84.3%Gemma 4 官方模型卡2026-08-28厂商公布
Humanity's Last Exam人类最后考试19.5%Gemma 4 官方模型卡2026-08-28厂商公布
τ²-bench工具调用 agent76.9%Gemma 4 官方模型卡2026-08-28厂商公布
MMMU多模态理解76.9%Gemma 4 官方模型卡2026-08-28厂商公布
Artificial Analysis Intelligence IndexAA 综合指数30Artificial Analysis (v4.1.1)2026-08-28独立复测
GPQA Diamond研究生级科学问答85.7%Artificial Analysis (v4.1.1)2026-08-28独立复测
Humanity's Last Exam人类最后考试23.6%Artificial Analysis (v4.1.1)2026-08-28独立复测
SciCode科学计算编程43.4%Artificial Analysis (v4.1.1)2026-08-28独立复测
Terminal-Bench Hard终端 agent(AA 困难子集)36.4%Artificial Analysis (v4.1.1)2026-08-28独立复测
τ²-Bench Telecom工具调用 agent(电信域)59.9%Artificial Analysis (v4.1.1)2026-08-28独立复测
MMMU-Pro多模态理解(Pro)73.4%Artificial Analysis (v4.1.1)2026-08-28独立复测
IFBench指令遵循75.6%Artificial Analysis (v4.1.1)2026-08-28独立复测
Terminal-Bench终端 agent43.4%Artificial Analysis · Terminal-Bench 2.12026-08-28独立复测
τ³-Bench Banking工具调用 agent(银行域)14.8%Artificial Analysis · τ³-Bench Banking2026-08-28独立复测
LMArena Chinese Elo中文人类偏好 Elo1476LMArena Text · Chinese (style control)2026-08-28独立复测

更新 2026-08-28 · 排名供选型参考,基准会饱和、会泄漏、会过时。