开源权重可下推理模型·可关多模态单卡可跑可商用 · Apache-2.0
Google logo

Gemma 4 26B A4B

谷歌 Gemma 4 · 26B A4B · Google 谷歌 · 发布 2026-04-02 · 当前代

激活 3.8B 的 MoE,24GB 卡上又快又能装长上下文。

参数
25.2B 总 / 3.8B 激活
MOE
上下文
256K
输出 32K
价格 / 1M tok
免费层
Google AI 定价页( · 2026-08-28
最低可跑
RTX 4060 Ti
Q4_K_M · 16 GB · ≈81 tok/s
Arena Elo1438
2026-08-28
AA 综合指数26
2026-08-28
竞赛编程77.1
2026-08-28
GPQA 推理79.2
2026-08-28
类型
MoE
注意力
局部滑窗(1024) 24 层:16 Q / 8 KV,head_dim 256;全局 6 层:16 Q / 2 KV,head_dim 512,K=V 共享(5:1 交错)
层数
30
专家
128 · 激活 8 + 共享
隐藏维
2816
词表
262,144

30 层 = 6 × (5 × 滑窗 + 1 × 全局)。128 路由专家 + 1 共享专家选 8,专家中间维 704,稠密 FFN 2112。全局层 partial_rotary 0.25、theta 1e6;滑窗层 theta 1e4。logit softcap 30。视觉编码器 27 层、hidden 1152、patch 16,每图 280 个 soft token。表内 kv_heads / head_dim 指 6 层全局层。

类型:MoE + 局部/全局交错注意力,25.2B 总参 / 3.8B 激活,原生图像 / 视频输入。

项目数值
层数30 = 6 × (5 × 滑窗 1024 + 1 × 全局)
隐藏维2,816
稠密 FFN2,112
专家128 路由 + 1 共享,每 token 选 8,专家中间维 704
滑窗层(24 层)16 Q / 8 KV,head_dim 256,theta 1e4
全局层(6 层)16 Q / 2 KV,head_dim 512,K=V 共享,partial_rotary 0.25,theta 1e6
词表262,144
上下文262,144
logit softcap30
视觉编码器27 层,hidden 1152,patch 16,280 soft token / 图

config.jsonmodel_type: gemma4architectures: Gemma4ForConditionalGeneration

参考:google/gemma-4-26B-A4B-it config.json 与 Gemma 4 模型卡。

Token Embedding词表 262,144× 30 层(6 层全注意力)注意力:局部滑窗(1024) 24 层:16 Q / 8 KV,head_dim 256;全局 6 层:16 Q / 2 KV,head_dim 512,K=V 共享KV 头 2 · head_dim 512路由top-8E1E2E3共享专家128 专家 · 激活 8 · d=2816LM Head25.2B / 3.8B 激活实线 = 已公开 · 虚线 = 未披露
精度权重大小说明
BF1652 GB官方精度
FP829 GB
Q827 GB
Q414 GBGGUF Q4_K_M 或等效
消费级 24GB
官方 QAT Q4_0 14.4 GB(社区 Q4_K_M 16.9 GB),KV 极小,256K 上下文单并发可行,激活 3.8B 速度快
单卡 80GB
BF16 51.6 GB + 256K 上下文(KV 3 GB)轻松,可多并发
8×80GB 节点
过剩;用于高并发服务

KV Cache:随长度增长的只有 6 层全局层:2 KV 头 × 512 × K=V 共享 × 2 B = 2 KiB/层 → 12 KiB/token(BF16)。24 层滑窗层窗口 1024,KV 固定约 8 MiB/层。256K 上下文 KV ≈ 3 GB。12 KiB/token

⚠ 能加载 ≠ 能在满上下文 / 高并发下舒服跑。标「估」的数字来自 计算器 公式或社区量化文件大小。

精度权重大小参考显存说明
BF1651.6 GB80GB 单卡官方 safetensors,2 分片(含视觉编码器)
FP828.8 GB48GB社区量化(估)
Q826.9 GB48GBunsloth GGUF Q8_0
Q414.4 GB24GB官方 QAT Q4_0 GGUF;unsloth Q4_K_M 16.9 GB

KV Cache:只有 6 层全局层随长度增长,2 KV 头 × 512 × K=V 共享 × 2 B = 12 KiB/token;24 层滑窗层各固定约 8 MiB。256K 上下文 KV ≈ 3 GB。

参考配置

  • RTX 4090 / 5090 24GB:QAT Q4_0,256K 上下文单并发
  • A100 / H100 80GB:BF16 + 256K,多并发
  • 8×80GB:高并发服务

警示:MoE 权重全部驻留显存;视频帧 token 会明显增加输入长度。

硬件配置与预估吞吐
最低可跑(8K 上下文)
RTX 4060 Ti 16GB
≈¥3,500 · 合计 ≈¥3,500 · 消费级
量化
Q4_K_M
解码
81 tok/s
最大上下文
34K
推荐配置(≥Q8 · 32K 上下文 · ≥15 tok/s)
RTX 5090 32GB
≈¥16,000 · 合计 ≈¥16,000 · 消费级
量化
FP8
解码
291 tok/s
最大上下文
341K
配置量化占用 / 显存解码 tok/s预填充 tok/s最大上下文
2× RTX 3060 12GB消费级Q6_K23 GB / 24 GB1262961123K
RTX 4060 Ti 16GB消费级Q4_K_M16 GB / 16 GB81130334K
RTX 3090 24GB消费级Q6_K21 GB / 24 GB1944204225K
RTX 4070 Ti Super 16GB消费级Q4_K_M16 GB / 16 GB190260534K
RTX 5070 Ti 16GB消费级Q4_K_M16 GB / 16 GB253521134K
RTX 4080 Super 16GB消费级Q4_K_M16 GB / 16 GB208307934K
RTX 5080 16GB消费级Q4_K_M16 GB / 16 GB271663234K
RTX 4090 24GB消费级Q6_K21 GB / 24 GB2099770225K
RTX 5090 32GB消费级FP830 GB / 32 GB30312434341K
L4 24GB工作站Q6_K21 GB / 24 GB623553225K
RTX A6000 48GB工作站FP830 GB / 48 GB13045593.0M
RTX 6000 Ada 48GB工作站FP830 GB / 48 GB16253883.0M
L40S 48GB工作站FP830 GB / 48 GB14653883.0M
RTX PRO 6000 Blackwell 96GB工作站BF1653 GB / 96 GB151148033.6M
A10 24GB数据中心Q6_K21 GB / 24 GB1243671225K
A100 40GB数据中心FP830 GB / 40 GB263184741.7M
A100 80GB数据中心BF1653 GB / 80 GB172184742.3M
H20 96GB数据中心BF1653 GB / 96 GB33843823.6M
昇腾 Ascend 910B 64GB数据中心BF1653 GB / 64 GB13516579956K
H100 80GB PCIe数据中心BF1653 GB / 80 GB169447632.3M
H100 80GB SXM数据中心BF1653 GB / 80 GB283585592.3M
AMD MI300X 192GB数据中心BF1653 GB / 192 GB4477738811.6M
H200 141GB数据中心BF1653 GB / 141 GB405585597.3M
B200 192GB数据中心BF1653 GB / 192 GB67513322411.6M
Mac M4 Pro 64GB统一内存BF1653 GB / 56 GB181007273K
DGX Spark 128GB统一内存BF1653 GB / 120 GB1836715.6M
Mac M4 Max 128GB统一内存BF1653 GB / 120 GB3520135.6M
Mac Studio M3 Ultra 256GB统一内存BF1653 GB / 240 GB53337515.6M
Mac Studio M3 Ultra 512GB统一内存BF1653 GB / 490 GB53337536.4M

单流(batch=1)估算:解码 ≈ 显存带宽 × 效率 ÷ 每 token 读取字节(激活参数 × 量化位宽 + KV);预填充 ≈ FP16 算力 × 0.45 ÷ (2 × 激活参数)。多卡按张量并行、带宽求和 × 0.55。实际受引擎、驱动、PCIe 影响,误差 ±30%。反向查:我的卡能跑谁 →

用计算器按你的上下文与并发估算 →

编程LiveCodeBench v6 77.1、Codeforces Elo 1718(官方模型卡);SWE-bench 未披露。

推理GPQA Diamond 82.3、HLE 8.7(无工具)/ 17.2(带搜索)、BigBench Extra Hard 64.8(官方模型卡)。

数学AIME 2026 88.3(无工具,官方模型卡);AIME 2025 未披露。

知识MMLU Pro 82.6、MMMLU 86.3(官方模型卡)。

Agenttau2-bench 三项均值 68.2(官方模型卡)。

多模态MMMU Pro 73.8、MATH-Vision 82.4、MedXPertQA MM 58.1、OmniDocBench 1.5 0.149(官方模型卡)。

中文140+ 语言训练,MMMLU 86.3;中文独立数据少。

逻辑能力

带可选思考模式的 MoE。考试型推理接近 31B(GPQA Diamond 82.3、AIME 2026 88.3、MMLU Pro 82.6、BigBench Extra Hard 64.8),但 HLE 8.7(无工具)/ 17.2(带搜索)和 128K 长上下文检索 44.1 差距大。工程型推理中等:LiveCodeBench v6 77.1、Codeforces 1718、tau2 68.2;官方未给 SWE-bench / Terminal-Bench。多模态推理强:MMMU Pro 73.8、MATH-Vision 82.4。

亮点
  1. 1.Apache-2.0,25.2B 总参 / 3.8B 激活,单卡吞吐远高于 31B Dense
  2. 2.GPQA 82.3、AIME 2026 88.3、LiveCodeBench v6 77.1,只比 31B 低 2–3 分
  3. 3.仅 6 层全局注意力且 K=V 共享,KV 12 KiB/token,24GB 卡 Q4 可跑 256K 上下文
  1. 1.MoE 全部 25B 参数都要进显存,不是 4B 模型的显存需求
  2. 2.HLE 无工具 8.7、MRCR v2 128K 44.1,知识与长程检索明显弱于 31B
  3. 3.tau2 均值 68.2、Codeforces 1718,agent / 竞赛代码差距比考试题大;无 SWE-bench 官方数
适合:单卡高吞吐本地助手 · 边缘服务器批处理 · 需要宽松许可的低成本产品
不适合:前沿知识问答 · 复杂长程 agent
基准分数来源日期证据
LMArena Text Elo人类偏好 Elo1438LMArena Text (style control)2026-08-28独立复测
Artificial Analysis Intelligence IndexAA 综合指数26Artificial Analysis Intelligence Index v32026-08-28独立复测
LiveCodeBench竞赛编程77.1%Gemma 4 官方模型卡2026-08-28厂商公布
GPQA Diamond研究生级科学问答82.3%Gemma 4 官方模型卡2026-08-28厂商公布
Humanity's Last Exam人类最后考试8.7%Gemma 4 官方模型卡2026-08-28厂商公布
τ²-bench工具调用 agent68.2%Gemma 4 官方模型卡2026-08-28厂商公布
MMMU多模态理解73.8%Gemma 4 官方模型卡2026-08-28厂商公布
Artificial Analysis Intelligence IndexAA 综合指数26Artificial Analysis (v4.1.1)2026-08-28独立复测
GPQA Diamond研究生级科学问答79.2%Artificial Analysis (v4.1.1)2026-08-28独立复测
Humanity's Last Exam人类最后考试19.3%Artificial Analysis (v4.1.1)2026-08-28独立复测
SciCode科学计算编程40%Artificial Analysis (v4.1.1)2026-08-28独立复测
Terminal-Bench Hard终端 agent(AA 困难子集)13.6%Artificial Analysis (v4.1.1)2026-08-28独立复测
τ²-Bench Telecom工具调用 agent(电信域)43.6%Artificial Analysis (v4.1.1)2026-08-28独立复测
MMMU-Pro多模态理解(Pro)69.2%Artificial Analysis (v4.1.1)2026-08-28独立复测
IFBench指令遵循72.4%Artificial Analysis (v4.1.1)2026-08-28独立复测
Terminal-Bench终端 agent39%Artificial Analysis · Terminal-Bench 2.12026-08-28独立复测
τ³-Bench Banking工具调用 agent(银行域)12%Artificial Analysis · τ³-Bench Banking2026-08-28独立复测
LMArena Chinese Elo中文人类偏好 Elo1481LMArena Text · Chinese (style control)2026-08-28独立复测

更新 2026-08-28 · 排名供选型参考,基准会饱和、会泄漏、会过时。