Gemma 4 26B A4B
谷歌 Gemma 4 · 26B A4B · Google 谷歌 · 发布 2026-04-02 · 当前代
激活 3.8B 的 MoE,24GB 卡上又快又能装长上下文。
- 类型
- MoE
- 注意力
- 局部滑窗(1024) 24 层:16 Q / 8 KV,head_dim 256;全局 6 层:16 Q / 2 KV,head_dim 512,K=V 共享(5:1 交错)
- 层数
- 30
- 专家
- 128 · 激活 8 + 共享
- 隐藏维
- 2816
- 词表
- 262,144
30 层 = 6 × (5 × 滑窗 + 1 × 全局)。128 路由专家 + 1 共享专家选 8,专家中间维 704,稠密 FFN 2112。全局层 partial_rotary 0.25、theta 1e6;滑窗层 theta 1e4。logit softcap 30。视觉编码器 27 层、hidden 1152、patch 16,每图 280 个 soft token。表内 kv_heads / head_dim 指 6 层全局层。
类型:MoE + 局部/全局交错注意力,25.2B 总参 / 3.8B 激活,原生图像 / 视频输入。
| 项目 | 数值 |
|---|---|
| 层数 | 30 = 6 × (5 × 滑窗 1024 + 1 × 全局) |
| 隐藏维 | 2,816 |
| 稠密 FFN | 2,112 |
| 专家 | 128 路由 + 1 共享,每 token 选 8,专家中间维 704 |
| 滑窗层(24 层) | 16 Q / 8 KV,head_dim 256,theta 1e4 |
| 全局层(6 层) | 16 Q / 2 KV,head_dim 512,K=V 共享,partial_rotary 0.25,theta 1e6 |
| 词表 | 262,144 |
| 上下文 | 262,144 |
| logit softcap | 30 |
| 视觉编码器 | 27 层,hidden 1152,patch 16,280 soft token / 图 |
config.json 中 model_type: gemma4,architectures: Gemma4ForConditionalGeneration。
参考:google/gemma-4-26B-A4B-it config.json 与 Gemma 4 模型卡。
| 精度 | 权重大小 | 说明 |
|---|---|---|
| BF16 | 52 GB | 官方精度 |
| FP8 | 29 GB | |
| Q8 | 27 GB | |
| Q4 | 14 GB | GGUF Q4_K_M 或等效 |
- 消费级 24GB
- 官方 QAT Q4_0 14.4 GB(社区 Q4_K_M 16.9 GB),KV 极小,256K 上下文单并发可行,激活 3.8B 速度快
- 单卡 80GB
- BF16 51.6 GB + 256K 上下文(KV 3 GB)轻松,可多并发
- 8×80GB 节点
- 过剩;用于高并发服务
KV Cache:随长度增长的只有 6 层全局层:2 KV 头 × 512 × K=V 共享 × 2 B = 2 KiB/层 → 12 KiB/token(BF16)。24 层滑窗层窗口 1024,KV 固定约 8 MiB/层。256K 上下文 KV ≈ 3 GB。 ≈ 12 KiB/token
⚠ 能加载 ≠ 能在满上下文 / 高并发下舒服跑。标「估」的数字来自 计算器 公式或社区量化文件大小。
| 精度 | 权重大小 | 参考显存 | 说明 |
|---|---|---|---|
| BF16 | 51.6 GB | 80GB 单卡 | 官方 safetensors,2 分片(含视觉编码器) |
| FP8 | 28.8 GB | 48GB | 社区量化(估) |
| Q8 | 26.9 GB | 48GB | unsloth GGUF Q8_0 |
| Q4 | 14.4 GB | 24GB | 官方 QAT Q4_0 GGUF;unsloth Q4_K_M 16.9 GB |
KV Cache:只有 6 层全局层随长度增长,2 KV 头 × 512 × K=V 共享 × 2 B = 12 KiB/token;24 层滑窗层各固定约 8 MiB。256K 上下文 KV ≈ 3 GB。
参考配置:
- RTX 4090 / 5090 24GB:QAT Q4_0,256K 上下文单并发
- A100 / H100 80GB:BF16 + 256K,多并发
- 8×80GB:高并发服务
警示:MoE 权重全部驻留显存;视频帧 token 会明显增加输入长度。
| 配置 | 量化 | 占用 / 显存 | 解码 tok/s | 预填充 tok/s | 最大上下文 |
|---|---|---|---|---|---|
| 2× RTX 3060 12GB消费级 | Q6_K估 | 23 GB / 24 GB | 126 | 2961 | 123K |
| RTX 4060 Ti 16GB消费级 | Q4_K_M | 16 GB / 16 GB | 81 | 1303 | 34K |
| RTX 3090 24GB消费级 | Q6_K估 | 21 GB / 24 GB | 194 | 4204 | 225K |
| RTX 4070 Ti Super 16GB消费级 | Q4_K_M | 16 GB / 16 GB | 190 | 2605 | 34K |
| RTX 5070 Ti 16GB消费级 | Q4_K_M | 16 GB / 16 GB | 253 | 5211 | 34K |
| RTX 4080 Super 16GB消费级 | Q4_K_M | 16 GB / 16 GB | 208 | 3079 | 34K |
| RTX 5080 16GB消费级 | Q4_K_M | 16 GB / 16 GB | 271 | 6632 | 34K |
| RTX 4090 24GB消费级 | Q6_K估 | 21 GB / 24 GB | 209 | 9770 | 225K |
| RTX 5090 32GB消费级 | FP8 | 30 GB / 32 GB | 303 | 12434 | 341K |
| L4 24GB工作站 | Q6_K估 | 21 GB / 24 GB | 62 | 3553 | 225K |
| RTX A6000 48GB工作站 | FP8 | 30 GB / 48 GB | 130 | 4559 | 3.0M |
| RTX 6000 Ada 48GB工作站 | FP8 | 30 GB / 48 GB | 162 | 5388 | 3.0M |
| L40S 48GB工作站 | FP8 | 30 GB / 48 GB | 146 | 5388 | 3.0M |
| RTX PRO 6000 Blackwell 96GB工作站 | BF16 | 53 GB / 96 GB | 151 | 14803 | 3.6M |
| A10 24GB数据中心 | Q6_K估 | 21 GB / 24 GB | 124 | 3671 | 225K |
| A100 40GB数据中心 | FP8 | 30 GB / 40 GB | 263 | 18474 | 1.7M |
| A100 80GB数据中心 | BF16 | 53 GB / 80 GB | 172 | 18474 | 2.3M |
| H20 96GB数据中心 | BF16 | 53 GB / 96 GB | 338 | 4382 | 3.6M |
| 昇腾 Ascend 910B 64GB数据中心 | BF16 | 53 GB / 64 GB | 135 | 16579 | 956K |
| H100 80GB PCIe数据中心 | BF16 | 53 GB / 80 GB | 169 | 44763 | 2.3M |
| H100 80GB SXM数据中心 | BF16 | 53 GB / 80 GB | 283 | 58559 | 2.3M |
| AMD MI300X 192GB数据中心 | BF16 | 53 GB / 192 GB | 447 | 77388 | 11.6M |
| H200 141GB数据中心 | BF16 | 53 GB / 141 GB | 405 | 58559 | 7.3M |
| B200 192GB数据中心 | BF16 | 53 GB / 192 GB | 675 | 133224 | 11.6M |
| Mac M4 Pro 64GB统一内存 | BF16 | 53 GB / 56 GB | 18 | 1007 | 273K |
| DGX Spark 128GB统一内存 | BF16 | 53 GB / 120 GB | 18 | 3671 | 5.6M |
| Mac M4 Max 128GB统一内存 | BF16 | 53 GB / 120 GB | 35 | 2013 | 5.6M |
| Mac Studio M3 Ultra 256GB统一内存 | BF16 | 53 GB / 240 GB | 53 | 3375 | 15.6M |
| Mac Studio M3 Ultra 512GB统一内存 | BF16 | 53 GB / 490 GB | 53 | 3375 | 36.4M |
单流(batch=1)估算:解码 ≈ 显存带宽 × 效率 ÷ 每 token 读取字节(激活参数 × 量化位宽 + KV);预填充 ≈ FP16 算力 × 0.45 ÷ (2 × 激活参数)。多卡按张量并行、带宽求和 × 0.55。实际受引擎、驱动、PCIe 影响,误差 ±30%。反向查:我的卡能跑谁 →
编程LiveCodeBench v6 77.1、Codeforces Elo 1718(官方模型卡);SWE-bench 未披露。
推理GPQA Diamond 82.3、HLE 8.7(无工具)/ 17.2(带搜索)、BigBench Extra Hard 64.8(官方模型卡)。
数学AIME 2026 88.3(无工具,官方模型卡);AIME 2025 未披露。
知识MMLU Pro 82.6、MMMLU 86.3(官方模型卡)。
Agenttau2-bench 三项均值 68.2(官方模型卡)。
多模态MMMU Pro 73.8、MATH-Vision 82.4、MedXPertQA MM 58.1、OmniDocBench 1.5 0.149(官方模型卡)。
中文140+ 语言训练,MMMLU 86.3;中文独立数据少。
带可选思考模式的 MoE。考试型推理接近 31B(GPQA Diamond 82.3、AIME 2026 88.3、MMLU Pro 82.6、BigBench Extra Hard 64.8),但 HLE 8.7(无工具)/ 17.2(带搜索)和 128K 长上下文检索 44.1 差距大。工程型推理中等:LiveCodeBench v6 77.1、Codeforces 1718、tau2 68.2;官方未给 SWE-bench / Terminal-Bench。多模态推理强:MMMU Pro 73.8、MATH-Vision 82.4。
- 1.Apache-2.0,25.2B 总参 / 3.8B 激活,单卡吞吐远高于 31B Dense
- 2.GPQA 82.3、AIME 2026 88.3、LiveCodeBench v6 77.1,只比 31B 低 2–3 分
- 3.仅 6 层全局注意力且 K=V 共享,KV 12 KiB/token,24GB 卡 Q4 可跑 256K 上下文
- 1.MoE 全部 25B 参数都要进显存,不是 4B 模型的显存需求
- 2.HLE 无工具 8.7、MRCR v2 128K 44.1,知识与长程检索明显弱于 31B
- 3.tau2 均值 68.2、Codeforces 1718,agent / 竞赛代码差距比考试题大;无 SWE-bench 官方数
| 基准 | 分数 | 来源 | 日期 | 证据 |
|---|---|---|---|---|
| LMArena Text Elo人类偏好 Elo | 1438 | LMArena Text (style control) | 2026-08-28 | 独立复测 |
| Artificial Analysis Intelligence IndexAA 综合指数 | 26 | Artificial Analysis Intelligence Index v3 | 2026-08-28 | 独立复测 |
| LiveCodeBench竞赛编程 | 77.1% | Gemma 4 官方模型卡 | 2026-08-28 | 厂商公布 |
| GPQA Diamond研究生级科学问答 | 82.3% | Gemma 4 官方模型卡 | 2026-08-28 | 厂商公布 |
| Humanity's Last Exam人类最后考试 | 8.7% | Gemma 4 官方模型卡 | 2026-08-28 | 厂商公布 |
| τ²-bench工具调用 agent | 68.2% | Gemma 4 官方模型卡 | 2026-08-28 | 厂商公布 |
| MMMU多模态理解 | 73.8% | Gemma 4 官方模型卡 | 2026-08-28 | 厂商公布 |
| Artificial Analysis Intelligence IndexAA 综合指数 | 26 | Artificial Analysis (v4.1.1) | 2026-08-28 | 独立复测 |
| GPQA Diamond研究生级科学问答 | 79.2% | Artificial Analysis (v4.1.1) | 2026-08-28 | 独立复测 |
| Humanity's Last Exam人类最后考试 | 19.3% | Artificial Analysis (v4.1.1) | 2026-08-28 | 独立复测 |
| SciCode科学计算编程 | 40% | Artificial Analysis (v4.1.1) | 2026-08-28 | 独立复测 |
| Terminal-Bench Hard终端 agent(AA 困难子集) | 13.6% | Artificial Analysis (v4.1.1) | 2026-08-28 | 独立复测 |
| τ²-Bench Telecom工具调用 agent(电信域) | 43.6% | Artificial Analysis (v4.1.1) | 2026-08-28 | 独立复测 |
| MMMU-Pro多模态理解(Pro) | 69.2% | Artificial Analysis (v4.1.1) | 2026-08-28 | 独立复测 |
| IFBench指令遵循 | 72.4% | Artificial Analysis (v4.1.1) | 2026-08-28 | 独立复测 |
| Terminal-Bench终端 agent | 39% | Artificial Analysis · Terminal-Bench 2.1 | 2026-08-28 | 独立复测 |
| τ³-Bench Banking工具调用 agent(银行域) | 12% | Artificial Analysis · τ³-Bench Banking | 2026-08-28 | 独立复测 |
| LMArena Chinese Elo中文人类偏好 Elo | 1481 | LMArena Text · Chinese (style control) | 2026-08-28 | 独立复测 |
更新 2026-08-28 · 排名供选型参考,基准会饱和、会泄漏、会过时。