开源权重可下单卡可跑已被替代限制许可 · Gemma Terms of Use
Google logo

Gemma 2 9B

Gemma 2 · 9B · Google · 发布 2024-06-27 · 已被替代Gemma 4 26B A4B

蒸馏出的 9B,对话质量一度超过 Llama 3 8B。

参数
9.2B
DENSE
上下文
8K
价格 / 1M tok
自建
无官方 API
最低可跑
RTX 3060
FP8 · 12 GB · ≈22 tok/s
Arena Elo
AA 综合指数
代码
GPQA 推理
类型
Dense
注意力
GQA(16 Q 头 / 8 KV 头);4K 滑窗交替
层数
42
隐藏维
3584
词表
256,000

8T token,由 27B 蒸馏;上下文 8K。

完善中

Token Embedding词表 256,000× 42 层注意力:GQAKV 头 8 · head_dim 256Dense FFN隐藏维 3584Dense:每个 token 经过全部参数LM Head9.2B实线 = 已公开 · 虚线 = 未披露
精度权重大小说明
BF1618 GB官方精度
FP8暂无
Q89.8 GB
Q45.8 GBGGUF Q4_K_M 或等效
消费级 24GB
BF16 18.4 GB 单卡可跑
单卡 80GB
高并发
8×80GB 节点
过剩

KV Cache:8×256×2×42×2 B = 336 KiB/token。336 KiB/token

⚠ 能加载 ≠ 能在满上下文 / 高并发下舒服跑。标「估」的数字来自 计算器 公式或社区量化文件大小。

完善中

硬件配置与预估吞吐
最低可跑(8K 上下文)
RTX 3060 12GB
≈¥2,000 · 合计 ≈¥2,000 · 消费级
量化
FP8
解码
22 tok/s
最大上下文
10K
推荐配置(≥Q8 · 32K 上下文 · ≥15 tok/s)
2 × RTX 3060 12GB
≈¥2,000 × 2 · 合计 ≈¥4,000 · 消费级
量化
FP8
解码
27 tok/s
最大上下文
76K
配置量化占用 / 显存解码 tok/s预填充 tok/s最大上下文
RTX 3060 12GB消费级FP812 GB / 12 GB2261110K
RTX 4060 Ti 16GB消费级FP812 GB / 16 GB1853834K
RTX 3090 24GB消费级BF1622 GB / 24 GB29173613K
RTX 4070 Ti Super 16GB消费级FP812 GB / 16 GB41107634K
RTX 5070 Ti 16GB消费级FP812 GB / 16 GB55215234K
RTX 4080 Super 16GB消费级FP812 GB / 16 GB45127234K
RTX 5080 16GB消费级FP812 GB / 16 GB59273934K
RTX 4090 24GB消费级BF1622 GB / 24 GB31403513K
RTX 5090 32GB消费级BF1622 GB / 32 GB55513638K
L4 24GB工作站BF1622 GB / 24 GB9.2146713K
RTX A6000 48GB工作站BF1622 GB / 48 GB24188387K
RTX 6000 Ada 48GB工作站BF1622 GB / 48 GB29222687K
L40S 48GB工作站BF1622 GB / 48 GB26222687K
RTX PRO 6000 Blackwell 96GB工作站BF1622 GB / 96 GB556114233K
A10 24GB数据中心BF1622 GB / 24 GB18151613K
A100 40GB数据中心BF1622 GB / 40 GB48763062K
A100 80GB数据中心BF1622 GB / 80 GB627630184K
H20 96GB数据中心BF1622 GB / 96 GB1231810233K
昇腾 Ascend 910B 64GB数据中心BF1622 GB / 64 GB496848135K
H100 80GB PCIe数据中心BF1622 GB / 80 GB6118489184K
H100 80GB SXM数据中心BF1622 GB / 80 GB10324188184K
AMD MI300X 192GB数据中心BF1622 GB / 192 GB16231965525K
H200 141GB数据中心BF1622 GB / 141 GB14724188370K
B200 192GB数据中心BF1622 GB / 192 GB24555027525K
Mac M4 Pro 64GB统一内存BF1622 GB / 56 GB6.4416111K
DGX Spark 128GB统一内存BF1622 GB / 120 GB6.41516306K
Mac M4 Max 128GB统一内存BF1622 GB / 120 GB13832306K
Mac Studio M3 Ultra 256GB统一内存BF1622 GB / 240 GB191394672K
Mac Studio M3 Ultra 512GB统一内存BF1622 GB / 490 GB1913941.4M

单流(batch=1)估算:解码 ≈ 显存带宽 × 效率 ÷ 每 token 读取字节(激活参数 × 量化位宽 + KV);预填充 ≈ FP16 算力 × 0.45 ÷ (2 × 激活参数)。多卡按张量并行、带宽求和 × 0.55。实际受引擎、驱动、PCIe 影响,误差 ±30%。反向查:我的卡能跑谁 →

用计算器按你的上下文与并发估算 →
可用维度不足 3 个,不绘制雷达图

数学GSM8K 68.6%(官方基座)。

知识MMLU 71.3%(官方基座)。

逻辑能力

9B 中上:MMLU 71.3%、GSM8K 68.6%(官方基座)。

亮点
  1. 1.知识蒸馏使 9B 逼近 27B 的一半以上能力
  2. 2.Q4 5.8 GB,笔记本可跑
  3. 3.多语言与写作优秀
  1. 1.上下文 8K
  2. 2.无工具调用 / system prompt
  3. 3.Gemma Terms 非 OSI 许可
适合:轻量多语言对话 · 教学
不适合:长文本 · 代码

暂无带来源的分数。

更新 2026-08-28 · 排名供选型参考,基准会饱和、会泄漏、会过时。