开源权重可下单卡可跑已被替代限制许可 · Gemma Terms of Use
Gemma 2 9B
Gemma 2 · 9B · Google · 发布 2024-06-27 · 已被替代 → Gemma 4 26B A4B
蒸馏出的 9B,对话质量一度超过 Llama 3 8B。
参数
9.2B
DENSE
上下文
8K
价格 / 1M tok
自建
无官方 API
最低可跑
RTX 3060
FP8 · 12 GB · ≈22 tok/s
Arena Elo—
AA 综合指数—
代码—
GPQA 推理—
架构简图
- 类型
- Dense
- 注意力
- GQA(16 Q 头 / 8 KV 头);4K 滑窗交替
- 层数
- 42
- 隐藏维
- 3584
- 词表
- 256,000
8T token,由 27B 蒸馏;上下文 8K。
完善中
| 精度 | 权重大小 | 说明 |
|---|---|---|
| BF16 | 18 GB | 官方精度 |
| FP8 | — | 暂无 |
| Q8 | 9.8 GB | |
| Q4 | 5.8 GB | GGUF Q4_K_M 或等效 |
- 消费级 24GB
- BF16 18.4 GB 单卡可跑
- 单卡 80GB
- 高并发
- 8×80GB 节点
- 过剩
KV Cache:8×256×2×42×2 B = 336 KiB/token。 ≈ 336 KiB/token
⚠ 能加载 ≠ 能在满上下文 / 高并发下舒服跑。标「估」的数字来自 计算器 公式或社区量化文件大小。
完善中
硬件配置与预估吞吐
最低可跑(8K 上下文)
RTX 3060 12GB
≈¥2,000 · 合计 ≈¥2,000 · 消费级
量化
FP8
解码
22 tok/s
最大上下文
10K
推荐配置(≥Q8 · 32K 上下文 · ≥15 tok/s)
2 × RTX 3060 12GB
≈¥2,000 × 2 · 合计 ≈¥4,000 · 消费级
量化
FP8
解码
27 tok/s
最大上下文
76K
| 配置 | 量化 | 占用 / 显存 | 解码 tok/s | 预填充 tok/s | 最大上下文 |
|---|---|---|---|---|---|
| RTX 3060 12GB消费级 | FP8估 | 12 GB / 12 GB | 22 | 611 | 10K |
| RTX 4060 Ti 16GB消费级 | FP8估 | 12 GB / 16 GB | 18 | 538 | 34K |
| RTX 3090 24GB消费级 | BF16 | 22 GB / 24 GB | 29 | 1736 | 13K |
| RTX 4070 Ti Super 16GB消费级 | FP8估 | 12 GB / 16 GB | 41 | 1076 | 34K |
| RTX 5070 Ti 16GB消费级 | FP8估 | 12 GB / 16 GB | 55 | 2152 | 34K |
| RTX 4080 Super 16GB消费级 | FP8估 | 12 GB / 16 GB | 45 | 1272 | 34K |
| RTX 5080 16GB消费级 | FP8估 | 12 GB / 16 GB | 59 | 2739 | 34K |
| RTX 4090 24GB消费级 | BF16 | 22 GB / 24 GB | 31 | 4035 | 13K |
| RTX 5090 32GB消费级 | BF16 | 22 GB / 32 GB | 55 | 5136 | 38K |
| L4 24GB工作站 | BF16 | 22 GB / 24 GB | 9.2 | 1467 | 13K |
| RTX A6000 48GB工作站 | BF16 | 22 GB / 48 GB | 24 | 1883 | 87K |
| RTX 6000 Ada 48GB工作站 | BF16 | 22 GB / 48 GB | 29 | 2226 | 87K |
| L40S 48GB工作站 | BF16 | 22 GB / 48 GB | 26 | 2226 | 87K |
| RTX PRO 6000 Blackwell 96GB工作站 | BF16 | 22 GB / 96 GB | 55 | 6114 | 233K |
| A10 24GB数据中心 | BF16 | 22 GB / 24 GB | 18 | 1516 | 13K |
| A100 40GB数据中心 | BF16 | 22 GB / 40 GB | 48 | 7630 | 62K |
| A100 80GB数据中心 | BF16 | 22 GB / 80 GB | 62 | 7630 | 184K |
| H20 96GB数据中心 | BF16 | 22 GB / 96 GB | 123 | 1810 | 233K |
| 昇腾 Ascend 910B 64GB数据中心 | BF16 | 22 GB / 64 GB | 49 | 6848 | 135K |
| H100 80GB PCIe数据中心 | BF16 | 22 GB / 80 GB | 61 | 18489 | 184K |
| H100 80GB SXM数据中心 | BF16 | 22 GB / 80 GB | 103 | 24188 | 184K |
| AMD MI300X 192GB数据中心 | BF16 | 22 GB / 192 GB | 162 | 31965 | 525K |
| H200 141GB数据中心 | BF16 | 22 GB / 141 GB | 147 | 24188 | 370K |
| B200 192GB数据中心 | BF16 | 22 GB / 192 GB | 245 | 55027 | 525K |
| Mac M4 Pro 64GB统一内存 | BF16 | 22 GB / 56 GB | 6.4 | 416 | 111K |
| DGX Spark 128GB统一内存 | BF16 | 22 GB / 120 GB | 6.4 | 1516 | 306K |
| Mac M4 Max 128GB统一内存 | BF16 | 22 GB / 120 GB | 13 | 832 | 306K |
| Mac Studio M3 Ultra 256GB统一内存 | BF16 | 22 GB / 240 GB | 19 | 1394 | 672K |
| Mac Studio M3 Ultra 512GB统一内存 | BF16 | 22 GB / 490 GB | 19 | 1394 | 1.4M |
单流(batch=1)估算:解码 ≈ 显存带宽 × 效率 ÷ 每 token 读取字节(激活参数 × 量化位宽 + KV);预填充 ≈ FP16 算力 × 0.45 ÷ (2 × 激活参数)。多卡按张量并行、带宽求和 × 0.55。实际受引擎、驱动、PCIe 影响,误差 ±30%。反向查:我的卡能跑谁 →
可用维度不足 3 个,不绘制雷达图
数学GSM8K 68.6%(官方基座)。
知识MMLU 71.3%(官方基座)。
逻辑能力
9B 中上:MMLU 71.3%、GSM8K 68.6%(官方基座)。
亮点
- 1.知识蒸馏使 9B 逼近 27B 的一半以上能力
- 2.Q4 5.8 GB,笔记本可跑
- 3.多语言与写作优秀
坑
- 1.上下文 8K
- 2.无工具调用 / system prompt
- 3.Gemma Terms 非 OSI 许可
适合:轻量多语言对话 · 教学
不适合:长文本 · 代码
暂无带来源的分数。
更新 2026-08-28 · 排名供选型参考,基准会饱和、会泄漏、会过时。