Gemma 2 27B
Gemma 2 · 27B · Google · 发布 2024-06-27 · 已被替代 → Gemma 3 27B
27B 打到 70B 级对话质量,单卡 24GB 的甜点。
- 类型
- Dense
- 注意力
- GQA(32 Q 头 / 16 KV 头);局部 4K 滑窗与全局注意力逐层交替
- 层数
- 46
- 隐藏维
- 4608
- 词表
- 256,000
13T token;logit soft-capping;上下文 8K;从零训练(非蒸馏,9B 才是蒸馏)。
类型:Dense Transformer,27.2B 参数。
- 46 层,隐藏维 4608,FFN 36,864(GeGLU),词表 256,000
- GQA:32 Query 头 / 16 KV 头,head_dim 128
- 局部滑窗(4096)与全局注意力逐层交替
- Logit soft-capping(attn 50 / final 30),RMSNorm 前后双归一化
- 上下文 8192
参考:Gemma 2 技术报告(arXiv 2408.00118)。
| 精度 | 权重大小 | 说明 |
|---|---|---|
| BF16 | 54 GB | 官方精度 |
| FP8 | — | 暂无 |
| Q8 | 29 GB | |
| Q4 | 17 GB | GGUF Q4_K_M 或等效 |
- 消费级 24GB
- Q4_K_M 16.6 GB,RTX 4090 可跑满 8K 上下文
- 单卡 80GB
- BF16 54.4 GB 单卡
- 8×80GB 节点
- 过剩
KV Cache:16×128×2×46×2 B = 368 KiB/token(一半层为 4K 滑窗,长文实际更小);8K 上限约 2.9 GB。 ≈ 368 KiB/token
⚠ 能加载 ≠ 能在满上下文 / 高并发下舒服跑。标「估」的数字来自 计算器 公式或社区量化文件大小。
| 精度 | 权重大小 | 参考硬件 | 说明 |
|---|---|---|---|
| BF16 | 54.4 GB | 80GB 单卡 | 官方 safetensors |
| Q8 | ≈ 28.9 GB | 32GB / 48GB | GGUF Q8_0 |
| Q4 | 16.6 GB | 24GB | GGUF Q4_K_M(bartowski) |
KV Cache:368 KiB/token(全局层),滑窗层封顶 4K。8K 上下文最多约 2.9 GB。
参考配置:
- RTX 4090 24GB:Q4_K_M + 8K 全上下文,余量充足
- A100 80GB:BF16,多并发
- 注意:soft-capping 要求 eager attention 或 flash-attn ≥ 2.6,早期 vLLM 需 flashinfer
| 配置 | 量化 | 占用 / 显存 | 解码 tok/s | 预填充 tok/s | 最大上下文 |
|---|---|---|---|---|---|
| 2× RTX 3060 12GB消费级 | Q4_K_M | 22 GB / 24 GB | 21 | 414 | 14K |
| 2× RTX 4060 Ti 16GB消费级 | FP8估 | 31 GB / 32 GB | 11 | 364 | 13K |
| RTX 3090 24GB消费级 | Q5_K_M估 | 23 GB / 24 GB | 28 | 587 | 11K |
| 2× RTX 4070 Ti Super 16GB消费级 | FP8估 | 31 GB / 32 GB | 26 | 728 | 13K |
| 2× RTX 5070 Ti 16GB消费级 | FP8估 | 31 GB / 32 GB | 34 | 1456 | 13K |
| 2× RTX 4080 Super 16GB消费级 | FP8估 | 31 GB / 32 GB | 28 | 860 | 13K |
| 2× RTX 5080 16GB消费级 | FP8估 | 31 GB / 32 GB | 37 | 1853 | 13K |
| RTX 4090 24GB消费级 | Q5_K_M估 | 23 GB / 24 GB | 30 | 1365 | 11K |
| RTX 5090 32GB消费级 | FP8估 | 30 GB / 32 GB | 41 | 1737 | 20K |
| L4 24GB工作站 | Q5_K_M估 | 23 GB / 24 GB | 8.9 | 496 | 11K |
| RTX A6000 48GB工作站 | FP8估 | 30 GB / 48 GB | 17 | 637 | 109K |
| RTX 6000 Ada 48GB工作站 | FP8估 | 30 GB / 48 GB | 22 | 753 | 109K |
| L40S 48GB工作站 | FP8估 | 30 GB / 48 GB | 20 | 753 | 109K |
| RTX PRO 6000 Blackwell 96GB工作站 | BF16 | 58 GB / 96 GB | 20 | 2068 | 112K |
| A10 24GB数据中心 | Q5_K_M估 | 23 GB / 24 GB | 18 | 513 | 11K |
| A100 40GB数据中心 | FP8估 | 30 GB / 40 GB | 35 | 2581 | 65K |
| A100 80GB数据中心 | BF16 | 58 GB / 80 GB | 23 | 2581 | 68K |
| H20 96GB数据中心 | BF16 | 58 GB / 96 GB | 45 | 612 | 112K |
| 昇腾 Ascend 910B 64GB数据中心 | BF16 | 58 GB / 64 GB | 18 | 2316 | 23K |
| H100 80GB PCIe数据中心 | BF16 | 58 GB / 80 GB | 23 | 6254 | 68K |
| H100 80GB SXM数据中心 | BF16 | 58 GB / 80 GB | 38 | 8181 | 68K |
| AMD MI300X 192GB数据中心 | BF16 | 58 GB / 192 GB | 60 | 10812 | 380K |
| H200 141GB数据中心 | BF16 | 58 GB / 141 GB | 54 | 8181 | 238K |
| B200 192GB数据中心 | BF16 | 58 GB / 192 GB | 90 | 18612 | 380K |
| Mac M4 Pro 64GB统一内存 | FP8估 | 30 GB / 56 GB | 4.7 | 141 | 154K |
| DGX Spark 128GB统一内存 | BF16 | 58 GB / 120 GB | 2.4 | 513 | 179K |
| Mac M4 Max 128GB统一内存 | BF16 | 58 GB / 120 GB | 4.7 | 281 | 179K |
| Mac Studio M3 Ultra 256GB统一内存 | BF16 | 58 GB / 240 GB | 7.1 | 472 | 513K |
| Mac Studio M3 Ultra 512GB统一内存 | BF16 | 58 GB / 490 GB | 7.1 | 472 | 1.2M |
单流(batch=1)估算:解码 ≈ 显存带宽 × 效率 ÷ 每 token 读取字节(激活参数 × 量化位宽 + KV);预填充 ≈ FP16 算力 × 0.45 ÷ (2 × 激活参数)。多卡按张量并行、带宽求和 × 0.55。实际受引擎、驱动、PCIe 影响,误差 ±30%。反向查:我的卡能跑谁 →
编程HumanEval 51.8%(官方基座)。
数学GSM8K 74.0%、MATH 42.3%(官方基座)。
知识MMLU 75.2%(官方基座)。
中文中文可用,弱于 Qwen。
非推理模型中游偏上:MMLU 75.2%、GSM8K 74.0%、MATH 42.3%(官方基座)。对话与写作优秀,数学 / 代码明显不及 Qwen2.5-32B。
- 1.Arena 一度超过 Llama 3 70B,同尺寸对话质量当年第一
- 2.Q4 16.6 GB 单张 24GB 卡跑满上下文
- 3.多语言与写作风格好,官方 TPU / GPU 全支持
- 1.上下文仅 8K,是最大硬伤
- 2.无 system prompt、无原生工具调用
- 3.Gemma Terms 含禁用政策,非 OSI 许可
暂无带来源的分数。
更新 2026-08-28 · 排名供选型参考,基准会饱和、会泄漏、会过时。