开源权重可下单卡可跑已被替代限制许可 · Gemma Terms of Use
Google logo

Gemma 2 27B

Gemma 2 · 27B · Google · 发布 2024-06-27 · 已被替代Gemma 3 27B

27B 打到 70B 级对话质量,单卡 24GB 的甜点。

参数
27.2B
DENSE
上下文
8K
价格 / 1M tok
自建
无官方 API
最低可跑
2× RTX 3060
Q4_K_M · 22 GB · ≈21 tok/s
Arena Elo
AA 综合指数
代码
GPQA 推理
类型
Dense
注意力
GQA(32 Q 头 / 16 KV 头);局部 4K 滑窗与全局注意力逐层交替
层数
46
隐藏维
4608
词表
256,000

13T token;logit soft-capping;上下文 8K;从零训练(非蒸馏,9B 才是蒸馏)。

类型:Dense Transformer,27.2B 参数。

  • 46 层,隐藏维 4608,FFN 36,864(GeGLU),词表 256,000
  • GQA:32 Query 头 / 16 KV 头,head_dim 128
  • 局部滑窗(4096)与全局注意力逐层交替
  • Logit soft-capping(attn 50 / final 30),RMSNorm 前后双归一化
  • 上下文 8192

参考:Gemma 2 技术报告(arXiv 2408.00118)。

Token Embedding词表 256,000× 46 层注意力:GQAKV 头 16 · head_dim 128Dense FFN隐藏维 4608Dense:每个 token 经过全部参数LM Head27.2B实线 = 已公开 · 虚线 = 未披露
精度权重大小说明
BF1654 GB官方精度
FP8暂无
Q829 GB
Q417 GBGGUF Q4_K_M 或等效
消费级 24GB
Q4_K_M 16.6 GB,RTX 4090 可跑满 8K 上下文
单卡 80GB
BF16 54.4 GB 单卡
8×80GB 节点
过剩

KV Cache:16×128×2×46×2 B = 368 KiB/token(一半层为 4K 滑窗,长文实际更小);8K 上限约 2.9 GB。368 KiB/token

⚠ 能加载 ≠ 能在满上下文 / 高并发下舒服跑。标「估」的数字来自 计算器 公式或社区量化文件大小。

精度权重大小参考硬件说明
BF1654.4 GB80GB 单卡官方 safetensors
Q8≈ 28.9 GB32GB / 48GBGGUF Q8_0
Q416.6 GB24GBGGUF Q4_K_M(bartowski)

KV Cache:368 KiB/token(全局层),滑窗层封顶 4K。8K 上下文最多约 2.9 GB。

参考配置

  • RTX 4090 24GB:Q4_K_M + 8K 全上下文,余量充足
  • A100 80GB:BF16,多并发
  • 注意:soft-capping 要求 eager attention 或 flash-attn ≥ 2.6,早期 vLLM 需 flashinfer
硬件配置与预估吞吐
最低可跑(8K 上下文)
2 × RTX 3060 12GB
≈¥2,000 × 2 · 合计 ≈¥4,000 · 消费级
量化
Q4_K_M
解码
21 tok/s
最大上下文
14K
推荐配置(≥Q8 · 32K 上下文 · ≥15 tok/s)
2 × RTX 3090 24GB
二手 ≈¥5,000 × 2 · 合计 ≈¥10,000 · 消费级
量化
FP8
解码
31 tok/s
最大上下文
102K
配置量化占用 / 显存解码 tok/s预填充 tok/s最大上下文
2× RTX 3060 12GB消费级Q4_K_M22 GB / 24 GB2141414K
2× RTX 4060 Ti 16GB消费级FP831 GB / 32 GB1136413K
RTX 3090 24GB消费级Q5_K_M23 GB / 24 GB2858711K
2× RTX 4070 Ti Super 16GB消费级FP831 GB / 32 GB2672813K
2× RTX 5070 Ti 16GB消费级FP831 GB / 32 GB34145613K
2× RTX 4080 Super 16GB消费级FP831 GB / 32 GB2886013K
2× RTX 5080 16GB消费级FP831 GB / 32 GB37185313K
RTX 4090 24GB消费级Q5_K_M23 GB / 24 GB30136511K
RTX 5090 32GB消费级FP830 GB / 32 GB41173720K
L4 24GB工作站Q5_K_M23 GB / 24 GB8.949611K
RTX A6000 48GB工作站FP830 GB / 48 GB17637109K
RTX 6000 Ada 48GB工作站FP830 GB / 48 GB22753109K
L40S 48GB工作站FP830 GB / 48 GB20753109K
RTX PRO 6000 Blackwell 96GB工作站BF1658 GB / 96 GB202068112K
A10 24GB数据中心Q5_K_M23 GB / 24 GB1851311K
A100 40GB数据中心FP830 GB / 40 GB35258165K
A100 80GB数据中心BF1658 GB / 80 GB23258168K
H20 96GB数据中心BF1658 GB / 96 GB45612112K
昇腾 Ascend 910B 64GB数据中心BF1658 GB / 64 GB18231623K
H100 80GB PCIe数据中心BF1658 GB / 80 GB23625468K
H100 80GB SXM数据中心BF1658 GB / 80 GB38818168K
AMD MI300X 192GB数据中心BF1658 GB / 192 GB6010812380K
H200 141GB数据中心BF1658 GB / 141 GB548181238K
B200 192GB数据中心BF1658 GB / 192 GB9018612380K
Mac M4 Pro 64GB统一内存FP830 GB / 56 GB4.7141154K
DGX Spark 128GB统一内存BF1658 GB / 120 GB2.4513179K
Mac M4 Max 128GB统一内存BF1658 GB / 120 GB4.7281179K
Mac Studio M3 Ultra 256GB统一内存BF1658 GB / 240 GB7.1472513K
Mac Studio M3 Ultra 512GB统一内存BF1658 GB / 490 GB7.14721.2M

单流(batch=1)估算:解码 ≈ 显存带宽 × 效率 ÷ 每 token 读取字节(激活参数 × 量化位宽 + KV);预填充 ≈ FP16 算力 × 0.45 ÷ (2 × 激活参数)。多卡按张量并行、带宽求和 × 0.55。实际受引擎、驱动、PCIe 影响,误差 ±30%。反向查:我的卡能跑谁 →

用计算器按你的上下文与并发估算 →
可用维度不足 3 个,不绘制雷达图

编程HumanEval 51.8%(官方基座)。

数学GSM8K 74.0%、MATH 42.3%(官方基座)。

知识MMLU 75.2%(官方基座)。

中文中文可用,弱于 Qwen。

逻辑能力

非推理模型中游偏上:MMLU 75.2%、GSM8K 74.0%、MATH 42.3%(官方基座)。对话与写作优秀,数学 / 代码明显不及 Qwen2.5-32B。

亮点
  1. 1.Arena 一度超过 Llama 3 70B,同尺寸对话质量当年第一
  2. 2.Q4 16.6 GB 单张 24GB 卡跑满上下文
  3. 3.多语言与写作风格好,官方 TPU / GPU 全支持
  1. 1.上下文仅 8K,是最大硬伤
  2. 2.无 system prompt、无原生工具调用
  3. 3.Gemma Terms 含禁用政策,非 OSI 许可
适合:单卡英文 / 多语言对话助手 · 写作与总结
不适合:长文档 · 代码 / 数学

暂无带来源的分数。

更新 2026-08-28 · 排名供选型参考,基准会饱和、会泄漏、会过时。