开源权重可下单卡可跑已被替代限制许可 · Llama 3.1 Community License
Llama 3.1 8B
Llama 3.1 · 8B · Meta · 发布 2024-07-23 · 已被替代 → Qwen3.8-27B
2024 年最流行的 8B 底座,微调与部署生态第一。
参数
8.03B
DENSE
上下文
128K
价格 / 1M tok
$0.03 / $0.05
第三方托管常见价(DeepI · 2026-08-28
最低可跑
RTX 3060
FP8 · 9.7 GB · ≈27 tok/s
Arena Elo—
AA 综合指数—
代码—
GPQA 推理31.8
2024-07-23
架构简图
- 类型
- Dense
- 注意力
- GQA(32 Q 头 / 8 KV 头)
- 层数
- 32
- 隐藏维
- 4096
- 词表
- 128,256
128K 上下文(llama3 RoPE scaling,原生 8K)。
完善中
| 精度 | 权重大小 | 说明 |
|---|---|---|
| BF16 | 16 GB | 官方精度 |
| FP8 | — | 暂无 |
| Q8 | 8.5 GB | |
| Q4 | 4.9 GB | GGUF Q4_K_M 或等效 |
- 消费级 24GB
- BF16 16 GB 单卡可跑;Q4 4.9 GB 留大量 KV,可上 128K
- 单卡 80GB
- BF16 高并发
- 8×80GB 节点
- 过剩
KV Cache:128 KiB/token;32K 上下文约 4 GB。 ≈ 128 KiB/token
⚠ 能加载 ≠ 能在满上下文 / 高并发下舒服跑。标「估」的数字来自 计算器 公式或社区量化文件大小。
完善中
硬件配置与预估吞吐
最低可跑(8K 上下文)
RTX 3060 12GB
≈¥2,000 · 合计 ≈¥2,000 · 消费级
量化
FP8
解码
27 tok/s
最大上下文
44K
推荐配置(≥Q8 · 32K 上下文 · ≥15 tok/s)
RTX 3060 12GB
≈¥2,000 · 合计 ≈¥2,000 · 消费级
量化
FP8
解码
23 tok/s
最大上下文
44K
| 配置 | 量化 | 占用 / 显存 | 解码 tok/s | 预填充 tok/s | 最大上下文 |
|---|---|---|---|---|---|
| RTX 3060 12GB消费级 | FP8估 | 9.7 GB / 12 GB | 27 | 700 | 44K |
| RTX 4060 Ti 16GB消费级 | FP8估 | 9.7 GB / 16 GB | 22 | 616 | 108K |
| RTX 3090 24GB消费级 | BF16 | 18 GB / 24 GB | 36 | 1989 | 54K |
| RTX 4070 Ti Super 16GB消费级 | FP8估 | 9.7 GB / 16 GB | 51 | 1233 | 108K |
| RTX 5070 Ti 16GB消费级 | FP8估 | 9.7 GB / 16 GB | 68 | 2466 | 108K |
| RTX 4080 Super 16GB消费级 | FP8估 | 9.7 GB / 16 GB | 56 | 1457 | 108K |
| RTX 5080 16GB消费级 | FP8估 | 9.7 GB / 16 GB | 73 | 3138 | 108K |
| RTX 4090 24GB消费级 | BF16 | 18 GB / 24 GB | 38 | 4623 | 54K |
| RTX 5090 32GB消费级 | BF16 | 18 GB / 32 GB | 68 | 5884 | 118K |
| L4 24GB工作站 | BF16 | 18 GB / 24 GB | 11 | 1681 | 54K |
| RTX A6000 48GB工作站 | BF16 | 18 GB / 48 GB | 29 | 2158 | 246K |
| RTX 6000 Ada 48GB工作站 | BF16 | 18 GB / 48 GB | 36 | 2550 | 246K |
| L40S 48GB工作站 | BF16 | 18 GB / 48 GB | 33 | 2550 | 246K |
| RTX PRO 6000 Blackwell 96GB工作站 | BF16 | 18 GB / 96 GB | 68 | 7005 | 630K |
| A10 24GB数据中心 | BF16 | 18 GB / 24 GB | 23 | 1737 | 54K |
| A100 40GB数据中心 | BF16 | 18 GB / 40 GB | 59 | 8742 | 182K |
| A100 80GB数据中心 | BF16 | 18 GB / 80 GB | 77 | 8742 | 502K |
| H20 96GB数据中心 | BF16 | 18 GB / 96 GB | 152 | 2073 | 630K |
| 昇腾 Ascend 910B 64GB数据中心 | BF16 | 18 GB / 64 GB | 61 | 7846 | 374K |
| H100 80GB PCIe数据中心 | BF16 | 18 GB / 80 GB | 76 | 21183 | 502K |
| H100 80GB SXM数据中心 | BF16 | 18 GB / 80 GB | 127 | 27712 | 502K |
| AMD MI300X 192GB数据中心 | BF16 | 18 GB / 192 GB | 201 | 36622 | 1.4M |
| H200 141GB数据中心 | BF16 | 18 GB / 141 GB | 182 | 27712 | 990K |
| B200 192GB数据中心 | BF16 | 18 GB / 192 GB | 303 | 63045 | 1.4M |
| Mac M4 Pro 64GB统一内存 | BF16 | 18 GB / 56 GB | 8.0 | 476 | 310K |
| DGX Spark 128GB统一内存 | BF16 | 18 GB / 120 GB | 8.0 | 1737 | 822K |
| Mac M4 Max 128GB统一内存 | BF16 | 18 GB / 120 GB | 16 | 953 | 822K |
| Mac Studio M3 Ultra 256GB统一内存 | BF16 | 18 GB / 240 GB | 24 | 1597 | 1.7M |
| Mac Studio M3 Ultra 512GB统一内存 | BF16 | 18 GB / 490 GB | 24 | 1597 | 3.7M |
单流(batch=1)估算:解码 ≈ 显存带宽 × 效率 ÷ 每 token 读取字节(激活参数 × 量化位宽 + KV);预填充 ≈ FP16 算力 × 0.45 ÷ (2 × 激活参数)。多卡按张量并行、带宽求和 × 0.55。实际受引擎、驱动、PCIe 影响,误差 ±30%。反向查:我的卡能跑谁 →
可用维度不足 3 个,不绘制雷达图
编程HumanEval 72.6%(官方)。
推理GPQA 30.4%(官方模型卡)。
数学MATH 51.9%(官方)。
知识MMLU 69.4%(官方)。
中文弱。
逻辑能力
入门级:GPQA 30.4%、MATH 51.9%(官方)。简单逻辑与格式化输出可靠,多步推理与复杂代码不稳。
亮点
- 1.消费级显卡 BF16 直接跑,Q4 不到 5 GB
- 2.128K 上下文 + 原生工具调用模板
- 3.衍生微调数量在 HF 上长期第一
坑
- 1.中文能力弱于同期 Qwen2 / GLM-4 9B
- 2.无推理模式,数学 GPQA 30.4% 属入门
- 3.许可限制(7 亿月活)与品牌标注要求
适合:微调底座 / 教学 · 边缘设备英文助手
不适合:中文 · 复杂推理
| 基准 | 分数 | 来源 | 日期 | 证据 |
|---|---|---|---|---|
| GPQA Diamond研究生级科学问答 | 31.8% | Llama 3.3 模型卡(GPQA Diamond CoT 对照列) | 2024-07-23 | 厂商公布 |
更新 2026-08-28 · 排名供选型参考,基准会饱和、会泄漏、会过时。