开源权重可下单卡可跑已被替代限制许可 · Llama 3.1 Community License
Meta logo

Llama 3.1 8B

Llama 3.1 · 8B · Meta · 发布 2024-07-23 · 已被替代Qwen3.8-27B

2024 年最流行的 8B 底座,微调与部署生态第一。

参数
8.03B
DENSE
上下文
128K
价格 / 1M tok
$0.03 / $0.05
第三方托管常见价(DeepI · 2026-08-28
最低可跑
RTX 3060
FP8 · 9.7 GB · ≈27 tok/s
Arena Elo
AA 综合指数
代码
GPQA 推理31.8
2024-07-23
类型
Dense
注意力
GQA(32 Q 头 / 8 KV 头)
层数
32
隐藏维
4096
词表
128,256

128K 上下文(llama3 RoPE scaling,原生 8K)。

完善中

Token Embedding词表 128,256× 32 层注意力:GQAKV 头 8 · head_dim 128Dense FFN隐藏维 4096Dense:每个 token 经过全部参数LM Head8.03B实线 = 已公开 · 虚线 = 未披露
精度权重大小说明
BF1616 GB官方精度
FP8暂无
Q88.5 GB
Q44.9 GBGGUF Q4_K_M 或等效
消费级 24GB
BF16 16 GB 单卡可跑;Q4 4.9 GB 留大量 KV,可上 128K
单卡 80GB
BF16 高并发
8×80GB 节点
过剩

KV Cache:128 KiB/token;32K 上下文约 4 GB。128 KiB/token

⚠ 能加载 ≠ 能在满上下文 / 高并发下舒服跑。标「估」的数字来自 计算器 公式或社区量化文件大小。

完善中

硬件配置与预估吞吐
最低可跑(8K 上下文)
RTX 3060 12GB
≈¥2,000 · 合计 ≈¥2,000 · 消费级
量化
FP8
解码
27 tok/s
最大上下文
44K
推荐配置(≥Q8 · 32K 上下文 · ≥15 tok/s)
RTX 3060 12GB
≈¥2,000 · 合计 ≈¥2,000 · 消费级
量化
FP8
解码
23 tok/s
最大上下文
44K
配置量化占用 / 显存解码 tok/s预填充 tok/s最大上下文
RTX 3060 12GB消费级FP89.7 GB / 12 GB2770044K
RTX 4060 Ti 16GB消费级FP89.7 GB / 16 GB22616108K
RTX 3090 24GB消费级BF1618 GB / 24 GB36198954K
RTX 4070 Ti Super 16GB消费级FP89.7 GB / 16 GB511233108K
RTX 5070 Ti 16GB消费级FP89.7 GB / 16 GB682466108K
RTX 4080 Super 16GB消费级FP89.7 GB / 16 GB561457108K
RTX 5080 16GB消费级FP89.7 GB / 16 GB733138108K
RTX 4090 24GB消费级BF1618 GB / 24 GB38462354K
RTX 5090 32GB消费级BF1618 GB / 32 GB685884118K
L4 24GB工作站BF1618 GB / 24 GB11168154K
RTX A6000 48GB工作站BF1618 GB / 48 GB292158246K
RTX 6000 Ada 48GB工作站BF1618 GB / 48 GB362550246K
L40S 48GB工作站BF1618 GB / 48 GB332550246K
RTX PRO 6000 Blackwell 96GB工作站BF1618 GB / 96 GB687005630K
A10 24GB数据中心BF1618 GB / 24 GB23173754K
A100 40GB数据中心BF1618 GB / 40 GB598742182K
A100 80GB数据中心BF1618 GB / 80 GB778742502K
H20 96GB数据中心BF1618 GB / 96 GB1522073630K
昇腾 Ascend 910B 64GB数据中心BF1618 GB / 64 GB617846374K
H100 80GB PCIe数据中心BF1618 GB / 80 GB7621183502K
H100 80GB SXM数据中心BF1618 GB / 80 GB12727712502K
AMD MI300X 192GB数据中心BF1618 GB / 192 GB201366221.4M
H200 141GB数据中心BF1618 GB / 141 GB18227712990K
B200 192GB数据中心BF1618 GB / 192 GB303630451.4M
Mac M4 Pro 64GB统一内存BF1618 GB / 56 GB8.0476310K
DGX Spark 128GB统一内存BF1618 GB / 120 GB8.01737822K
Mac M4 Max 128GB统一内存BF1618 GB / 120 GB16953822K
Mac Studio M3 Ultra 256GB统一内存BF1618 GB / 240 GB2415971.7M
Mac Studio M3 Ultra 512GB统一内存BF1618 GB / 490 GB2415973.7M

单流(batch=1)估算:解码 ≈ 显存带宽 × 效率 ÷ 每 token 读取字节(激活参数 × 量化位宽 + KV);预填充 ≈ FP16 算力 × 0.45 ÷ (2 × 激活参数)。多卡按张量并行、带宽求和 × 0.55。实际受引擎、驱动、PCIe 影响,误差 ±30%。反向查:我的卡能跑谁 →

用计算器按你的上下文与并发估算 →
可用维度不足 3 个,不绘制雷达图

编程HumanEval 72.6%(官方)。

推理GPQA 30.4%(官方模型卡)。

数学MATH 51.9%(官方)。

知识MMLU 69.4%(官方)。

中文弱。

逻辑能力

入门级:GPQA 30.4%、MATH 51.9%(官方)。简单逻辑与格式化输出可靠,多步推理与复杂代码不稳。

亮点
  1. 1.消费级显卡 BF16 直接跑,Q4 不到 5 GB
  2. 2.128K 上下文 + 原生工具调用模板
  3. 3.衍生微调数量在 HF 上长期第一
  1. 1.中文能力弱于同期 Qwen2 / GLM-4 9B
  2. 2.无推理模式,数学 GPQA 30.4% 属入门
  3. 3.许可限制(7 亿月活)与品牌标注要求
适合:微调底座 / 教学 · 边缘设备英文助手
不适合:中文 · 复杂推理
基准分数来源日期证据
GPQA Diamond研究生级科学问答31.8%Llama 3.3 模型卡(GPQA Diamond CoT 对照列)2024-07-23厂商公布

更新 2026-08-28 · 排名供选型参考,基准会饱和、会泄漏、会过时。