开源权重可下多模态已被替代限制许可 · Llama 4 Community License
Llama 4 Scout
Meta · 发布 2025-04-05 · 已被替代 → Muse Glimmer 30B
单卡 H100 可跑的多模态 MoE,宣称 10M 上下文。
参数
109B 总 / 17B 激活
MOE
上下文
10M
价格 / 1M tok
$0.08 / $0.30
第三方托管常见价 · 2025-12-20
最低可跑
4× RTX 3090
Q6_K · 94 GB · ≈135 tok/s
Arena Elo1300
2025-12-20
AA 综合指数—
竞赛编程32.8
2025-12-20
GPQA 推理57.2
2025-12-20
架构简图
- 类型
- MoE
- 注意力
- GQA + iRoPE
- 层数
- 48
- 专家
- 16 · 激活 1 + 共享
- 隐藏维
- 5120
- 词表
- 未披露
完善中
| 精度 | 权重大小 | 说明 |
|---|---|---|
| BF16 | 218 GB估 | 官方精度 |
| FP8 | 109 GB估 | |
| Q8 | — | 暂无 |
| Q4 | 65 GB估 | GGUF Q4_K_M 或等效 |
- 消费级 24GB
- 未评估
- 单卡 80GB
- 官方 int4 单 H100 可跑
- 8×80GB 节点
- 未评估
⚠ 能加载 ≠ 能在满上下文 / 高并发下舒服跑。标「估」的数字来自 计算器 公式或社区量化文件大小。
完善中
硬件配置与预估吞吐
最低可跑(8K 上下文)
4 × RTX 3090 24GB
二手 ≈¥5,000 × 4 · 合计 ≈¥20,000 · 消费级
量化
Q6_K
解码
135 tok/s
最大上下文
21K
推荐配置(≥Q8 · 32K 上下文 · ≥15 tok/s)
4 × RTX 5090 32GB
≈¥16,000 × 4 · 合计 ≈¥64,000 · 消费级
量化
FP8
解码
195 tok/s
最大上下文
151K
| 配置 | 量化 | 占用 / 显存 | 解码 tok/s | 预填充 tok/s | 最大上下文 |
|---|---|---|---|---|---|
| 4× RTX 3090 24GB消费级 | Q6_K估 | 94 GB / 96 GB | 135 | 3759 | 21K |
| 4× RTX 4090 24GB消费级 | Q6_K估 | 94 GB / 96 GB | 146 | 8735 | 21K |
| 4× RTX 5090 32GB消费级 | FP8 | 115 GB / 128 GB | 221 | 11118 | 151K |
| 4× L4 24GB工作站 | Q6_K估 | 94 GB / 96 GB | 43 | 3176 | 21K |
| 2× RTX A6000 48GB工作站 | Q6_K估 | 91 GB / 96 GB | 56 | 2038 | 34K |
| 2× RTX 6000 Ada 48GB工作站 | Q6_K估 | 91 GB / 96 GB | 69 | 2409 | 34K |
| 2× L40S 48GB工作站 | Q6_K估 | 91 GB / 96 GB | 62 | 2409 | 34K |
| RTX PRO 6000 Blackwell 96GB工作站 | Q6_K估 | 90 GB / 96 GB | 77 | 3309 | 41K |
| 4× A10 24GB数据中心 | Q6_K估 | 94 GB / 96 GB | 87 | 3282 | 21K |
| 2× A100 40GB数据中心 | Q5_K_M估 | 79 GB / 80 GB | 128 | 8259 | 13K |
| A100 80GB数据中心 | Q5_K_M估 | 78 GB / 80 GB | 99 | 4129 | 19K |
| H20 96GB数据中心 | Q6_K估 | 90 GB / 96 GB | 171 | 979 | 41K |
| 2× 昇腾 Ascend 910B 64GB数据中心 | FP8 | 112 GB / 128 GB | 99 | 7412 | 177K |
| H100 80GB PCIe数据中心 | Q5_K_M估 | 78 GB / 80 GB | 97 | 10006 | 19K |
| H100 80GB SXM数据中心 | Q5_K_M估 | 78 GB / 80 GB | 163 | 13090 | 19K |
| AMD MI300X 192GB数据中心 | FP8 | 111 GB / 192 GB | 193 | 17299 | 873K |
| H200 141GB数据中心 | FP8 | 111 GB / 141 GB | 175 | 13090 | 329K |
| B200 192GB数据中心 | FP8 | 111 GB / 192 GB | 292 | 29779 | 873K |
| DGX Spark 128GB统一内存 | FP8 | 111 GB / 120 GB | 7.7 | 821 | 105K |
| Mac M4 Max 128GB统一内存 | FP8 | 111 GB / 120 GB | 15 | 450 | 105K |
| Mac Studio M3 Ultra 256GB统一内存 | BF16 | 221 GB / 240 GB | 11 | 754 | 111K |
| Mac Studio M3 Ultra 512GB统一内存 | BF16 | 221 GB / 490 GB | 11 | 754 | 1.4M |
单流(batch=1)估算:解码 ≈ 显存带宽 × 效率 ÷ 每 token 读取字节(激活参数 × 量化位宽 + KV);预填充 ≈ FP16 算力 × 0.45 ÷ (2 × 激活参数)。多卡按张量并行、带宽求和 × 0.55。实际受引擎、驱动、PCIe 影响,误差 ±30%。反向查:我的卡能跑谁 →
完善中
逻辑能力
非推理模型,能力中游。
亮点
- 1.int4 单 H100
- 2.10M 上下文(宣称)
- 3.原生图文
坑
- 1.10M 上下文实际可用性远低于宣称
- 2.推理弱
- 3.许可限制
适合:多模态 + 长文原型
不适合:推理 / 代码
| 基准 | 分数 | 来源 | 日期 | 证据 |
|---|---|---|---|---|
| LMArena Text Elo人类偏好 Elo | 1300 | LMArena Text (style control) | 2025-12-20 | 独立复测 |
| LiveCodeBench竞赛编程 | 32.8% | Llama 4 模型卡 | 2025-12-20 | 厂商公布 |
| GPQA Diamond研究生级科学问答 | 57.2% | Llama 4 模型卡 | 2025-12-20 | 厂商公布 |
| MMMU多模态理解 | 69.4% | Llama 4 模型卡 | 2025-12-20 | 厂商公布 |
更新 2025-12-20 · 排名供选型参考,基准会饱和、会泄漏、会过时。