开源权重可下多模态已被替代限制许可 · Llama 4 Community License
Llama 4 Maverick
Meta · 发布 2025-04-05 · 已被替代 → Muse Spark 1.2
Meta 的原生多模态 MoE,1M 上下文,许可有 MAU 限制。
参数
400B 总 / 17B 激活
MOE
上下文
1M
价格 / 1M tok
$0.15 / $0.60
第三方托管常见价 · 2025-12-20
最低可跑
Mac Studio M3 Ultra
FP8 · 402 GB · ≈23 tok/s
Arena Elo1330
2025-12-20
AA 综合指数—
竞赛编程43.4
2025-12-20
GPQA 推理69.8
2025-12-20
架构简图
- 类型
- MoE
- 注意力
- GQA + iRoPE(交替无位置编码层)
- 层数
- 48
- 专家
- 128 · 激活 1 + 共享
- 隐藏维
- 5120
- 词表
- 未披露
完善中
| 精度 | 权重大小 | 说明 |
|---|---|---|
| BF16 | 800 GB估 | 官方精度 |
| FP8 | 400 GB估 | |
| Q8 | — | 暂无 |
| Q4 | 245 GB估 | GGUF Q4_K_M 或等效 |
- 消费级 24GB
- 未评估
- 单卡 80GB
- 未评估
- 8×80GB 节点
- FP8 8×H100(官方目标)
⚠ 能加载 ≠ 能在满上下文 / 高并发下舒服跑。标「估」的数字来自 计算器 公式或社区量化文件大小。
完善中
硬件配置与预估吞吐
最低可跑(8K 上下文)
Mac Studio M3 Ultra 512GB
≈¥75,000 · 合计 ≈¥75,000 · 统一内存
量化
FP8
解码
23 tok/s
最大上下文
947K
推荐配置(≥Q8 · 32K 上下文 · ≥15 tok/s)
Mac Studio M3 Ultra 512GB
≈¥75,000 · 合计 ≈¥75,000 · 统一内存
量化
FP8
解码
20 tok/s
最大上下文
947K
| 配置 | 量化 | 占用 / 显存 | 解码 tok/s | 预填充 tok/s | 最大上下文 |
|---|---|---|---|---|---|
| 8× L40S 48GB工作站 | Q6_K估 | 331 GB / 384 GB | 250 | 9635 | 290K |
| 4× RTX PRO 6000 Blackwell 96GB工作站 | Q6_K估 | 326 GB / 384 GB | 259 | 13235 | 316K |
| 8× A100 40GB数据中心 | Q5_K_M估 | 287 GB / 320 GB | 513 | 33035 | 183K |
| 4× A100 80GB数据中心 | Q5_K_M估 | 282 GB / 320 GB | 336 | 16518 | 209K |
| 4× H20 96GB数据中心 | Q6_K估 | 326 GB / 384 GB | 579 | 3918 | 316K |
| 4× 昇腾 Ascend 910B 64GB数据中心 | Q4_K_M | 251 GB / 256 GB | 307 | 14824 | 33K |
| 4× H100 80GB PCIe数据中心 | Q5_K_M估 | 282 GB / 320 GB | 330 | 40024 | 209K |
| 4× H100 80GB SXM数据中心 | Q5_K_M估 | 282 GB / 320 GB | 552 | 52359 | 209K |
| 2× AMD MI300X 192GB数据中心 | Q6_K估 | 324 GB / 384 GB | 383 | 34597 | 329K |
| 2× H200 141GB数据中心 | Q5_K_M估 | 280 GB / 282 GB | 396 | 26179 | 19K |
| 2× B200 192GB数据中心 | Q6_K估 | 324 GB / 384 GB | 579 | 59559 | 329K |
| Mac Studio M3 Ultra 512GB统一内存 | FP8 | 402 GB / 490 GB | 23 | 754 | 947K |
单流(batch=1)估算:解码 ≈ 显存带宽 × 效率 ÷ 每 token 读取字节(激活参数 × 量化位宽 + KV);预填充 ≈ FP16 算力 × 0.45 ÷ (2 × 激活参数)。多卡按张量并行、带宽求和 × 0.55。实际受引擎、驱动、PCIe 影响,误差 ±30%。反向查:我的卡能跑谁 →
完善中
逻辑能力
非推理模型,考试型与工程型均为中游。
亮点
- 1.原生图文
- 2.1M 上下文(宣称)
- 3.17B 激活,吞吐高
坑
- 1.月活 > 7 亿需单独授权,欧盟限制
- 2.推理 / 代码弱于同期中国开源模型
- 3.长上下文实测质量争议
适合:多模态英文对话
不适合:推理 / 代码主力
| 基准 | 分数 | 来源 | 日期 | 证据 |
|---|---|---|---|---|
| LMArena Text Elo人类偏好 Elo | 1330 | LMArena Text (style control) | 2025-12-20 | 独立复测 |
| LiveCodeBench竞赛编程 | 43.4% | Llama 4 模型卡 | 2025-12-20 | 厂商公布 |
| GPQA Diamond研究生级科学问答 | 69.8% | Llama 4 模型卡 | 2025-12-20 | 厂商公布 |
| MMMU多模态理解 | 73.4% | Llama 4 模型卡 | 2025-12-20 | 厂商公布 |
更新 2025-12-20 · 排名供选型参考,基准会饱和、会泄漏、会过时。