开源权重可下多模态可商用 · Apache-2.0
Mistral Large 3
Mistral Large 3 · Mistral AI · 发布 2025-12-02 · 当前代
Mistral 675B MoE 开源多模态,Apache-2.0,非推理。
参数
675B 总 / 41B 激活
MOE
上下文
256K
价格 / 1M tok
$0.50 / $1.50
Mistral 定价页 · 2026-08-28
最低可跑
Mac Studio M3 Ultra
Q5_K_M · 471 GB · ≈12 tok/s
Arena Elo—
AA 综合指数16
2026-08-28
竞赛编程46.5
2026-08-28
GPQA 推理68
2026-08-28
架构简图
- 类型
- MoE
- 注意力
- MLA(kv_lora_rank 256,32 头)
- 层数
- 36
- 专家
- 128 · 激活 4 + 共享
- 隐藏维
- 4096
- 词表
- 131,072
细粒度 MoE:128 路由专家 + 1 共享,每 token 4 专家。语言模型 673B/39B 激活 + 2.5B 视觉编码器。YaRN 扩到 1M 位置,官方宣称 256K。官方仅放出 FP8 / NVFP4 指令版与 BF16 基座。
完善中
| 精度 | 权重大小 | 说明 |
|---|---|---|
| BF16 | 1350 GB估 | 官方精度 |
| FP8 | 675 GB估 | |
| Q8 | 716 GB估 | |
| Q4 | 392 GB估 | GGUF Q4_K_M 或等效 |
- 消费级 24GB
- 未评估
- 单卡 80GB
- 不可行
- 8×80GB 节点
- NVFP4 单节点 8×H100 / A100(官方);FP8 需 8×H200 或 B200
⚠ 能加载 ≠ 能在满上下文 / 高并发下舒服跑。标「估」的数字来自 计算器 公式或社区量化文件大小。
完善中
硬件配置与预估吞吐
最低可跑(8K 上下文)
Mac Studio M3 Ultra 512GB
≈¥75,000 · 合计 ≈¥75,000 · 统一内存
量化
Q5_K_M
解码
12 tok/s
最大上下文
41K
推荐配置(≥Q8 · 32K 上下文 · ≥15 tok/s)
8 × RTX PRO 6000 Blackwell 96GB
≈¥70,000 × 8 · 合计 ≈¥560,000 · 工作站
量化
FP8
解码
156 tok/s
最大上下文
297K
| 配置 | 量化 | 占用 / 显存 | 解码 tok/s | 预填充 tok/s | 最大上下文 |
|---|---|---|---|---|---|
| 8× RTX PRO 6000 Blackwell 96GB工作站 | FP8 | 687 GB / 768 GB | 182 | 10976 | 297K |
| 8× A100 80GB数据中心 | Q6_K估 | 554 GB / 640 GB | 238 | 13698 | 161K |
| 8× H20 96GB数据中心 | FP8 | 687 GB / 768 GB | 405 | 3249 | 297K |
| 8× 昇腾 Ascend 910B 64GB数据中心 | Q5_K_M估 | 480 GB / 512 GB | 213 | 12293 | 65K |
| 8× H100 80GB PCIe数据中心 | Q6_K估 | 554 GB / 640 GB | 234 | 33190 | 161K |
| 8× H100 80GB SXM数据中心 | Q6_K估 | 554 GB / 640 GB | 392 | 43420 | 161K |
| 4× AMD MI300X 192GB数据中心 | FP8 | 682 GB / 768 GB | 269 | 28690 | 314K |
| 4× H200 141GB数据中心 | Q6_K估 | 549 GB / 564 GB | 281 | 21710 | 34K |
| 4× B200 192GB数据中心 | FP8 | 682 GB / 768 GB | 405 | 49390 | 314K |
| Mac Studio M3 Ultra 512GB统一内存 | Q5_K_M估 | 471 GB / 490 GB | 12 | 313 | 41K |
单流(batch=1)估算:解码 ≈ 显存带宽 × 效率 ÷ 每 token 读取字节(激活参数 × 量化位宽 + KV);预填充 ≈ FP16 算力 × 0.45 ÷ (2 × 激活参数)。多卡按张量并行、带宽求和 × 0.55。实际受引擎、驱动、PCIe 影响,误差 ±30%。反向查:我的卡能跑谁 →
中文官方支持中文,独立数据少。
逻辑能力
非推理模型,考试型与工程型均为中游;LMArena 开源非推理类第 2(发布时官方说法)。
亮点
- 1.Apache-2.0,欧洲最大开源 MoE,3000 张 H200 从零训练
- 2.41B 激活,多模态 + 40 余种语言
- 3.API 便宜:$0.5 / $1.5
坑
- 1.非推理模型,AA 智能指数仅 16,已被 Medium 3.5 全面超越
- 2.675B 需整节点 8 卡,个人无法部署
- 3.发布 8 个月,Mistral 已转向 Medium 3.5 / Small 4
适合:需要 Apache-2.0 的大模型微调基座 · 多语言非推理对话
不适合:推理 / 编程主力 · 单机部署
| 基准 | 分数 | 来源 | 日期 | 证据 |
|---|---|---|---|---|
| Artificial Analysis Intelligence IndexAA 综合指数 | 16 | Artificial Analysis Intelligence Index v3 | 2026-08-28 | 独立复测 |
| Artificial Analysis Intelligence IndexAA 综合指数 | 16 | Artificial Analysis (v4.1.1) | 2026-08-28 | 独立复测 |
| GPQA Diamond研究生级科学问答 | 68% | Artificial Analysis (v4.1.1) | 2026-08-28 | 独立复测 |
| Humanity's Last Exam人类最后考试 | 4.2% | Artificial Analysis (v4.1.1) | 2026-08-28 | 独立复测 |
| AIME 2025美国数学邀请赛 | 38% | Artificial Analysis (v4.1.1) | 2026-08-28 | 独立复测 |
| LiveCodeBench竞赛编程 | 46.5% | Artificial Analysis (v4.1.1) | 2026-08-28 | 独立复测 |
| SciCode科学计算编程 | 36.2% | Artificial Analysis (v4.1.1) | 2026-08-28 | 独立复测 |
| Terminal-Bench Hard终端 agent(AA 困难子集) | 15.9% | Artificial Analysis (v4.1.1) | 2026-08-28 | 独立复测 |
| τ²-Bench Telecom工具调用 agent(电信域) | 24.6% | Artificial Analysis (v4.1.1) | 2026-08-28 | 独立复测 |
| MMMU-Pro多模态理解(Pro) | 55.7% | Artificial Analysis (v4.1.1) | 2026-08-28 | 独立复测 |
| IFBench指令遵循 | 36.2% | Artificial Analysis (v4.1.1) | 2026-08-28 | 独立复测 |
| Terminal-Bench终端 agent | 12% | Artificial Analysis · Terminal-Bench 2.1 | 2026-08-28 | 独立复测 |
| τ³-Bench Banking工具调用 agent(银行域) | 5.8% | Artificial Analysis · τ³-Bench Banking | 2026-08-28 | 独立复测 |
| LMArena Chinese Elo中文人类偏好 Elo | 1430 | LMArena Text · Chinese (style control) | 2026-08-28 | 独立复测 |
更新 2026-08-28 · 排名供选型参考,基准会饱和、会泄漏、会过时。