开源权重可下多模态可商用 · Apache-2.0
Mistral AI logo

Mistral Large 3

Mistral Large 3 · Mistral AI · 发布 2025-12-02 · 当前代

Mistral 675B MoE 开源多模态,Apache-2.0,非推理。

参数
675B 总 / 41B 激活
MOE
上下文
256K
价格 / 1M tok
$0.50 / $1.50
Mistral 定价页 · 2026-08-28
最低可跑
Mac Studio M3 Ultra
Q5_K_M · 471 GB · ≈12 tok/s
Arena Elo
AA 综合指数16
2026-08-28
竞赛编程46.5
2026-08-28
GPQA 推理68
2026-08-28
类型
MoE
注意力
MLA(kv_lora_rank 256,32 头)
层数
36
专家
128 · 激活 4 + 共享
隐藏维
4096
词表
131,072

细粒度 MoE:128 路由专家 + 1 共享,每 token 4 专家。语言模型 673B/39B 激活 + 2.5B 视觉编码器。YaRN 扩到 1M 位置,官方宣称 256K。官方仅放出 FP8 / NVFP4 指令版与 BF16 基座。

完善中

Token Embedding词表 131,072× 36 层注意力:MLAKV 头 32 · head_dim 128路由top-4E1E2E3共享专家128 专家 · 激活 4 · d=4096LM Head675B / 41B 激活实线 = 已公开 · 虚线 = 未披露
精度权重大小说明
BF161350 GB官方精度
FP8675 GB
Q8716 GB
Q4392 GBGGUF Q4_K_M 或等效
消费级 24GB
未评估
单卡 80GB
不可行
8×80GB 节点
NVFP4 单节点 8×H100 / A100(官方);FP8 需 8×H200 或 B200

⚠ 能加载 ≠ 能在满上下文 / 高并发下舒服跑。标「估」的数字来自 计算器 公式或社区量化文件大小。

完善中

硬件配置与预估吞吐
最低可跑(8K 上下文)
Mac Studio M3 Ultra 512GB
≈¥75,000 · 合计 ≈¥75,000 · 统一内存
量化
Q5_K_M
解码
12 tok/s
最大上下文
41K
推荐配置(≥Q8 · 32K 上下文 · ≥15 tok/s)
8 × RTX PRO 6000 Blackwell 96GB
≈¥70,000 × 8 · 合计 ≈¥560,000 · 工作站
量化
FP8
解码
156 tok/s
最大上下文
297K
配置量化占用 / 显存解码 tok/s预填充 tok/s最大上下文
8× RTX PRO 6000 Blackwell 96GB工作站FP8687 GB / 768 GB18210976297K
8× A100 80GB数据中心Q6_K554 GB / 640 GB23813698161K
8× H20 96GB数据中心FP8687 GB / 768 GB4053249297K
8× 昇腾 Ascend 910B 64GB数据中心Q5_K_M480 GB / 512 GB2131229365K
8× H100 80GB PCIe数据中心Q6_K554 GB / 640 GB23433190161K
8× H100 80GB SXM数据中心Q6_K554 GB / 640 GB39243420161K
4× AMD MI300X 192GB数据中心FP8682 GB / 768 GB26928690314K
4× H200 141GB数据中心Q6_K549 GB / 564 GB2812171034K
4× B200 192GB数据中心FP8682 GB / 768 GB40549390314K
Mac Studio M3 Ultra 512GB统一内存Q5_K_M471 GB / 490 GB1231341K

单流(batch=1)估算:解码 ≈ 显存带宽 × 效率 ÷ 每 token 读取字节(激活参数 × 量化位宽 + KV);预填充 ≈ FP16 算力 × 0.45 ÷ (2 × 激活参数)。多卡按张量并行、带宽求和 × 0.55。实际受引擎、驱动、PCIe 影响,误差 ±30%。反向查:我的卡能跑谁 →

用计算器按你的上下文与并发估算 →

中文官方支持中文,独立数据少。

逻辑能力

非推理模型,考试型与工程型均为中游;LMArena 开源非推理类第 2(发布时官方说法)。

亮点
  1. 1.Apache-2.0,欧洲最大开源 MoE,3000 张 H200 从零训练
  2. 2.41B 激活,多模态 + 40 余种语言
  3. 3.API 便宜:$0.5 / $1.5
  1. 1.非推理模型,AA 智能指数仅 16,已被 Medium 3.5 全面超越
  2. 2.675B 需整节点 8 卡,个人无法部署
  3. 3.发布 8 个月,Mistral 已转向 Medium 3.5 / Small 4
适合:需要 Apache-2.0 的大模型微调基座 · 多语言非推理对话
不适合:推理 / 编程主力 · 单机部署
基准分数来源日期证据
Artificial Analysis Intelligence IndexAA 综合指数16Artificial Analysis Intelligence Index v32026-08-28独立复测
Artificial Analysis Intelligence IndexAA 综合指数16Artificial Analysis (v4.1.1)2026-08-28独立复测
GPQA Diamond研究生级科学问答68%Artificial Analysis (v4.1.1)2026-08-28独立复测
Humanity's Last Exam人类最后考试4.2%Artificial Analysis (v4.1.1)2026-08-28独立复测
AIME 2025美国数学邀请赛38%Artificial Analysis (v4.1.1)2026-08-28独立复测
LiveCodeBench竞赛编程46.5%Artificial Analysis (v4.1.1)2026-08-28独立复测
SciCode科学计算编程36.2%Artificial Analysis (v4.1.1)2026-08-28独立复测
Terminal-Bench Hard终端 agent(AA 困难子集)15.9%Artificial Analysis (v4.1.1)2026-08-28独立复测
τ²-Bench Telecom工具调用 agent(电信域)24.6%Artificial Analysis (v4.1.1)2026-08-28独立复测
MMMU-Pro多模态理解(Pro)55.7%Artificial Analysis (v4.1.1)2026-08-28独立复测
IFBench指令遵循36.2%Artificial Analysis (v4.1.1)2026-08-28独立复测
Terminal-Bench终端 agent12%Artificial Analysis · Terminal-Bench 2.12026-08-28独立复测
τ³-Bench Banking工具调用 agent(银行域)5.8%Artificial Analysis · τ³-Bench Banking2026-08-28独立复测
LMArena Chinese Elo中文人类偏好 Elo1430LMArena Text · Chinese (style control)2026-08-28独立复测

更新 2026-08-28 · 排名供选型参考,基准会饱和、会泄漏、会过时。