Mistral Small 4
Mistral Small 4 · Mistral AI Mistral AI · 发布 2026-03-16 · 当前代
119B MoE 仅 6.5B 激活,推理 / 视觉 / 编程三合一。
- 类型
- MoE
- 注意力
- MLA(kv_lora_rank 256 + RoPE 64,q_lora_rank 1024,32 头,head_dim 128)
- 层数
- 36
- 专家
- 128 · 激活 4 + 共享
- 隐藏维
- 4096
- 词表
- 131,072
与 Large 3 同构的细粒度 MoE:128 路由 + 1 共享专家,每 token 选 4,专家中间维 2048,全部 36 层均为 MoE(first_k_dense_replace 0)。MLA:qk_nope 64 + qk_rope 64、v_head 128,YaRN factor 128(原始 8K → config 1M,官方上下文 256K)。Pixtral 视觉编码器 24 层、hidden 1024、patch 14、image 1540。合并 Magistral 推理、Pixtral 视觉、Devstral 编程于一体。官方权重为 FP8(静态激活量化)。
类型:细粒度 MoE + MLA,119B 总参 / 6.5B 激活,图像输入。
| 项目 | 数值 |
|---|---|
| 层数 | 36(全部 MoE) |
| 隐藏维 | 4,096 |
| 专家 | 128 路由 + 1 共享,每 token 选 4,专家中间维 2,048 |
| 注意力 | MLA:32 头,q_lora_rank 1024,kv_lora_rank 256,qk_nope 64 + qk_rope 64,v_head 128 |
| RoPE | YaRN factor 128,原始 8,192,theta 1e4 |
| 词表 | 131,072(Tekken) |
| 上下文 | 官方 256K(config max_position 1,048,576) |
| 视觉编码器 | Pixtral 24 层,hidden 1024,patch 14,image 1540,spatial merge 2 |
config.json 中 model_type: mistral3 / text_config.model_type: mistral4,quant_method: fp8。
参考:mistralai/Mistral-Small-4-119B-2603 config.json。
| 精度 | 权重大小 | 说明 |
|---|---|---|
| BF16 | 238 GB | 官方精度 |
| FP8 | 121 GB | |
| Q8 | 126 GB | |
| Q4 | 74 GB | GGUF Q4_K_M 或等效 |
- 消费级 24GB
- 不可行
- 单卡 80GB
- UD-Q4_K_M 73.8 GB 单卡勉强可载,仅短上下文;官方最低 4×H100 / 2×H200 / 1×B200
- 8×80GB 节点
- 官方 FP8 121 GB,4×H100 推荐配置,8×H100 高并发
KV Cache:MLA 压缩缓存:(256 潜向量 + 64 RoPE) × 2 B = 640 B/层 × 36 层 ≈ 22.5 KiB/token。若引擎不做 MLA 吸收而缓存完整 K/V(32 头 × 128 × 2 × 2 B),则为 576 KiB/token。256K 上下文 MLA 缓存 ≈ 5.6 GB。 ≈ 22.5 KiB/token
⚠ 能加载 ≠ 能在满上下文 / 高并发下舒服跑。标「估」的数字来自 计算器 公式或社区量化文件大小。
| 精度 | 权重大小 | 参考显存 | 说明 |
|---|---|---|---|
| BF16 | 238 GB | 4×80GB | unsloth GGUF BF16(官方未发布 BF16) |
| FP8 | 121 GB | 2×80GB | 官方 safetensors,3 分片 120.9 GB(另有 7 分片 consolidated 格式 141 GB) |
| Q8 | 126 GB | 2×80GB | unsloth GGUF Q8_0 |
| Q4 | 73.8 GB | 80GB 单卡 | unsloth UD-Q4_K_M;UD-Q4_K_S 69.5 GB |
KV Cache:MLA 压缩缓存 ≈ 22.5 KiB/token((256 + 64) × 2 B × 36 层);非吸收实现 576 KiB/token。256K 上下文 MLA 缓存 ≈ 5.6 GB。
参考配置:
- 24GB:不可行
- 80GB 单卡:Q4 勉强可载,短上下文
- 4×H100 / 2×H200 / 1×B200:官方最低;4×H200 / 2×B200:官方推荐
警示:high 推理档输出很长,预留输出 KV;vLLM 需 tensor-parallel ≥ 2。
| 配置 | 量化 | 占用 / 显存 | 解码 tok/s | 预填充 tok/s | 最大上下文 |
|---|---|---|---|---|---|
| 4× RTX 3090 24GB消费级 | Q5_K_M估 | 87 GB / 96 GB | 441 | 9831 | 414K |
| 4× RTX 4090 24GB消费级 | Q5_K_M估 | 87 GB / 96 GB | 474 | 22846 | 414K |
| 4× RTX 5090 32GB消费级 | FP8 | 126 GB / 128 GB | 598 | 29077 | 200K |
| 4× L4 24GB工作站 | Q5_K_M估 | 87 GB / 96 GB | 141 | 8308 | 414K |
| 2× RTX A6000 48GB工作站 | Q5_K_M估 | 85 GB / 96 GB | 181 | 5331 | 523K |
| 2× RTX 6000 Ada 48GB工作站 | Q5_K_M估 | 85 GB / 96 GB | 226 | 6300 | 523K |
| 2× L40S 48GB工作站 | Q5_K_M估 | 85 GB / 96 GB | 203 | 6300 | 523K |
| RTX PRO 6000 Blackwell 96GB工作站 | Q5_K_M估 | 83 GB / 96 GB | 249 | 8654 | 578K |
| 4× A10 24GB数据中心 | Q5_K_M估 | 87 GB / 96 GB | 282 | 8585 | 414K |
| 2× A100 40GB数据中心 | Q4_K_M | 76 GB / 80 GB | 432 | 21600 | 173K |
| A100 80GB数据中心 | Q4_K_M | 75 GB / 80 GB | 335 | 10800 | 228K |
| H20 96GB数据中心 | Q5_K_M估 | 83 GB / 96 GB | 556 | 2562 | 578K |
| 2× 昇腾 Ascend 910B 64GB数据中心 | FP8 | 123 GB / 128 GB | 267 | 19385 | 419K |
| H100 80GB PCIe数据中心 | Q4_K_M | 75 GB / 80 GB | 328 | 26169 | 228K |
| H100 80GB SXM数据中心 | Q4_K_M | 75 GB / 80 GB | 550 | 34235 | 228K |
| AMD MI300X 192GB数据中心 | FP8 | 122 GB / 192 GB | 522 | 45242 | 6.2M |
| H200 141GB数据中心 | FP8 | 122 GB / 141 GB | 473 | 34235 | 1.7M |
| B200 192GB数据中心 | FP8 | 122 GB / 192 GB | 789 | 77885 | 6.2M |
| DGX Spark 128GB统一内存 | Q6_K估 | 97 GB / 120 GB | 25 | 2146 | 1.0M |
| Mac M4 Max 128GB统一内存 | Q6_K估 | 97 GB / 120 GB | 51 | 1177 | 1.0M |
| Mac Studio M3 Ultra 256GB统一内存 | BF16 | 239 GB / 240 GB | 31 | 1973 | 36K |
| Mac Studio M3 Ultra 512GB统一内存 | BF16 | 239 GB / 490 GB | 31 | 1973 | 11.1M |
单流(batch=1)估算:解码 ≈ 显存带宽 × 效率 ÷ 每 token 读取字节(激活参数 × 量化位宽 + KV);预填充 ≈ FP16 算力 × 0.45 ÷ (2 × 激活参数)。多卡按张量并行、带宽求和 × 0.55。实际受引擎、驱动、PCIe 影响,误差 ±30%。反向查:我的卡能跑谁 →
编程LiveCodeBench 64(high)/ 32(instruct)(官方模型卡图表);SWE-bench 未披露。
推理GPQA Diamond 71.2(high)/ 59.1(instruct)、MMLU Pro 78(官方模型卡图表);HLE 未披露。
数学AIME 2025 84(high,图 1)/ 83.8(图 2)/ 36(instruct)(官方模型卡图表)。
指令遵循AllenAI IFBench 48(high)/ 35.7(instruct)、Arena Hard 58.3(官方模型卡图表)。
Agenttau2 / Terminal-Bench 官方未披露;Collie 62.9。
多模态MMMU-Pro 60(high)/ 46.3(instruct)(官方模型卡图表)。
中文官方支持中文,独立数据少。
考试型推理中游:reasoning_effort=high 时 GPQA Diamond 71.2、AIME 2025 84(另一张图 83.8)、MMLU Pro 78,与 Magistral Medium 1.2 持平;instruct 模式下 GPQA 59.1、AIME 36、LiveCodeBench 32,差距很大。工程型推理:LiveCodeBench 64(high),继承 Devstral 但官方未给 SWE-bench 数字。长上下文 AA LCR 72。指令遵循偏弱(IFBench 48)。
- 1.Apache-2.0,指令 + 推理 + 多模态 + 编程 agent 单一权重,reasoning_effort 可切
- 2.6.5B 激活,官方称比 Small 3 吞吐 3 倍、端到端延迟降 40%
- 3.GPQA Diamond 71.2、AIME 2025 84、LiveCodeBench 64(high),输出比 gpt-oss-120b 短 20%
- 1.名为 Small 实为 119B,FP8 121 GB,24GB 单卡跑不了,官方最低 4×H100
- 2.推理档输出很长(AIME 均 27.9K 字符),关思考后 GPQA 掉到 59.1、AIME 36
- 3.Agent 类官方未给 SWE-bench / Terminal-Bench / tau2 数字,IFBench 仅 48
| 基准 | 分数 | 来源 | 日期 | 证据 |
|---|---|---|---|---|
| Artificial Analysis Intelligence IndexAA 综合指数 | 20 | Artificial Analysis Intelligence Index v3 | 2026-08-28 | 独立复测 |
| LiveCodeBench竞赛编程 | 64% | Mistral Small 4 模型卡 | 2026-08-28 | 厂商公布 |
| GPQA Diamond研究生级科学问答 | 71.2% | Mistral Small 4 模型卡 | 2026-08-28 | 厂商公布 |
| AIME 2025美国数学邀请赛 | 84% | Mistral Small 4 模型卡 | 2026-08-28 | 厂商公布 |
| Artificial Analysis Intelligence IndexAA 综合指数 | 20 | Artificial Analysis (v4.1.1) | 2026-08-28 | 独立复测 |
| GPQA Diamond研究生级科学问答 | 76.9% | Artificial Analysis (v4.1.1) | 2026-08-28 | 独立复测 |
| Humanity's Last Exam人类最后考试 | 9.9% | Artificial Analysis (v4.1.1) | 2026-08-28 | 独立复测 |
| SciCode科学计算编程 | 38% | Artificial Analysis (v4.1.1) | 2026-08-28 | 独立复测 |
| Terminal-Bench Hard终端 agent(AA 困难子集) | 17.4% | Artificial Analysis (v4.1.1) | 2026-08-28 | 独立复测 |
| τ²-Bench Telecom工具调用 agent(电信域) | 41.2% | Artificial Analysis (v4.1.1) | 2026-08-28 | 独立复测 |
| MMMU-Pro多模态理解(Pro) | 56.8% | Artificial Analysis (v4.1.1) | 2026-08-28 | 独立复测 |
| IFBench指令遵循 | 48.2% | Artificial Analysis (v4.1.1) | 2026-08-28 | 独立复测 |
| Terminal-Bench终端 agent | 21% | Artificial Analysis · Terminal-Bench 2.1 | 2026-08-28 | 独立复测 |
| τ³-Bench Banking工具调用 agent(银行域) | 4.9% | Artificial Analysis · τ³-Bench Banking | 2026-08-28 | 独立复测 |
更新 2026-08-28 · 排名供选型参考,基准会饱和、会泄漏、会过时。