开源权重可下推理模型·可关多模态可商用 · Apache-2.0
Mistral AI logo

Mistral Small 4

Mistral Small 4 · Mistral AI Mistral AI · 发布 2026-03-16 · 当前代

119B MoE 仅 6.5B 激活,推理 / 视觉 / 编程三合一。

参数
119B 总 / 6.5B 激活
MOE
上下文
256K
价格 / 1M tok
$0.15 / $0.60
Mistral 定价页 · 2026-08-28
最低可跑
4× RTX 3090
Q5_K_M · 87 GB · ≈441 tok/s
Arena Elo
AA 综合指数20
2026-08-28
竞赛编程64
2026-08-28
GPQA 推理76.9
2026-08-28
类型
MoE
注意力
MLA(kv_lora_rank 256 + RoPE 64,q_lora_rank 1024,32 头,head_dim 128)
层数
36
专家
128 · 激活 4 + 共享
隐藏维
4096
词表
131,072

与 Large 3 同构的细粒度 MoE:128 路由 + 1 共享专家,每 token 选 4,专家中间维 2048,全部 36 层均为 MoE(first_k_dense_replace 0)。MLA:qk_nope 64 + qk_rope 64、v_head 128,YaRN factor 128(原始 8K → config 1M,官方上下文 256K)。Pixtral 视觉编码器 24 层、hidden 1024、patch 14、image 1540。合并 Magistral 推理、Pixtral 视觉、Devstral 编程于一体。官方权重为 FP8(静态激活量化)。

类型:细粒度 MoE + MLA,119B 总参 / 6.5B 激活,图像输入。

项目数值
层数36(全部 MoE)
隐藏维4,096
专家128 路由 + 1 共享,每 token 选 4,专家中间维 2,048
注意力MLA:32 头,q_lora_rank 1024,kv_lora_rank 256,qk_nope 64 + qk_rope 64,v_head 128
RoPEYaRN factor 128,原始 8,192,theta 1e4
词表131,072(Tekken)
上下文官方 256K(config max_position 1,048,576)
视觉编码器Pixtral 24 层,hidden 1024,patch 14,image 1540,spatial merge 2

config.jsonmodel_type: mistral3 / text_config.model_type: mistral4quant_method: fp8

参考:mistralai/Mistral-Small-4-119B-2603 config.json。

Token Embedding词表 131,072× 36 层注意力:MLAKV 头 32 · head_dim 128路由top-4E1E2E3共享专家128 专家 · 激活 4 · d=4096LM Head119B / 6.5B 激活实线 = 已公开 · 虚线 = 未披露
精度权重大小说明
BF16238 GB官方精度
FP8121 GB
Q8126 GB
Q474 GBGGUF Q4_K_M 或等效
消费级 24GB
不可行
单卡 80GB
UD-Q4_K_M 73.8 GB 单卡勉强可载,仅短上下文;官方最低 4×H100 / 2×H200 / 1×B200
8×80GB 节点
官方 FP8 121 GB,4×H100 推荐配置,8×H100 高并发

KV Cache:MLA 压缩缓存:(256 潜向量 + 64 RoPE) × 2 B = 640 B/层 × 36 层 ≈ 22.5 KiB/token。若引擎不做 MLA 吸收而缓存完整 K/V(32 头 × 128 × 2 × 2 B),则为 576 KiB/token。256K 上下文 MLA 缓存 ≈ 5.6 GB。22.5 KiB/token

⚠ 能加载 ≠ 能在满上下文 / 高并发下舒服跑。标「估」的数字来自 计算器 公式或社区量化文件大小。

精度权重大小参考显存说明
BF16238 GB4×80GBunsloth GGUF BF16(官方未发布 BF16)
FP8121 GB2×80GB官方 safetensors,3 分片 120.9 GB(另有 7 分片 consolidated 格式 141 GB)
Q8126 GB2×80GBunsloth GGUF Q8_0
Q473.8 GB80GB 单卡unsloth UD-Q4_K_M;UD-Q4_K_S 69.5 GB

KV Cache:MLA 压缩缓存 ≈ 22.5 KiB/token((256 + 64) × 2 B × 36 层);非吸收实现 576 KiB/token。256K 上下文 MLA 缓存 ≈ 5.6 GB。

参考配置

  • 24GB:不可行
  • 80GB 单卡:Q4 勉强可载,短上下文
  • 4×H100 / 2×H200 / 1×B200:官方最低;4×H200 / 2×B200:官方推荐

警示:high 推理档输出很长,预留输出 KV;vLLM 需 tensor-parallel ≥ 2。

硬件配置与预估吞吐
最低可跑(8K 上下文)
4 × RTX 3090 24GB
二手 ≈¥5,000 × 4 · 合计 ≈¥20,000 · 消费级
量化
Q5_K_M
解码
441 tok/s
最大上下文
414K
推荐配置(≥Q8 · 32K 上下文 · ≥15 tok/s)
Mac Studio M3 Ultra 256GB
≈¥50,000 · 合计 ≈¥50,000 · 统一内存
量化
BF16
解码
30 tok/s
最大上下文
36K
配置量化占用 / 显存解码 tok/s预填充 tok/s最大上下文
4× RTX 3090 24GB消费级Q5_K_M87 GB / 96 GB4419831414K
4× RTX 4090 24GB消费级Q5_K_M87 GB / 96 GB47422846414K
4× RTX 5090 32GB消费级FP8126 GB / 128 GB59829077200K
4× L4 24GB工作站Q5_K_M87 GB / 96 GB1418308414K
2× RTX A6000 48GB工作站Q5_K_M85 GB / 96 GB1815331523K
2× RTX 6000 Ada 48GB工作站Q5_K_M85 GB / 96 GB2266300523K
2× L40S 48GB工作站Q5_K_M85 GB / 96 GB2036300523K
RTX PRO 6000 Blackwell 96GB工作站Q5_K_M83 GB / 96 GB2498654578K
4× A10 24GB数据中心Q5_K_M87 GB / 96 GB2828585414K
2× A100 40GB数据中心Q4_K_M76 GB / 80 GB43221600173K
A100 80GB数据中心Q4_K_M75 GB / 80 GB33510800228K
H20 96GB数据中心Q5_K_M83 GB / 96 GB5562562578K
2× 昇腾 Ascend 910B 64GB数据中心FP8123 GB / 128 GB26719385419K
H100 80GB PCIe数据中心Q4_K_M75 GB / 80 GB32826169228K
H100 80GB SXM数据中心Q4_K_M75 GB / 80 GB55034235228K
AMD MI300X 192GB数据中心FP8122 GB / 192 GB522452426.2M
H200 141GB数据中心FP8122 GB / 141 GB473342351.7M
B200 192GB数据中心FP8122 GB / 192 GB789778856.2M
DGX Spark 128GB统一内存Q6_K97 GB / 120 GB2521461.0M
Mac M4 Max 128GB统一内存Q6_K97 GB / 120 GB5111771.0M
Mac Studio M3 Ultra 256GB统一内存BF16239 GB / 240 GB31197336K
Mac Studio M3 Ultra 512GB统一内存BF16239 GB / 490 GB31197311.1M

单流(batch=1)估算:解码 ≈ 显存带宽 × 效率 ÷ 每 token 读取字节(激活参数 × 量化位宽 + KV);预填充 ≈ FP16 算力 × 0.45 ÷ (2 × 激活参数)。多卡按张量并行、带宽求和 × 0.55。实际受引擎、驱动、PCIe 影响,误差 ±30%。反向查:我的卡能跑谁 →

用计算器按你的上下文与并发估算 →

编程LiveCodeBench 64(high)/ 32(instruct)(官方模型卡图表);SWE-bench 未披露。

推理GPQA Diamond 71.2(high)/ 59.1(instruct)、MMLU Pro 78(官方模型卡图表);HLE 未披露。

数学AIME 2025 84(high,图 1)/ 83.8(图 2)/ 36(instruct)(官方模型卡图表)。

指令遵循AllenAI IFBench 48(high)/ 35.7(instruct)、Arena Hard 58.3(官方模型卡图表)。

Agenttau2 / Terminal-Bench 官方未披露;Collie 62.9。

多模态MMMU-Pro 60(high)/ 46.3(instruct)(官方模型卡图表)。

中文官方支持中文,独立数据少。

逻辑能力

考试型推理中游:reasoning_effort=high 时 GPQA Diamond 71.2、AIME 2025 84(另一张图 83.8)、MMLU Pro 78,与 Magistral Medium 1.2 持平;instruct 模式下 GPQA 59.1、AIME 36、LiveCodeBench 32,差距很大。工程型推理:LiveCodeBench 64(high),继承 Devstral 但官方未给 SWE-bench 数字。长上下文 AA LCR 72。指令遵循偏弱(IFBench 48)。

亮点
  1. 1.Apache-2.0,指令 + 推理 + 多模态 + 编程 agent 单一权重,reasoning_effort 可切
  2. 2.6.5B 激活,官方称比 Small 3 吞吐 3 倍、端到端延迟降 40%
  3. 3.GPQA Diamond 71.2、AIME 2025 84、LiveCodeBench 64(high),输出比 gpt-oss-120b 短 20%
  1. 1.名为 Small 实为 119B,FP8 121 GB,24GB 单卡跑不了,官方最低 4×H100
  2. 2.推理档输出很长(AIME 均 27.9K 字符),关思考后 GPQA 掉到 59.1、AIME 36
  3. 3.Agent 类官方未给 SWE-bench / Terminal-Bench / tau2 数字,IFBench 仅 48
适合:低成本 API 多模态 agent · 80GB 单卡本地推理
不适合:24GB 消费卡 · 高难度数学 / 推理
基准分数来源日期证据
Artificial Analysis Intelligence IndexAA 综合指数20Artificial Analysis Intelligence Index v32026-08-28独立复测
LiveCodeBench竞赛编程64%Mistral Small 4 模型卡2026-08-28厂商公布
GPQA Diamond研究生级科学问答71.2%Mistral Small 4 模型卡2026-08-28厂商公布
AIME 2025美国数学邀请赛84%Mistral Small 4 模型卡2026-08-28厂商公布
Artificial Analysis Intelligence IndexAA 综合指数20Artificial Analysis (v4.1.1)2026-08-28独立复测
GPQA Diamond研究生级科学问答76.9%Artificial Analysis (v4.1.1)2026-08-28独立复测
Humanity's Last Exam人类最后考试9.9%Artificial Analysis (v4.1.1)2026-08-28独立复测
SciCode科学计算编程38%Artificial Analysis (v4.1.1)2026-08-28独立复测
Terminal-Bench Hard终端 agent(AA 困难子集)17.4%Artificial Analysis (v4.1.1)2026-08-28独立复测
τ²-Bench Telecom工具调用 agent(电信域)41.2%Artificial Analysis (v4.1.1)2026-08-28独立复测
MMMU-Pro多模态理解(Pro)56.8%Artificial Analysis (v4.1.1)2026-08-28独立复测
IFBench指令遵循48.2%Artificial Analysis (v4.1.1)2026-08-28独立复测
Terminal-Bench终端 agent21%Artificial Analysis · Terminal-Bench 2.12026-08-28独立复测
τ³-Bench Banking工具调用 agent(银行域)4.9%Artificial Analysis · τ³-Bench Banking2026-08-28独立复测

更新 2026-08-28 · 排名供选型参考,基准会饱和、会泄漏、会过时。