MiniMax-M3
MiniMax M3 · MiniMax · 发布 2026-06-01 · 当前代
428B/23B 稀疏注意力多模态开源模型,1M 上下文低价。
- 类型
- MoE
- 注意力
- MSA 块稀疏注意力(GQA 64 Q 头 / 4 KV 头)
- 层数
- 60
- 专家
- 128 · 激活 4 + 共享
- 隐藏维
- 6144
- 词表
- 200,064
MiniMax Sparse Attention(MSA):在 GQA 之上用 4 头索引分支选 top-16 个 128-token 块做块稀疏注意力;前 3 层全注意力 + Dense MLP。专家 128 路由 + 1 共享,每 token 4 个,swigluoai 激活,QK-norm,半维 RoPE。7 个 MTP 模块。原生多模态(CLIP 式 ViT,32 层,2016px),从预训练第一步混合模态。
类型:MoE + 块稀疏注意力,428B 总 / 23B 激活,原生多模态。
- 60 层(前 3 层全注意力 + Dense MLP 12288),隐藏维 6144,词表 200,064
- 专家:128 路由 + 1 共享,每 token 激活 4 个,专家中间维 3072,sigmoid 路由 + 路由偏置
- MSA(MiniMax Sparse Attention):GQA 64 Q 头 / 4 KV 头,head_dim 128;4 头索引分支(维 128)对 128-token 块打分选 top-16 块;从第 4 层起启用
- 半维 RoPE(rotary_dim 64),QK-norm(per-head),Gemma 式 norm,swigluoai 激活
- 7 个 MTP 模块用于投机解码
- 上下文 1,048,576,RoPE theta 5e6
- 视觉:32 层 ViT(隐藏 1280,patch 14,最大 2016px,3D RoPE),投影到 6144
参考:MSA 论文(arXiv 2606.13392)、HF 模型卡。
| 精度 | 权重大小 | 说明 |
|---|---|---|
| BF16 | 854 GB估 | 官方精度 |
| FP8 | 428 GB估 | |
| Q8 | 454 GB估 | |
| Q4 | 248 GB估 | GGUF Q4_K_M 或等效 |
- 消费级 24GB
- 不可行
- 单卡 80GB
- 不可行
- 8×80GB 节点
- BF16 854 GB 需 8×H200;FP8 428 GB 可 8×H100(KV 余量约 200 GB)
KV Cache:4 KV 头 × 128 × 2 × 60 层 × 2 B = 120 KiB/token;MSA 只减少注意力计算,KV 仍全量存储。1M 上下文单请求 ≈ 117 GB。 ≈ 120 KiB/token
⚠ 能加载 ≠ 能在满上下文 / 高并发下舒服跑。标「估」的数字来自 计算器 公式或社区量化文件大小。
| 精度 | 权重大小 | 参考显存 |
|---|---|---|
| BF16 | 854 GB(官方文件) | 8×H200 |
| FP8 | ≈ 428 GB(估) | 8×H100 |
| Q4 | ≈ 248 GB(估) | 4×80GB |
KV Cache:≈ 120 KiB/token。128K 上下文 ≈ 15 GB,1M ≈ 117 GB。MSA 降低的是注意力计算,不是 KV 存储。
参考配置:
- 24GB / 80GB:不可行
- 8×H100:FP8 权重 + 有限并发
- 8×H200:BF16 舒适
- ROCm ATOM 提供 MXFP4 / MXFP8 路径
| 配置 | 量化 | 占用 / 显存 | 解码 tok/s | 预填充 tok/s | 最大上下文 |
|---|---|---|---|---|---|
| 8× L40S 48GB工作站 | Q6_K估 | 353 GB / 384 GB | 196 | 7122 | 273K |
| 4× RTX PRO 6000 Blackwell 96GB工作站 | Q6_K估 | 348 GB / 384 GB | 203 | 9783 | 314K |
| 8× A100 40GB数据中心 | Q5_K_M估 | 306 GB / 320 GB | 405 | 24417 | 129K |
| 4× A100 80GB数据中心 | Q5_K_M估 | 301 GB / 320 GB | 266 | 12209 | 170K |
| 4× H20 96GB数据中心 | Q6_K估 | 348 GB / 384 GB | 453 | 2896 | 314K |
| 4× 昇腾 Ascend 910B 64GB数据中心 | Q4_K_M | 254 GB / 256 GB | 245 | 10957 | 27K |
| 4× H100 80GB PCIe数据中心 | Q5_K_M估 | 301 GB / 320 GB | 261 | 29583 | 170K |
| 4× H100 80GB SXM数据中心 | Q5_K_M估 | 301 GB / 320 GB | 437 | 38700 | 170K |
| 2× AMD MI300X 192GB数据中心 | Q6_K估 | 346 GB / 384 GB | 300 | 25572 | 335K |
| 2× H200 141GB数据中心 | Q4_K_M | 251 GB / 282 GB | 368 | 19350 | 270K |
| 2× B200 192GB数据中心 | Q6_K估 | 346 GB / 384 GB | 453 | 44022 | 335K |
| Mac Studio M3 Ultra 512GB统一内存 | FP8 | 430 GB / 490 GB | 17 | 558 | 1.0M |
单流(batch=1)估算:解码 ≈ 显存带宽 × 效率 ÷ 每 token 读取字节(激活参数 × 量化位宽 + KV);预填充 ≈ FP16 算力 × 0.45 ÷ (2 × 激活参数)。多卡按张量并行、带宽求和 × 0.55。实际受引擎、驱动、PCIe 影响,误差 ±30%。反向查:我的卡能跑谁 →
编程SWE-Bench Pro 59.0、Terminal-Bench 2.1 66.0、SWE-fficiency 34.8、KernelBench Hard 28.8(官方)。
推理官方未披露 GPQA / HLE;Z.ai GLM-5.2 对比表引用 GPQA 93、HLE 37。
AgentBrowseComp 83.5、MCP Atlas 74.2、PostTrainBench 37.1(官方)。
多模态原生图像 + 视频;官方博客未给出 MMMU 数值。
中文中文良好。
工程型推理为主:SWE-Bench Pro 59.0、Terminal-Bench 2.1 66.0、MCP Atlas 74.2,BrowseComp 83.5。考试型基准官方未披露(Z.ai 对比表中列 GPQA 93、HLE 37,属第三方引用)。思考默认可切 adaptive。常见问题:长程自主任务(PostTrainBench 37.1)落后 Opus 4.8;多模态强于纯文本推理。
- 1.MSA 稀疏注意力:1M 上下文下 prefill 9× / decode 15× 于 M2,每 token 计算降至 1/20
- 2.原生多模态(文本 + 图像 + 视频),SWE-Bench Pro 59.0 与 GPT-5.5 持平,API 价 $0.3/$1.2
- 3.思考可选:enabled / adaptive / disabled 三档,低延迟场景可关
- 1.MiniMax Community License:商用须标注「Built with MiniMax M3」,年收入 > 2000 万美元须书面授权,非 MIT
- 2.428B 总参数,BF16 854 GB,比 M2 大近一倍;KV 120 KiB/token 不因 MSA 减少
- 3.纯文本编程弱于同期 GLM-5.2 / Kimi K3;LMArena 1442、AA 指数 45,在旗舰中偏低
| 基准 | 分数 | 来源 | 日期 | 证据 |
|---|---|---|---|---|
| LMArena Text Elo人类偏好 Elo | 1442 | LMArena Text (style control) | 2026-08-28 | 独立复测 |
| Artificial Analysis Intelligence IndexAA 综合指数 | 45 | Artificial Analysis Intelligence Index v3 | 2026-08-28 | 独立复测 |
| Terminal-Bench终端 agent | 66% | MiniMax M3 官方博客 | 2026-08-28 | 厂商公布 |
| Artificial Analysis Intelligence IndexAA 综合指数 | 45 | Artificial Analysis (v4.1.1) | 2026-08-28 | 独立复测 |
| GPQA Diamond研究生级科学问答 | 92.9% | Artificial Analysis (v4.1.1) | 2026-08-28 | 独立复测 |
| Humanity's Last Exam人类最后考试 | 39% | Artificial Analysis (v4.1.1) | 2026-08-28 | 独立复测 |
| SciCode科学计算编程 | 45.4% | Artificial Analysis (v4.1.1) | 2026-08-28 | 独立复测 |
| Terminal-Bench Hard终端 agent(AA 困难子集) | 42.4% | Artificial Analysis (v4.1.1) | 2026-08-28 | 独立复测 |
| τ²-Bench Telecom工具调用 agent(电信域) | 88.9% | Artificial Analysis (v4.1.1) | 2026-08-28 | 独立复测 |
| MMMU-Pro多模态理解(Pro) | 78.6% | Artificial Analysis (v4.1.1) | 2026-08-28 | 独立复测 |
| IFBench指令遵循 | 82.9% | Artificial Analysis (v4.1.1) | 2026-08-28 | 独立复测 |
| Terminal-Bench终端 agent | 65.2% | Artificial Analysis · Terminal-Bench 2.1 | 2026-08-28 | 独立复测 |
| τ³-Bench Banking工具调用 agent(银行域) | 15.3% | Artificial Analysis · τ³-Bench Banking | 2026-08-28 | 独立复测 |
| LMArena Chinese Elo中文人类偏好 Elo | 1467 | LMArena Text · Chinese (style control) | 2026-08-28 | 独立复测 |
更新 2026-08-28 · 排名供选型参考,基准会饱和、会泄漏、会过时。