开源权重可下推理模型·可关多模态限制许可 · MiniMax Community License
MiniMax logo

MiniMax-M3

MiniMax M3 · MiniMax · 发布 2026-06-01 · 当前代

428B/23B 稀疏注意力多模态开源模型,1M 上下文低价。

参数
428B 总 / 23B 激活
MOE
上下文
1M
价格 / 1M tok
$0.30 / $1.20
MiniMax 开放平台 · 2026-08-28
最低可跑
Mac Studio M3 Ultra
FP8 · 430 GB · ≈17 tok/s
Arena Elo1442
2026-08-28
AA 综合指数45
2026-08-28
代码
GPQA 推理92.9
2026-08-28
类型
MoE
注意力
MSA 块稀疏注意力(GQA 64 Q 头 / 4 KV 头)
层数
60
专家
128 · 激活 4 + 共享
隐藏维
6144
词表
200,064

MiniMax Sparse Attention(MSA):在 GQA 之上用 4 头索引分支选 top-16 个 128-token 块做块稀疏注意力;前 3 层全注意力 + Dense MLP。专家 128 路由 + 1 共享,每 token 4 个,swigluoai 激活,QK-norm,半维 RoPE。7 个 MTP 模块。原生多模态(CLIP 式 ViT,32 层,2016px),从预训练第一步混合模态。

类型:MoE + 块稀疏注意力,428B 总 / 23B 激活,原生多模态。

  • 60 层(前 3 层全注意力 + Dense MLP 12288),隐藏维 6144,词表 200,064
  • 专家:128 路由 + 1 共享,每 token 激活 4 个,专家中间维 3072,sigmoid 路由 + 路由偏置
  • MSA(MiniMax Sparse Attention):GQA 64 Q 头 / 4 KV 头,head_dim 128;4 头索引分支(维 128)对 128-token 块打分选 top-16 块;从第 4 层起启用
  • 半维 RoPE(rotary_dim 64),QK-norm(per-head),Gemma 式 norm,swigluoai 激活
  • 7 个 MTP 模块用于投机解码
  • 上下文 1,048,576,RoPE theta 5e6
  • 视觉:32 层 ViT(隐藏 1280,patch 14,最大 2016px,3D RoPE),投影到 6144

参考:MSA 论文(arXiv 2606.13392)、HF 模型卡。

Token Embedding词表 200,064× 60 层注意力:MSA 块稀疏注意力KV 头 4 · head_dim 128路由top-4E1E2E3共享专家128 专家 · 激活 4 · d=6144LM Head428B / 23B 激活实线 = 已公开 · 虚线 = 未披露
精度权重大小说明
BF16854 GB官方精度
FP8428 GB
Q8454 GB
Q4248 GBGGUF Q4_K_M 或等效
消费级 24GB
不可行
单卡 80GB
不可行
8×80GB 节点
BF16 854 GB 需 8×H200;FP8 428 GB 可 8×H100(KV 余量约 200 GB)

KV Cache:4 KV 头 × 128 × 2 × 60 层 × 2 B = 120 KiB/token;MSA 只减少注意力计算,KV 仍全量存储。1M 上下文单请求 ≈ 117 GB。120 KiB/token

⚠ 能加载 ≠ 能在满上下文 / 高并发下舒服跑。标「估」的数字来自 计算器 公式或社区量化文件大小。

精度权重大小参考显存
BF16854 GB(官方文件)8×H200
FP8≈ 428 GB(估)8×H100
Q4≈ 248 GB(估)4×80GB

KV Cache:≈ 120 KiB/token。128K 上下文 ≈ 15 GB,1M ≈ 117 GB。MSA 降低的是注意力计算,不是 KV 存储。

参考配置

  • 24GB / 80GB:不可行
  • 8×H100:FP8 权重 + 有限并发
  • 8×H200:BF16 舒适
  • ROCm ATOM 提供 MXFP4 / MXFP8 路径
硬件配置与预估吞吐
最低可跑(8K 上下文)
Mac Studio M3 Ultra 512GB
≈¥75,000 · 合计 ≈¥75,000 · 统一内存
量化
FP8
解码
17 tok/s
最大上下文
1.0M
推荐配置(≥Q8 · 32K 上下文 · ≥15 tok/s)
Mac Studio M3 Ultra 512GB
≈¥75,000 · 合计 ≈¥75,000 · 统一内存
量化
FP8
解码
16 tok/s
最大上下文
1.0M
配置量化占用 / 显存解码 tok/s预填充 tok/s最大上下文
8× L40S 48GB工作站Q6_K353 GB / 384 GB1967122273K
4× RTX PRO 6000 Blackwell 96GB工作站Q6_K348 GB / 384 GB2039783314K
8× A100 40GB数据中心Q5_K_M306 GB / 320 GB40524417129K
4× A100 80GB数据中心Q5_K_M301 GB / 320 GB26612209170K
4× H20 96GB数据中心Q6_K348 GB / 384 GB4532896314K
4× 昇腾 Ascend 910B 64GB数据中心Q4_K_M254 GB / 256 GB2451095727K
4× H100 80GB PCIe数据中心Q5_K_M301 GB / 320 GB26129583170K
4× H100 80GB SXM数据中心Q5_K_M301 GB / 320 GB43738700170K
2× AMD MI300X 192GB数据中心Q6_K346 GB / 384 GB30025572335K
2× H200 141GB数据中心Q4_K_M251 GB / 282 GB36819350270K
2× B200 192GB数据中心Q6_K346 GB / 384 GB45344022335K
Mac Studio M3 Ultra 512GB统一内存FP8430 GB / 490 GB175581.0M

单流(batch=1)估算:解码 ≈ 显存带宽 × 效率 ÷ 每 token 读取字节(激活参数 × 量化位宽 + KV);预填充 ≈ FP16 算力 × 0.45 ÷ (2 × 激活参数)。多卡按张量并行、带宽求和 × 0.55。实际受引擎、驱动、PCIe 影响,误差 ±30%。反向查:我的卡能跑谁 →

用计算器按你的上下文与并发估算 →

编程SWE-Bench Pro 59.0、Terminal-Bench 2.1 66.0、SWE-fficiency 34.8、KernelBench Hard 28.8(官方)。

推理官方未披露 GPQA / HLE;Z.ai GLM-5.2 对比表引用 GPQA 93、HLE 37。

AgentBrowseComp 83.5、MCP Atlas 74.2、PostTrainBench 37.1(官方)。

多模态原生图像 + 视频;官方博客未给出 MMMU 数值。

中文中文良好。

逻辑能力

工程型推理为主:SWE-Bench Pro 59.0、Terminal-Bench 2.1 66.0、MCP Atlas 74.2,BrowseComp 83.5。考试型基准官方未披露(Z.ai 对比表中列 GPQA 93、HLE 37,属第三方引用)。思考默认可切 adaptive。常见问题:长程自主任务(PostTrainBench 37.1)落后 Opus 4.8;多模态强于纯文本推理。

亮点
  1. 1.MSA 稀疏注意力:1M 上下文下 prefill 9× / decode 15× 于 M2,每 token 计算降至 1/20
  2. 2.原生多模态(文本 + 图像 + 视频),SWE-Bench Pro 59.0 与 GPT-5.5 持平,API 价 $0.3/$1.2
  3. 3.思考可选:enabled / adaptive / disabled 三档,低延迟场景可关
  1. 1.MiniMax Community License:商用须标注「Built with MiniMax M3」,年收入 > 2000 万美元须书面授权,非 MIT
  2. 2.428B 总参数,BF16 854 GB,比 M2 大近一倍;KV 120 KiB/token 不因 MSA 减少
  3. 3.纯文本编程弱于同期 GLM-5.2 / Kimi K3;LMArena 1442、AA 指数 45,在旗舰中偏低
适合:图像 / 视频 + 长上下文的 agent · 低成本 1M 上下文服务 · 自建 8×H100 级多模态推理
不适合:单卡部署 · 对纯文本编程要求最高(用 GLM-5.2 / K3) · 不愿标注品牌的商用产品
基准分数来源日期证据
LMArena Text Elo人类偏好 Elo1442LMArena Text (style control)2026-08-28独立复测
Artificial Analysis Intelligence IndexAA 综合指数45Artificial Analysis Intelligence Index v32026-08-28独立复测
Terminal-Bench终端 agent66%MiniMax M3 官方博客2026-08-28厂商公布
Artificial Analysis Intelligence IndexAA 综合指数45Artificial Analysis (v4.1.1)2026-08-28独立复测
GPQA Diamond研究生级科学问答92.9%Artificial Analysis (v4.1.1)2026-08-28独立复测
Humanity's Last Exam人类最后考试39%Artificial Analysis (v4.1.1)2026-08-28独立复测
SciCode科学计算编程45.4%Artificial Analysis (v4.1.1)2026-08-28独立复测
Terminal-Bench Hard终端 agent(AA 困难子集)42.4%Artificial Analysis (v4.1.1)2026-08-28独立复测
τ²-Bench Telecom工具调用 agent(电信域)88.9%Artificial Analysis (v4.1.1)2026-08-28独立复测
MMMU-Pro多模态理解(Pro)78.6%Artificial Analysis (v4.1.1)2026-08-28独立复测
IFBench指令遵循82.9%Artificial Analysis (v4.1.1)2026-08-28独立复测
Terminal-Bench终端 agent65.2%Artificial Analysis · Terminal-Bench 2.12026-08-28独立复测
τ³-Bench Banking工具调用 agent(银行域)15.3%Artificial Analysis · τ³-Bench Banking2026-08-28独立复测
LMArena Chinese Elo中文人类偏好 Elo1467LMArena Text · Chinese (style control)2026-08-28独立复测

更新 2026-08-28 · 排名供选型参考,基准会饱和、会泄漏、会过时。