开源权重可下推理模型不可商用 · MiniMax Non-Commercial License(MIT-style)
MiniMax logo

MiniMax-M2.7

MiniMax M2.7 · MiniMax · 发布 2026-03-18 · 当前代

10B 激活的 agent 编程模型,但权重仅限非商用。

参数
229B 总 / 10B 激活
MOE
上下文
200K
价格 / 1M tok
$0.30 / $1.20
MiniMax 开放平台 · 2026-08-28
最低可跑
Mac Studio M3 Ultra
FP8 · 232 GB · ≈37 tok/s
Arena Elo
AA 综合指数39
2026-08-28
代码
GPQA 推理87.4
2026-08-28
类型
MoE
注意力
GQA(48 Q 头 / 8 KV 头)
层数
62
专家
256 · 激活 8
隐藏维
3072
词表
200,064

与 M2 同构(62 层 GQA + 256 专家),3 个 MTP 模块,QK-norm。HF 发布版为 FP8(block 128×128)。预训练 29.2T token(NVIDIA 技术博客)。

完善中

Token Embedding词表 200,064× 62 层注意力:GQAKV 头 8 · head_dim 128路由top-8E1E2E3256 专家 · 激活 8 · d=3072LM Head229B / 10B 激活实线 = 已公开 · 虚线 = 未披露
精度权重大小说明
BF16458 GB官方精度
FP8230 GB
Q8243 GB
Q4133 GBGGUF Q4_K_M 或等效
消费级 24GB
不可行
单卡 80GB
不可行(Q4 约 133 GB)
8×80GB 节点
FP8 230 GB 官方发布版,4×H100 起

KV Cache:8 KV 头 × 128 × 2 × 62 层 × 2 B = 248 KiB/token。248 KiB/token

⚠ 能加载 ≠ 能在满上下文 / 高并发下舒服跑。标「估」的数字来自 计算器 公式或社区量化文件大小。

完善中

硬件配置与预估吞吐
最低可跑(8K 上下文)
Mac Studio M3 Ultra 256GB
≈¥50,000 · 合计 ≈¥50,000 · 统一内存
量化
FP8
解码
37 tok/s
最大上下文
73K
推荐配置(≥Q8 · 32K 上下文 · ≥15 tok/s)
Mac Studio M3 Ultra 256GB
≈¥50,000 · 合计 ≈¥50,000 · 统一内存
量化
FP8
解码
29 tok/s
最大上下文
73K
配置量化占用 / 显存解码 tok/s预填充 tok/s最大上下文
8× L4 24GB工作站Q5_K_M170 GB / 192 GB14710800101K
4× RTX A6000 48GB工作站Q6_K190 GB / 192 GB168693017K
4× RTX 6000 Ada 48GB工作站Q6_K190 GB / 192 GB210819017K
4× L40S 48GB工作站Q6_K190 GB / 192 GB189819017K
2× RTX PRO 6000 Blackwell 96GB工作站Q6_K188 GB / 192 GB1961125026K
8× A10 24GB数据中心Q5_K_M170 GB / 192 GB29411160101K
4× A100 40GB数据中心Q4_K_M140 GB / 160 GB4342808092K
2× A100 80GB数据中心Q4_K_M137 GB / 160 GB28514040102K
2× H20 96GB数据中心Q6_K188 GB / 192 GB436333026K
4× 昇腾 Ascend 910B 64GB数据中心FP8236 GB / 256 GB31925200175K
2× H100 80GB PCIe数据中心Q4_K_M137 GB / 160 GB27934020102K
2× H100 80GB SXM数据中心Q4_K_M137 GB / 160 GB46844505102K
AMD MI300X 192GB数据中心Q6_K186 GB / 192 GB3422940831K
H200 141GB数据中心Q4_K_M136 GB / 141 GB3962225328K
B200 192GB数据中心Q6_K186 GB / 192 GB5165062531K
2× DGX Spark 128GB统一内存FP8233 GB / 240 GB25279063K
Mac Studio M3 Ultra 256GB统一内存FP8232 GB / 240 GB37128373K
Mac Studio M3 Ultra 512GB统一内存BF16461 GB / 490 GB191283129K

单流(batch=1)估算:解码 ≈ 显存带宽 × 效率 ÷ 每 token 读取字节(激活参数 × 量化位宽 + KV);预填充 ≈ FP16 算力 × 0.45 ÷ (2 × 激活参数)。多卡按张量并行、带宽求和 × 0.55。实际受引擎、驱动、PCIe 影响,误差 ±30%。反向查:我的卡能跑谁 →

用计算器按你的上下文与并发估算 →

编程SWE-Pro 56.22、Terminal Bench 2 57.0、SWE Multilingual 76.5、Multi-SWE 52.7(官方)。

AgentToolathon 46.3、GDPval-AA 1495、MM Claw 62.7(官方)。

逻辑能力

工程型推理为主:SWE-Pro 56.22、Multi-SWE 52.7、NL2Repo 39.8、MLE Bench Lite 66.6% 奖牌率。

亮点
  1. 1.SWE-Pro 56.22、Terminal Bench 2 57.0、GDPval-AA Elo 1495(发布时开源最高)
  2. 2.10B 激活低延迟,FP8 230 GB 4×H100 可跑
  3. 3.原生 Agent Teams 多 agent 协作
  1. 1.许可为非商用:商用须 MiniMax 书面授权并标注「Built with MiniMax M2.7」,与 M2 的 MIT 不同
  2. 2.已被 M3 取代旗舰;多模态需用 M3
  3. 3.通用推理基准(GPQA / AIME)官方未披露
适合:非商用 / 研究自建的编程 agent · API 低成本 agent 服务
不适合:商用自建(许可限制) · 多模态
基准分数来源日期证据
Terminal-Bench终端 agent57%MiniMax M2.7 模型卡2026-08-28厂商公布
Artificial Analysis Intelligence IndexAA 综合指数39Artificial Analysis (v4.1.1)2026-08-28独立复测
GPQA Diamond研究生级科学问答87.4%Artificial Analysis (v4.1.1)2026-08-28独立复测
Humanity's Last Exam人类最后考试29.6%Artificial Analysis (v4.1.1)2026-08-28独立复测
SciCode科学计算编程47%Artificial Analysis (v4.1.1)2026-08-28独立复测
Terminal-Bench Hard终端 agent(AA 困难子集)39.4%Artificial Analysis (v4.1.1)2026-08-28独立复测
τ²-Bench Telecom工具调用 agent(电信域)84.8%Artificial Analysis (v4.1.1)2026-08-28独立复测
IFBench指令遵循75.7%Artificial Analysis (v4.1.1)2026-08-28独立复测
Terminal-Bench终端 agent55.4%Artificial Analysis · Terminal-Bench 2.12026-08-28独立复测
τ³-Bench Banking工具调用 agent(银行域)9.9%Artificial Analysis · τ³-Bench Banking2026-08-28独立复测
LMArena Chinese Elo中文人类偏好 Elo1443LMArena Text · Chinese (style control)2026-08-28独立复测

更新 2026-08-28 · 排名供选型参考,基准会饱和、会泄漏、会过时。