开源权重可下已被替代可商用 · Apache-2.0
Mixtral 8x7B
Mixtral · 8x7B · Mistral AI · 发布 2023-12-11 · 已被替代 → Mistral Small 3.2
把 MoE 带进开源主流的里程碑,12.9B 激活打平 Llama 2 70B。
参数
46.7B 总 / 12.9B 激活
MOE
上下文
32K
价格 / 1M tok
$0.24 / $0.24
第三方托管常见价(DeepI · 2026-08-28
最低可跑
2× RTX 4060 Ti
Q4_K_M · 30 GB · ≈37 tok/s
Arena Elo—
AA 综合指数—
代码—
GPQA 推理—
架构简图
- 类型
- MoE
- 注意力
- GQA(32 Q 头 / 8 KV 头)
- 层数
- 32
- 专家
- 8 · 激活 2
- 隐藏维
- 4096
- 词表
- 32,000
第一款广泛流行的开源 MoE:8 专家 top-2,FFN 14,336;上下文 32K。
类型:稀疏 MoE Transformer,46.7B 总参 / 12.9B 激活。
- 32 层,隐藏维 4096,词表 32,000
- 每层 8 个专家 FFN(14,336),router top-2;无共享专家
- GQA:32 Query 头 / 8 KV 头,head_dim 128;RoPE θ=1e6
- 上下文 32,768(无滑窗)
参考:《Mixtral of Experts》。
| 精度 | 权重大小 | 说明 |
|---|---|---|
| BF16 | 93 GB | 官方精度 |
| FP8 | — | 暂无 |
| Q8 | 50 GB | |
| Q4 | 26 GB | GGUF Q4_K_M 或等效 |
- 消费级 24GB
- Q4_K_M 26.4 GB 略超 24GB,需 Q3 或 CPU 卸载部分专家
- 单卡 80GB
- BF16 93 GB 需 2×80GB;Q8 单卡 80GB
- 8×80GB 节点
- 高并发
KV Cache:128 KiB/token(与 7B 相同,MoE 不增加 KV);32K 约 4 GB。 ≈ 128 KiB/token
⚠ 能加载 ≠ 能在满上下文 / 高并发下舒服跑。标「估」的数字来自 计算器 公式或社区量化文件大小。
| 精度 | 权重大小 | 参考硬件 | 说明 |
|---|---|---|---|
| BF16 | 93.4 GB | 2×80GB | 官方 safetensors |
| Q8 | ≈ 49.6 GB | 80GB 单卡 | GGUF Q8_0 |
| Q4 | 26.4 GB | 32GB / 2×24GB | GGUF Q4_K_M(TheBloke) |
KV Cache:128 KiB/token。
参考配置:
- RTX 4090 24GB:Q3_K_M 约 20 GB 或 Q4 + 专家 CPU 卸载
- A100/H100 80GB:Q8 或 FP8,32K 上下文
- 2×80GB:BF16
硬件配置与预估吞吐
最低可跑(8K 上下文)
2 × RTX 4060 Ti 16GB
≈¥3,500 × 2 · 合计 ≈¥7,000 · 消费级
量化
Q4_K_M
解码
37 tok/s
最大上下文
26K
推荐配置(≥Q8 · 32K 上下文 · ≥15 tok/s)
A100 80GB
云 ≈$1.5/h · 合计 ≈¥60,000 · 数据中心
量化
FP8
解码
88 tok/s
最大上下文
514K
| 配置 | 量化 | 占用 / 显存 | 解码 tok/s | 预填充 tok/s | 最大上下文 |
|---|---|---|---|---|---|
| 2× RTX 4060 Ti 16GB消费级 | Q4_K_M | 30 GB / 32 GB | 37 | 767 | 26K |
| 2× RTX 3090 24GB消费级 | Q6_K估 | 41 GB / 48 GB | 90 | 2477 | 66K |
| 2× RTX 4070 Ti Super 16GB消费级 | Q4_K_M | 30 GB / 32 GB | 86 | 1535 | 26K |
| 2× RTX 5070 Ti 16GB消费级 | Q4_K_M | 30 GB / 32 GB | 115 | 3070 | 26K |
| 2× RTX 4080 Super 16GB消费级 | Q4_K_M | 30 GB / 32 GB | 95 | 1814 | 26K |
| 2× RTX 5080 16GB消费级 | Q4_K_M | 30 GB / 32 GB | 123 | 3907 | 26K |
| 2× RTX 4090 24GB消费级 | Q6_K估 | 41 GB / 48 GB | 97 | 5756 | 66K |
| RTX 5090 32GB消费级 | Q4_K_M | 29 GB / 32 GB | 136 | 3663 | 35K |
| 2× L4 24GB工作站 | Q6_K估 | 41 GB / 48 GB | 29 | 2093 | 66K |
| RTX A6000 48GB工作站 | Q6_K估 | 40 GB / 48 GB | 44 | 1343 | 76K |
| RTX 6000 Ada 48GB工作站 | Q6_K估 | 40 GB / 48 GB | 55 | 1587 | 76K |
| L40S 48GB工作站 | Q6_K估 | 40 GB / 48 GB | 49 | 1587 | 76K |
| RTX PRO 6000 Blackwell 96GB工作站 | BF16 | 96 GB / 96 GB | 43 | 4360 | 11K |
| 2× A10 24GB数据中心 | Q6_K估 | 41 GB / 48 GB | 58 | 2163 | 66K |
| A100 40GB数据中心 | Q6_K估 | 40 GB / 40 GB | 89 | 5442 | 12K |
| A100 80GB数据中心 | FP8估 | 48 GB / 80 GB | 99 | 5442 | 514K |
| H20 96GB数据中心 | BF16 | 96 GB / 96 GB | 97 | 1291 | 11K |
| 昇腾 Ascend 910B 64GB数据中心 | FP8估 | 48 GB / 64 GB | 77 | 4884 | 258K |
| H100 80GB PCIe数据中心 | FP8估 | 48 GB / 80 GB | 97 | 13186 | 514K |
| H100 80GB SXM数据中心 | FP8估 | 48 GB / 80 GB | 162 | 17250 | 514K |
| AMD MI300X 192GB数据中心 | BF16 | 96 GB / 192 GB | 128 | 22797 | 779K |
| H200 141GB数据中心 | BF16 | 96 GB / 141 GB | 116 | 17250 | 371K |
| B200 192GB数据中心 | BF16 | 96 GB / 192 GB | 193 | 39244 | 779K |
| Mac M4 Pro 64GB统一内存 | FP8估 | 48 GB / 56 GB | 10 | 297 | 130K |
| DGX Spark 128GB统一内存 | BF16 | 96 GB / 120 GB | 5.1 | 1081 | 203K |
| Mac M4 Max 128GB统一内存 | BF16 | 96 GB / 120 GB | 10 | 593 | 203K |
| Mac Studio M3 Ultra 256GB统一内存 | BF16 | 96 GB / 240 GB | 15 | 994 | 1.1M |
| Mac Studio M3 Ultra 512GB统一内存 | BF16 | 96 GB / 490 GB | 15 | 994 | 3.1M |
单流(batch=1)估算:解码 ≈ 显存带宽 × 效率 ÷ 每 token 读取字节(激活参数 × 量化位宽 + KV);预填充 ≈ FP16 算力 × 0.45 ÷ (2 × 激活参数)。多卡按张量并行、带宽求和 × 0.55。实际受引擎、驱动、PCIe 影响,误差 ±30%。反向查:我的卡能跑谁 →
可用维度不足 3 个,不绘制雷达图
编程HumanEval 40.2%(官方基座)。
数学GSM8K 74.4%(官方基座,8-shot)。
知识MMLU 70.6%(官方)。
中文弱。
逻辑能力
2023 年末开源顶级:MMLU 70.6%、GSM8K 74.4%(官方基座数据),推理与 Llama 2 70B 相当。无 CoT 专训,复杂题目会错但格式稳定。
亮点
- 1.首个大规模流行的开源稀疏 MoE,推理速度接近 13B Dense
- 2.Apache-2.0 无限制商用,当年 Arena 开源第一
- 3.32K 上下文,法德西意多语言
坑
- 1.总参 46.7B,显存按 47B 算,24GB 卡放不下 Q4
- 2.中文弱、无工具调用原生格式
- 3.2025 年 24B Dense(Mistral Small 3)已全面超过它
适合:MoE 研究 / 教学对照 · 已有部署的维护
不适合:中文 · 代码 / 数学新项目
暂无带来源的分数。
更新 2026-08-28 · 排名供选型参考,基准会饱和、会泄漏、会过时。