开源权重可下已被替代限制许可 · Databricks Open Model License
Databricks logo

DBRX

DBRX · 132B-A36B · Databricks · 发布 2024-03-27 · 已被替代

Databricks 的 132B 细粒度 MoE,短暂的开源榜首。

参数
132B 总 / 36B 激活
MOE
上下文
32K
价格 / 1M tok
自建
无官方 API
最低可跑
4× RTX 3090
Q4_K_M · 83 GB · ≈93 tok/s
Arena Elo
AA 综合指数
代码
GPQA 推理
类型
MoE
注意力
GQA(48 Q 头 / 8 KV 头)
层数
40
专家
16 · 激活 4
隐藏维
6144
词表
100,352

细粒度 MoE:16 专家 top-4(组合数 65 倍于 Mixtral);12T token;32K。

完善中

Token Embedding词表 100,352× 40 层注意力:GQAKV 头 8 · head_dim 128路由top-4E1E2E316 专家 · 激活 4 · d=6144LM Head132B / 36B 激活实线 = 已公开 · 虚线 = 未披露
精度权重大小说明
BF16264 GB官方精度
FP8暂无
Q8140 GB
Q477 GBGGUF Q4_K_M 或等效
消费级 24GB
不可行
单卡 80GB
Q4 约 77 GB 单卡勉强;BF16 4×80GB
8×80GB 节点
BF16 高并发

KV Cache:160 KiB/token。160 KiB/token

⚠ 能加载 ≠ 能在满上下文 / 高并发下舒服跑。标「估」的数字来自 计算器 公式或社区量化文件大小。

完善中

硬件配置与预估吞吐
最低可跑(8K 上下文)
4 × RTX 3090 24GB
二手 ≈¥5,000 × 4 · 合计 ≈¥20,000 · 消费级
量化
Q4_K_M
解码
93 tok/s
最大上下文
93K
推荐配置(≥Q8 · 32K 上下文 · ≥15 tok/s)
2 × A100 80GB
云 ≈$1.5/h × 2 · 合计 ≈¥120,000 · 数据中心
量化
FP8
解码
58 tok/s
最大上下文
328K
配置量化占用 / 显存解码 tok/s预填充 tok/s最大上下文
4× RTX 3090 24GB消费级Q4_K_M83 GB / 96 GB93177593K
4× RTX 4090 24GB消费级Q4_K_M83 GB / 96 GB100412593K
4× RTX 5090 32GB消费级Q6_K112 GB / 128 GB1315250113K
4× L4 24GB工作站Q4_K_M83 GB / 96 GB30150093K
2× RTX A6000 48GB工作站Q5_K_M95 GB / 96 GB3296316K
2× RTX 6000 Ada 48GB工作站Q5_K_M95 GB / 96 GB40113816K
2× L40S 48GB工作站Q5_K_M95 GB / 96 GB36113816K
RTX PRO 6000 Blackwell 96GB工作站Q5_K_M94 GB / 96 GB44156324K
4× A10 24GB数据中心Q4_K_M83 GB / 96 GB59155093K
4× A100 40GB数据中心FP8137 GB / 160 GB937800297K
A100 80GB数据中心Q4_K_M79 GB / 80 GB60195014K
H20 96GB数据中心Q5_K_M94 GB / 96 GB9946324K
2× 昇腾 Ascend 910B 64GB数据中心Q6_K109 GB / 128 GB583500128K
H100 80GB PCIe数据中心Q4_K_M79 GB / 80 GB59472514K
H100 80GB SXM数据中心Q4_K_M79 GB / 80 GB98618114K
AMD MI300X 192GB数据中心FP8134 GB / 192 GB948169753K
H200 141GB数据中心FP8134 GB / 141 GB856181100K
B200 192GB数据中心FP8134 GB / 192 GB14214063753K
DGX Spark 128GB统一内存Q6_K108 GB / 120 GB4.538884K
Mac M4 Max 128GB统一内存Q6_K108 GB / 120 GB9.121384K
Mac Studio M3 Ultra 256GB统一内存FP8134 GB / 240 GB113561.3M
Mac Studio M3 Ultra 512GB统一内存BF16266 GB / 490 GB5.63561.4M

单流(batch=1)估算:解码 ≈ 显存带宽 × 效率 ÷ 每 token 读取字节(激活参数 × 量化位宽 + KV);预填充 ≈ FP16 算力 × 0.45 ÷ (2 × 激活参数)。多卡按张量并行、带宽求和 × 0.55。实际受引擎、驱动、PCIe 影响,误差 ±30%。反向查:我的卡能跑谁 →

用计算器按你的上下文与并发估算 →
可用维度不足 3 个,不绘制雷达图

编程HumanEval 70.1%(官方)。

数学GSM8K 66.9%(官方)。

知识MMLU 73.7%(官方)。

逻辑能力

2024 年初一线:MMLU 73.7%、GSM8K 66.9%、HumanEval 70.1%(官方)。

亮点
  1. 1.发布时超越 Mixtral 8x7B / Grok-1,代码 HumanEval 70.1%
  2. 2.16 选 4 细粒度专家设计早于 DeepSeek 流行
  3. 3.Databricks 平台原生集成
  1. 1.许可限制月活 7 亿并禁止用输出训练他模
  2. 2.仅 Databricks 生态活跃,社区量化少
  3. 3.三周后被 Llama 3 70B 超越,系列无后续
适合:MoE 设计研究 · Databricks 平台用户
不适合:新项目

暂无带来源的分数。

更新 2026-08-28 · 排名供选型参考,基准会饱和、会泄漏、会过时。