开源权重可下推理模型·可关多模态单卡可跑可商用 · Apache-2.0
Meta logo

Muse Glimmer 30B

Meta Muse Glimmer 30B · Meta · 发布 2026-08-10 · 当前代

Meta 回归开源:30B 稠密 agent 模型,24GB 单卡跑。

参数
29.6B
DENSE
上下文
128K
价格 / 1M tok
$0.30 / $1.10
第三方托管常见价(OpenR · 2026-08-28
最低可跑
2× RTX 3060
Q5_K_M · 23 GB · ≈19 tok/s
Arena Elo
AA 综合指数35
2026-08-28
真实仓库修 bug76
2026-08-28
GPQA 推理83.5
2026-08-28
类型
Dense
注意力
GQA(32 Q 头 / 2 KV 头,16:1)
层数
52
隐藏维
6656
词表
202,048

稠密因果 Transformer + 约 1.8B Perception Encoder 视觉编码器。词表 200K BPE + 2048 特殊 token。官方配 DFlash 投机解码 drafter。

类型:稠密 Transformer,约 29.6B 参数(含约 1.8B 视觉编码器)。

  • 语言模型 52 层,隐藏维 6656,词表 202,048(200K BPE + 2,048 特殊 token)
  • GQA:32 Q 头 / 2 KV 头,head_dim 128 —— 16:1 极端比例,KV Cache 非常小
  • 视觉:Meta Perception Encoder,图文输入、文本输出
  • 上下文 131,072+
  • 配套 DFlash 投机解码 drafter:RTX 5090 3.1×、M5 Max 1.8×、M4 Max 1.5×

参考:HF 模型卡。

Token Embedding词表 202,048× 52 层注意力:GQAKV 头 2 · head_dim 128Dense FFN隐藏维 6656Dense:每个 token 经过全部参数LM Head29.6B实线 = 已公开 · 虚线 = 未披露
精度权重大小说明
BF1655 GB官方精度
FP834 GB
Q830 GB
Q418 GBGGUF Q4_K_M 或等效
消费级 24GB
官方 4-bit K-Quant 约 17–20 GB,24GB 单卡 / 32GB 官方目标配置
单卡 80GB
BF16 55 GB 单卡全精度 + 长上下文
8×80GB 节点
无必要

KV Cache:2 KV 头 × 128 × 2 × 52 层 × 2 B = 52 KiB/token,128K 上下文仅约 6.5 GB,极省显存。52 KiB/token

⚠ 能加载 ≠ 能在满上下文 / 高并发下舒服跑。标「估」的数字来自 计算器 公式或社区量化文件大小。

精度权重大小参考显存
BF1655 GB80GB 单卡
4-bit K-Quant(官方两档)≈ 17–20 GB24GB / 32GB 消费卡

KV Cache:2 KV 头 × 128 × 2 × 52 层 × 2 B = 52 KiB/token;128K 上下文 ≈ 6.5 GB。

参考配置

  • 24GB(4090 / 5090):官方目标,4-bit + 数万 token 上下文
  • 32GB(5090):4-bit 高档量化 + 满上下文
  • 80GB:BF16 全精度 + 128K
  • Mac M4 / M5 Max:官方 MLX 支持

实测:RTX 5090 基线 74.9 tok/s,DFlash 投机 233.4 tok/s(官方)。

硬件配置与预估吞吐
最低可跑(8K 上下文)
2 × RTX 3060 12GB
≈¥2,000 × 2 · 合计 ≈¥4,000 · 消费级
量化
Q5_K_M
解码
19 tok/s
最大上下文
23K
推荐配置(≥Q8 · 32K 上下文 · ≥15 tok/s)
RTX A6000 48GB
≈¥35,000 · 合计 ≈¥35,000 · 工作站
量化
FP8
解码
16 tok/s
最大上下文
488K
配置量化占用 / 显存解码 tok/s预填充 tok/s最大上下文
2× RTX 3060 12GB消费级Q5_K_M23 GB / 24 GB1938023K
2× RTX 4060 Ti 16GB消费级Q6_K26 GB / 32 GB13334117K
RTX 3090 24GB消费级Q5_K_M22 GB / 24 GB2954047K
2× RTX 4070 Ti Super 16GB消费级Q6_K26 GB / 32 GB31669117K
2× RTX 5070 Ti 16GB消费级Q6_K26 GB / 32 GB411338117K
2× RTX 4080 Super 16GB消费级Q6_K26 GB / 32 GB34791117K
2× RTX 5080 16GB消费级Q6_K26 GB / 32 GB441703117K
RTX 4090 24GB消费级Q5_K_M22 GB / 24 GB31125447K
RTX 5090 32GB消费级Q8_031 GB / 32 GB37159624K
L4 24GB工作站Q5_K_M22 GB / 24 GB9.345647K
RTX A6000 48GB工作站FP836 GB / 48 GB17585488K
RTX 6000 Ada 48GB工作站FP836 GB / 48 GB21692488K
L40S 48GB工作站FP836 GB / 48 GB19692488K
RTX PRO 6000 Blackwell 96GB工作站BF1657 GB / 96 GB201900784K
A10 24GB数据中心Q5_K_M22 GB / 24 GB1947147K
A100 40GB数据中心FP836 GB / 40 GB342372173K
A100 80GB数据中心BF1657 GB / 80 GB222372469K
H20 96GB数据中心BF1657 GB / 96 GB44563784K
昇腾 Ascend 910B 64GB数据中心BF1657 GB / 64 GB172128154K
H100 80GB PCIe数据中心BF1657 GB / 80 GB225747469K
H100 80GB SXM数据中心BF1657 GB / 80 GB377518469K
AMD MI300X 192GB数据中心BF1657 GB / 192 GB5899352.6M
H200 141GB数据中心BF1657 GB / 141 GB5275181.6M
B200 192GB数据中心BF1657 GB / 192 GB87171032.6M
Mac M4 Pro 64GB统一内存FP836 GB / 56 GB4.6129803K
DGX Spark 128GB统一内存BF1657 GB / 120 GB2.34711.2M
Mac M4 Max 128GB统一内存BF1657 GB / 120 GB4.62581.2M
Mac Studio M3 Ultra 256GB统一内存BF1657 GB / 240 GB6.94333.5M
Mac Studio M3 Ultra 512GB统一内存BF1657 GB / 490 GB6.94338.3M

单流(batch=1)估算:解码 ≈ 显存带宽 × 效率 ÷ 每 token 读取字节(激活参数 × 量化位宽 + KV);预填充 ≈ FP16 算力 × 0.45 ÷ (2 × 激活参数)。多卡按张量并行、带宽求和 × 0.55。实际受引擎、驱动、PCIe 影响,误差 ±30%。反向查:我的卡能跑谁 →

用计算器按你的上下文与并发估算 →

编程SWE-bench Verified 76.0%、SWE-bench Pro 51.2%、Terminal-Bench 2.1 51.7%(官方)。

推理GPQA Diamond 83.5、HLE 文本 22.0(官方)。

数学AIME 2026 94.7(官方;AIME 2025 未披露)。

AgentMCP-Atlas 75.5、OSWorld-Verified 65.9(官方)。

多模态MMMU-Pro 74(官方)。

中文官方支持 100+ 语言,中文未单独评测。

逻辑能力

考试型推理在 30B 级别顶尖(GPQA 83.5、AIME 2026 94.7、HLE 文本 22.0),工程型推理同样突出(SWE-bench Verified 76.0%、Terminal-Bench 2.1 51.7%),AA 智能指数 35 超过 Nemotron 3 Super。reasoning effort 可调,关闭思考时能力回落。

亮点
  1. 1.Apache-2.0,Meta 首个 Muse 系开源权重,从 Muse Spark 蒸馏
  2. 2.SWE-bench Verified 76.0%、GPQA Diamond 83.5、AIME 2026 94.7(官方)
  3. 3.4-bit 不到 20 GB,2 KV 头 KV 极省,配 DFlash 投机解码 RTX 5090 提速 3.1×
  1. 1.刚发布不到一月,独立复测与长期稳定性待观察
  2. 2.上下文 128K,低于同级 Qwen / Gemma 的 256K+
  3. 3.中文能力官方称 100+ 语言但无中文专项数据
适合:24GB 单卡本地编程 agent · 本地多模态助手 / 工具调用 · MCP / 长任务 agent
不适合:超长上下文(>128K) · 中文为主产品的首选
基准分数来源日期证据
Artificial Analysis Intelligence IndexAA 综合指数35Artificial Analysis Intelligence Index v32026-08-28独立复测
SWE-bench Verified真实仓库修 bug76%Muse Glimmer 模型卡2026-08-28厂商公布
GPQA Diamond研究生级科学问答83.5%Muse Glimmer 模型卡2026-08-28厂商公布
Humanity's Last Exam人类最后考试22%Muse Glimmer 模型卡2026-08-28厂商公布
Terminal-Bench终端 agent51.7%Muse Glimmer 模型卡2026-08-28厂商公布
Artificial Analysis Intelligence IndexAA 综合指数35Artificial Analysis (v4.1.1)2026-08-28独立复测
GPQA Diamond研究生级科学问答83.5%Artificial Analysis (v4.1.1)2026-08-28独立复测
Humanity's Last Exam人类最后考试22%Artificial Analysis (v4.1.1)2026-08-28独立复测
SciCode科学计算编程43.6%Artificial Analysis (v4.1.1)2026-08-28独立复测
MMMU-Pro多模态理解(Pro)74.3%Artificial Analysis (v4.1.1)2026-08-28独立复测
Terminal-Bench终端 agent51.7%Artificial Analysis · Terminal-Bench 2.12026-08-28独立复测
τ³-Bench Banking工具调用 agent(银行域)23.5%Artificial Analysis · τ³-Bench Banking2026-08-28独立复测
LMArena Chinese Elo中文人类偏好 Elo1477LMArena Text · Chinese (style control)2026-08-28独立复测

更新 2026-08-28 · 排名供选型参考,基准会饱和、会泄漏、会过时。