- 类型
- 未披露
- 注意力
- 未披露
- 层数
- 未披露
- 专家
- 未披露
- 隐藏维
- 未披露
- 词表
- 未披露
未披露。原生多模态推理模型,Contemplating 模式可编排多个并行 agent。
完善中
闭源模型,无自建选项,不提供显存表。
完善中
推理HLE 58%、FrontierScience Research 38%(Contemplating,官方)。
逻辑能力
考试型推理顶级(HLE 58% 带多 agent 编排);工程型推理官方图表未给数字。
亮点
- 1.LMArena 文本 1498(1.2 xHigh,第 4 名)
- 2.HLE 58%(Contemplating 模式,官方)
- 3.1M 上下文,编程 / 计算机使用优化,$1.25 / $4.25
坑
- 1.Meta 首个闭源旗舰,无权重
- 2.Contributor 低价档会拿数据训练,慎用
- 3.API 2026-07 才开放,生态与 SDK 尚新
适合:编程 agent / Muse Code · 超长上下文研究任务
不适合:自托管 · 数据敏感场景用 Contributor 档
| 基准 | 分数 | 来源 | 日期 | 证据 |
|---|---|---|---|---|
| LMArena Text Elo人类偏好 Elo | 1498 | LMArena Text (style control) | 2026-08-28 | 独立复测 |
| Artificial Analysis Intelligence IndexAA 综合指数 | 57 | Artificial Analysis Intelligence Index v3 | 2026-08-28 | 独立复测 |
| Humanity's Last Exam人类最后考试 | 58% | Meta Muse Spark 发布公告 | 2026-08-28 | 厂商公布 |
| Artificial Analysis Intelligence IndexAA 综合指数 | 44 | Artificial Analysis (v4.1.1) | 2026-08-28 | 独立复测 |
| GPQA Diamond研究生级科学问答 | 88.4% | Artificial Analysis (v4.1.1) | 2026-08-28 | 独立复测 |
| Humanity's Last Exam人类最后考试 | 40.7% | Artificial Analysis (v4.1.1) | 2026-08-28 | 独立复测 |
| SciCode科学计算编程 | 51.5% | Artificial Analysis (v4.1.1) | 2026-08-28 | 独立复测 |
| Terminal-Bench Hard终端 agent(AA 困难子集) | 45.5% | Artificial Analysis (v4.1.1) | 2026-08-28 | 独立复测 |
| τ²-Bench Telecom工具调用 agent(电信域) | 91.5% | Artificial Analysis (v4.1.1) | 2026-08-28 | 独立复测 |
| MMMU-Pro多模态理解(Pro) | 80.5% | Artificial Analysis (v4.1.1) | 2026-08-28 | 独立复测 |
| IFBench指令遵循 | 75.9% | Artificial Analysis (v4.1.1) | 2026-08-28 | 独立复测 |
| Terminal-Bench终端 agent | 62.2% | Artificial Analysis · Terminal-Bench 2.1 | 2026-08-28 | 独立复测 |
| LMArena Chinese Elo中文人类偏好 Elo | 1536 | LMArena Text · Chinese (style control) | 2026-08-28 | 独立复测 |
更新 2026-08-28 · 排名供选型参考,基准会饱和、会泄漏、会过时。