- 类型
- 未披露
- 注意力
- 未披露
- 层数
- 未披露
- 专家
- 未披露
- 隐藏维
- 未披露
- 词表
- 未披露
完善中
闭源模型,无自建选项,不提供显存表。
完善中
完善中
逻辑能力
考试型推理顶级;工程型推理中上。
亮点
- 1.HLE 25.4%(无工具)、GPQA 87.5%
- 2.256K 上下文
- 3.Grok 4 Heavy 多 agent 变体
坑
- 1.延迟高、吞吐低
- 2.代码 agent 生态弱
- 3.无自建
适合:科学推理 · 深度研究
不适合:低延迟产品
| 基准 | 分数 | 来源 | 日期 | 证据 |
|---|---|---|---|---|
| LMArena Text Elo人类偏好 Elo | 1430 | LMArena Text (style control) | 2025-12-20 | 独立复测 |
| SWE-bench Verified真实仓库修 bug | 75% | xAI 发布公告 | 2025-12-20 | 厂商公布 |
| GPQA Diamond研究生级科学问答 | 87.5% | xAI 发布公告 | 2025-12-20 | 厂商公布 |
| Humanity's Last Exam人类最后考试 | 25.4% | xAI 发布公告 | 2025-12-20 | 厂商公布 |
| AIME 2025美国数学邀请赛 | 91.7% | xAI 发布公告 | 2025-12-20 | 厂商公布 |
更新 2025-12-20 · 排名供选型参考,基准会饱和、会泄漏、会过时。
