- 类型
- 未披露
- 注意力
- 未披露
- 层数
- 未披露
- 专家
- 未披露
- 隐藏维
- 未披露
- 词表
- 未披露
未披露。Colossus 20 万卡集群训练;Think 模式为推理版本,API 2025-04-09 开放。
完善中
闭源模型,无自建选项,不提供显存表。
完善中
完善中
逻辑能力
非推理版 GPQA 75.4%、LCB 57.0%;Think 版考试型推理进入第一梯队,工程型无官方数据。
亮点
- 1.LMArena Elo 1402("chocolate"),首个破 1400
- 2.Think 模式 AIME 2025 93.3%(cons@64)、GPQA 84.6%
- 3.DeepSearch 联网研究功能
坑
- 1.官方图表 cons@64 与他家 pass@1 对比引发争议
- 2.API 上下文 131K,非宣称的 1M
- 3.API 比产品晚近两个月
适合:历史对照
不适合:新项目
| 基准 | 分数 | 来源 | 日期 | 证据 |
|---|---|---|---|---|
| LMArena Text Elo人类偏好 Elo | 1402 | LMArena Text (style control) | 2025-02-19 | 独立复测 |
| LiveCodeBench竞赛编程 | 57% | xAI Grok 3 公告(非推理 pass@1;LCB 2024-10-01~2025-02-01) | 2025-02-19 | 厂商公布 |
| GPQA Diamond研究生级科学问答 | 75.4% | xAI Grok 3 公告(非推理 pass@1;LCB 2024-10-01~2025-02-01) | 2025-02-19 | 厂商公布 |
| MMMU多模态理解 | 73.2% | xAI Grok 3 公告(非推理 pass@1;LCB 2024-10-01~2025-02-01) | 2025-02-19 | 厂商公布 |
更新 2026-08-28 · 排名供选型参考,基准会饱和、会泄漏、会过时。
