- 类型
- 未披露
- 注意力
- 未披露
- 层数
- 未披露
- 专家
- 未披露
- 隐藏维
- 未披露
- 词表
- 未披露
完善中
闭源模型,无自建选项,不提供显存表。
完善中
可用维度不足 3 个,不绘制雷达图
完善中
逻辑能力
工具调用型 agent 强;深度推理中等。
亮点
- 1.2M 上下文
- 2.$0.20 / $0.50
- 3.τ²-bench 工具调用官方领先
坑
- 1.独立复测数据少
- 2.推理深度不如 Grok 4
- 3.无自建
适合:低价长上下文 agent
不适合:顶级推理
| 基准 | 分数 | 来源 | 日期 | 证据 |
|---|---|---|---|---|
| LMArena Text Elo人类偏好 Elo | 1440 | LMArena Text (style control) | 2025-12-20 | 独立复测 |
| Humanity's Last Exam人类最后考试 | 17.6% | xAI 发布公告 | 2025-12-20 | 厂商公布 |
| τ²-bench工具调用 agent | 93% | xAI 发布公告 | 2025-12-20 | 厂商公布 |
更新 2025-12-20 · 排名供选型参考,基准会饱和、会泄漏、会过时。
