闭源仅 API推理模型多模态可商用 · Proprietary

Grok 4.5
Grok 4.5 · xAI xAI · 发布 2026-07-16 · 当前代
xAI 面向代码与 agent 的旗舰,输出价仅 $6,Arena 1470。
参数
未披露
上下文
500K
价格 / 1M tok
$2.00 / $6.00
xAI 模型定价页 · 2026-08-28
API 速度
API ≈52 tok/s
首 token 14.21s · Artificial Analysis
Arena Elo1470
2026-08-28
AA 综合指数56
2026-08-28
代码—
GPQA 推理93.1
2026-08-28
架构简图
- 类型
- 未披露
- 注意力
- 未披露
- 层数
- 未披露
- 专家
- 未披露
- 隐藏维
- 未披露
- 词表
- 未披露
未披露。reasoning_effort 可选 low / medium / high(默认 high)。
类型:未披露。
已知:
- 500K 上下文,文本 + 图像输入,文本输出
reasoning_effort:low / medium / high(默认 high);Grok 4.6 再加 xhigh- 面向代码、agent 与知识工作训练
- 工具调用、结构化输出
参考:x.ai/news/grok-4-5、docs.x.ai 模型页。
闭源模型,无自建选项,不提供显存表。
无自建选项。
成本参考(2026-08-28 xAI 定价页):
| 档位 | 输入 $/M | 输出 $/M | 缓存输入 |
|---|---|---|---|
| <200K | 2.00 | 6.00 | 0.30 |
| ≥200K | 4.00 | 12.00 | 0.60 |
提示:AA 估算单次智能指数任务成本约 $0.31,token 效率优于同档闭源;但 TTFT 长,按并发设计要留超时。
编程Terminal-Bench 2.1 83.3%、SWE-Bench Pro 64.7%、DeepSWE 1.0 62.0%(xAI 公告)。
推理官方未公布 GPQA / HLE;AA 智能指数 56。
AgentSWE Marathon 29.0%(xAI 公告)。
多模态文本 + 图像输入。
逻辑能力
工程型推理是主打:DeepSWE 1.0 62.0%、SWE Marathon 29.0%(公告称第一)、Terminal-Bench 2.1 83.3%、SWE-Bench Pro 64.7%。考试型推理官方未公布,AA 智能指数 56(与 Gemini 3.7 Flash 持平,低于 Grok 4.6 的 61)。失败模式:长程自主软件工程任务仍不及 GPT-5.5 / Opus 级;token 效率好但延迟高。
亮点
- 1.Terminal-Bench 2.1 83.3%、SWE-Bench Pro 64.7%,代码 agent 进入第一梯队
- 2.$2 / $6 定价,输出价是 Gemini 3.1 Pro 的一半
- 3.Arena 文本榜 1470,高于后续的 Grok 4.6(1461)
坑
- 1.发布不到一个月就被 Grok 4.6 取代为「推荐」模型,xAI 迭代节奏极快
- 2.官方公告只给代码 / agent 类基准,GPQA / HLE / AIME 等通用推理数据缺失
- 3.AA 实测 51.6 tok/s、TTFT 约 14 s,速度偏慢;仅文本 + 图像,无音视频
适合:代码 agent / IDE 集成 · 知识工作类长任务 · 预算敏感的旗舰级调用
不适合:低延迟交互 · 音视频输入 · 私有化部署
| 基准 | 分数 | 来源 | 日期 | 证据 |
|---|---|---|---|---|
| LMArena Text Elo人类偏好 Elo | 1470 | LMArena Text (style control) | 2026-08-28 | 独立复测 |
| Artificial Analysis Intelligence IndexAA 综合指数 | 56 | Artificial Analysis Intelligence Index v3 | 2026-08-28 | 独立复测 |
| Artificial Analysis Intelligence IndexAA 综合指数 | 56 | Artificial Analysis (v4.1.1) | 2026-08-28 | 独立复测 |
| GPQA Diamond研究生级科学问答 | 93.1% | Artificial Analysis (v4.1.1) | 2026-08-28 | 独立复测 |
| Humanity's Last Exam人类最后考试 | 42.7% | Artificial Analysis (v4.1.1) | 2026-08-28 | 独立复测 |
| SciCode科学计算编程 | 54.1% | Artificial Analysis (v4.1.1) | 2026-08-28 | 独立复测 |
| MMMU-Pro多模态理解(Pro) | 80.4% | Artificial Analysis (v4.1.1) | 2026-08-28 | 独立复测 |
| Terminal-Bench终端 agent | 81.6% | Artificial Analysis · Terminal-Bench 2.1 | 2026-08-28 | 独立复测 |
| τ³-Bench Banking工具调用 agent(银行域) | 42.1% | Artificial Analysis · τ³-Bench Banking | 2026-08-28 | 独立复测 |
| LMArena Chinese Elo中文人类偏好 Elo | 1513 | LMArena Text · Chinese (style control) | 2026-08-28 | 独立复测 |
更新 2026-08-28 · 排名供选型参考,基准会饱和、会泄漏、会过时。