闭源仅 API推理模型多模态可商用 · Proprietary
xAI logo

Grok 4.5

Grok 4.5 · xAI xAI · 发布 2026-07-16 · 当前代

xAI 面向代码与 agent 的旗舰,输出价仅 $6,Arena 1470。

参数
未披露
上下文
500K
价格 / 1M tok
$2.00 / $6.00
xAI 模型定价页 · 2026-08-28
API 速度
API ≈52 tok/s
首 token 14.21s · Artificial Analysis
Arena Elo1470
2026-08-28
AA 综合指数56
2026-08-28
代码
GPQA 推理93.1
2026-08-28
类型
未披露
注意力
未披露
层数
未披露
专家
未披露
隐藏维
未披露
词表
未披露

未披露。reasoning_effort 可选 low / medium / high(默认 high)。

类型:未披露。

已知:

  • 500K 上下文,文本 + 图像输入,文本输出
  • reasoning_effort:low / medium / high(默认 high);Grok 4.6 再加 xhigh
  • 面向代码、agent 与知识工作训练
  • 工具调用、结构化输出

参考:x.ai/news/grok-4-5、docs.x.ai 模型页。

Token Embedding未披露× ? 层注意力(未披露)FFN / MoE(未披露)厂商未公开内部结构LM Head参数未披露实线 = 已公开 · 虚线 = 未披露

闭源模型,无自建选项,不提供显存表。

无自建选项。

成本参考(2026-08-28 xAI 定价页):

档位输入 $/M输出 $/M缓存输入
<200K2.006.000.30
≥200K4.0012.000.60

提示:AA 估算单次智能指数任务成本约 $0.31,token 效率优于同档闭源;但 TTFT 长,按并发设计要留超时。

编程Terminal-Bench 2.1 83.3%、SWE-Bench Pro 64.7%、DeepSWE 1.0 62.0%(xAI 公告)。

推理官方未公布 GPQA / HLE;AA 智能指数 56。

AgentSWE Marathon 29.0%(xAI 公告)。

多模态文本 + 图像输入。

逻辑能力

工程型推理是主打:DeepSWE 1.0 62.0%、SWE Marathon 29.0%(公告称第一)、Terminal-Bench 2.1 83.3%、SWE-Bench Pro 64.7%。考试型推理官方未公布,AA 智能指数 56(与 Gemini 3.7 Flash 持平,低于 Grok 4.6 的 61)。失败模式:长程自主软件工程任务仍不及 GPT-5.5 / Opus 级;token 效率好但延迟高。

亮点
  1. 1.Terminal-Bench 2.1 83.3%、SWE-Bench Pro 64.7%,代码 agent 进入第一梯队
  2. 2.$2 / $6 定价,输出价是 Gemini 3.1 Pro 的一半
  3. 3.Arena 文本榜 1470,高于后续的 Grok 4.6(1461)
  1. 1.发布不到一个月就被 Grok 4.6 取代为「推荐」模型,xAI 迭代节奏极快
  2. 2.官方公告只给代码 / agent 类基准,GPQA / HLE / AIME 等通用推理数据缺失
  3. 3.AA 实测 51.6 tok/s、TTFT 约 14 s,速度偏慢;仅文本 + 图像,无音视频
适合:代码 agent / IDE 集成 · 知识工作类长任务 · 预算敏感的旗舰级调用
不适合:低延迟交互 · 音视频输入 · 私有化部署
基准分数来源日期证据
LMArena Text Elo人类偏好 Elo1470LMArena Text (style control)2026-08-28独立复测
Artificial Analysis Intelligence IndexAA 综合指数56Artificial Analysis Intelligence Index v32026-08-28独立复测
Artificial Analysis Intelligence IndexAA 综合指数56Artificial Analysis (v4.1.1)2026-08-28独立复测
GPQA Diamond研究生级科学问答93.1%Artificial Analysis (v4.1.1)2026-08-28独立复测
Humanity's Last Exam人类最后考试42.7%Artificial Analysis (v4.1.1)2026-08-28独立复测
SciCode科学计算编程54.1%Artificial Analysis (v4.1.1)2026-08-28独立复测
MMMU-Pro多模态理解(Pro)80.4%Artificial Analysis (v4.1.1)2026-08-28独立复测
Terminal-Bench终端 agent81.6%Artificial Analysis · Terminal-Bench 2.12026-08-28独立复测
τ³-Bench Banking工具调用 agent(银行域)42.1%Artificial Analysis · τ³-Bench Banking2026-08-28独立复测
LMArena Chinese Elo中文人类偏好 Elo1513LMArena Text · Chinese (style control)2026-08-28独立复测

更新 2026-08-28 · 排名供选型参考,基准会饱和、会泄漏、会过时。