
Grok 4.6
Grok 4.6 加训版 · xAI xAI · 发布 2026-08-12 · 当前代
Grok 4.5 的加训版,长程 agent 与知识工作更强,同价。
- 类型
- 未披露
- 注意力
- 未披露
- 层数
- 未披露
- 专家
- 未披露
- 隐藏维
- 未披露
- 词表
- 未披露
未披露。xAI 称在 Grok 4.5 基座上追加训练与 agent 环境 RL,非更大模型。reasoning_effort:low / medium / high(默认)/ xhigh,推理不可关闭。知识截止 2026-02-01。
未披露。xAI 未公布参数量与架构,仅说明 4.6 是 Grok 4.5 基座的追加训练版(改进优化器与训练配方),不是更大的模型。
已知接口特性(docs.x.ai,2026-08-28):
- 上下文 500K;官方文档写「无文本输出上限」(未给出 max_output 数值)
reasoning_effort:low/medium/high(默认)/xhigh;xhigh为 4.6 起新增,推理不可关闭- 输入:文本 + 图像;输出:文本
- 能力:function calling、structured outputs、prompt caching、context compaction;服务端工具 web search、X search、code execution
- 不支持 Batch API;速率限制 150 RPS / 50M TPM;区域 us-east-1、us-west-2
- Fast 变体:同模型更快推理,价格翻倍
- 知识截止 2026-02-01(模型页;开发者指南写 2026-01)
闭源模型,无自建选项,不提供显存表。
无自建选项。
成本模型(docs.x.ai 模型页,2026-08-28):
- <200K 上下文:$2 输入 / $0.50 缓存读 / $6 输出
- ≥200K 上下文:整条请求按 $4 / $1 / $12 计费(翻倍)
- Fast 变体价格翻倍;无 Batch 折扣
- 与 Grok 4.5 同价;缓存读由 $0.30 涨到 $0.50
什么时候会变贵:
- 跨 200K 门槛整条翻倍,长上下文代码库工作要注意压缩(可用 context compaction)
- xhigh 档 token 消耗最大
- 优势在输出价:$6 仅为 Opus 5 的 1/4、GPT-5.6 Sol 的 1/5;AA 实测单任务 $0.84~0.94,比 Opus 5 低 60% 以上;agent 轮次约 53(Opus 5 约 103)、输入 token 约 0.5B(Opus 5 约 2.0B)
速度:AA 实测 57.8 tok/s(低于均值),TTFT 约 43 s,不适合低延迟交互;需要速度选 Fast 变体。
编程DeepSWE v1.1 65.9%、CursorBench v3.2 69.9%、FrontierCode v1.1 61.3%(xAI 公告)。
推理AA 智能指数 61(high 档,2026-08-28,与 GPT-5.6 Sol 持平、次于 Opus 5 的 63);较 Grok 4.5 +5 分。
知识GDPval-AA v2 1753(AA,仅次于 Opus 5);知识截止 2026-02-01(docs.x.ai)。
AgentAPEX-Agents 57.5%、Terminal-Bench v3.0 26%(xAI 公告);Terminal-Bench v2.1 88.4%、τ³-Banking 50.7%、AA-Briefcase 1577(AA)。
多模态文本 + 图像输入、文本输出;无音视频。
在 4.5 基础上强化长程 agent;知识工作类领先,纯软件工程类不占优。
- 1.AA 智能指数 61,GDPval-AA v2 1753,知识工作类基准领先
- 2.新增 xhigh 推理档,DeepSWE v1.1 65.9%、APEX-Agents 57.5%
- 3.与 4.5 同价 $2 / $6,xAI 当前推荐模型
- 1.Terminal-Bench v3.0 仅 26%,自主软件工程类基准仍落后对手
- 2.Arena 文本 1461,反而低于 Grok 4.5 的 1470
- 3.无音视频输入;官方仍未公布 GPQA / HLE 等通用推理基准
| 基准 | 分数 | 来源 | 日期 | 证据 |
|---|---|---|---|---|
| LMArena Text Elo人类偏好 Elo | 1461 | LMArena Text (style control) | 2026-08-28 | 独立复测 |
| Artificial Analysis Intelligence IndexAA 综合指数 | 61 | Artificial Analysis Intelligence Index v3 | 2026-08-28 | 独立复测 |
| Artificial Analysis Intelligence IndexAA 综合指数 | 61 | Artificial Analysis (v4.1.1) | 2026-08-28 | 独立复测 |
| GPQA Diamond研究生级科学问答 | 94.9% | Artificial Analysis (v4.1.1) | 2026-08-28 | 独立复测 |
| Humanity's Last Exam人类最后考试 | 42.9% | Artificial Analysis (v4.1.1) | 2026-08-28 | 独立复测 |
| SciCode科学计算编程 | 53.6% | Artificial Analysis (v4.1.1) | 2026-08-28 | 独立复测 |
| Terminal-Bench终端 agent | 88.4% | Artificial Analysis · Terminal-Bench 2.1 | 2026-08-28 | 独立复测 |
| τ³-Bench Banking工具调用 agent(银行域) | 50.7% | Artificial Analysis · τ³-Bench Banking | 2026-08-28 | 独立复测 |
| LMArena Chinese Elo中文人类偏好 Elo | 1539 | LMArena Text · Chinese (style control) | 2026-08-28 | 独立复测 |
更新 2026-08-28 · 排名供选型参考,基准会饱和、会泄漏、会过时。