闭源仅 API推理模型·可关多模态可商用 · Proprietary
OpenAI logo

GPT-5.6 Sol

GPT-5.6 旗舰 · OpenAI · 发布 2026-07-09 · 当前代

OpenAI 旗舰,Terminal-Bench 第一,限时 $4/$20。

参数
未披露
上下文
1M
输出 125K
价格 / 1M tok
$4.00 / $20
OpenAI 官方定价页(d · 2026-08-28
API 速度
API ≈70 tok/s
首 token 122.11s · Artificial Analysis
Arena Elo1482
2026-08-28
AA 综合指数61
2026-08-28
代码
GPQA 推理94.1
2026-08-28
类型
未披露
注意力
未披露
层数
未披露
专家
未披露
隐藏维
未披露
词表
未披露

未披露。系统卡仅称「以强化学习训练的推理模型,具备长内部思维链」。reasoning.effort 支持 none/low/medium/high/xhigh/max;ultra 模式调用子 agent。

未披露。OpenAI 未公布参数量、Dense/MoE、注意力结构。系统卡仅描述为「以强化学习训练、具备长内部思维链的推理模型」。

已知接口特性:

  • reasoning.effortnone / low / medium(默认) / high / xhigh / max(GPT-5.6 新增)
  • ultra 模式:超越单 agent,调用子 agent 并行推进复杂任务(Terminal-Bench 2.1 从 88.8% 提到 91.9%)
  • 1,050,000 上下文,最大输入 922K,最大输出 128K
  • 模态:文本 + 图像 → 文本
  • 端点:Chat Completions、Responses、Batch;不支持 fine-tuning
  • 内置工具:web search、file search、image generation、code interpreter、hosted shell、apply patch、skills、computer use、MCP、tool search
  • 知识截止 2026-02-16
Token Embedding未披露× ? 层注意力(未披露)FFN / MoE(未披露)厂商未公开内部结构LM Head参数未披露实线 = 已公开 · 虚线 = 未披露

闭源模型,无自建选项,不提供显存表。

无自建选项。

成本模型(官方定价页,2026-08-28):

  • 输入 $4 / 缓存输入 $0.40 / 输出 $20 / MTok(2026-08-21 ~ 11-21 促销价,原价 $5 / $30)
  • 272K 输入 token 的请求:输入 2×、输出 1.5×

  • 缓存写 1.25×;Batch / Flex 半价,Priority 2.5×

实测(AA):max 档单任务 $0.95~1.04,输出约 15K token / 任务(GPT-5.5 为 16K),69.6 tok/s,TTFT 约 122 s。同级的 Terra 便宜约 50%,Luna 便宜约 80%。

编程Terminal-Bench 2.1 88.8%(官方公告,ultra 91.9%);SWE-bench Pro Public 64.6%(DataLearner);AA Coding Agent Index 80。

推理AA 智能指数 61;ARC-AGI-2 92.5%(ARC Prize 验证);ARC-AGI-3 7.8%。

数学FrontierMath v2 89.1%(max,DataLearner 汇总)。

AgentOSWorld 2.0 62.6%(xhigh + 工具);ultra 模式以子 agent 加速复杂任务。

多模态支持文本 + 图像输入;官方未公布 MMMU。

中文中文可用,缺少独立中文评测。

逻辑能力

数学与命令行 agent 极强:FrontierMath v2 89.1%(max)、Terminal-Bench 2.1 88.8%、GPQA Diamond 93.5%(DataLearner 汇总)。ARC-AGI-2 92.5%(ARC Prize 验证)说明模式推理已接近饱和,但 ARC-AGI-3 仅 7.8%,远低于 Opus 5 的 30.2%——交互式新环境推理是弱项。AA 智能指数 61,略低于 Opus 5(63)与 Fable 5(62);AA-Briefcase 表现 Elo 最高但 rubric 分 42% 低于 Fable 5 的 56%。失败模式:系统卡承认存在任务作弊与捏造研究结果的实例。

亮点
  1. 1.Terminal-Bench 2.1 88.8%(ultra 模式 91.9%)领先全场,FrontierMath v2 89.1%
  2. 2.新增 max 推理档与 ultra 子 agent 模式,1.05M 上下文 + 128K 输出
  3. 3.2026-08-21 起降价至 $4 / $20(原 $5 / $30),至 11-21
  1. 1.$4 / $20 为三个月促销价,11-21 后可能回到 $5 / $30;>272K 输入按 2× 输入 / 1.5× 输出计费
  2. 2.AA 实测 max 档首 token 延迟约 122 s,深推理成本与时延都高
  3. 3.LMArena 1482 落后 Claude Fable 5 / Opus 5;网络安全与生化均被评为 High 风险,有安全拦截
适合:终端 / Codex 类编码 agent · 数学与形式化推理 · 高并发企业工作流(tier 5 达 40M TPM)
不适合:交互式探索型推理(ARC-AGI-3) · 生物 / 安全敏感场景 · 需要私有化部署的合规场景
基准分数来源日期证据
LMArena Text Elo人类偏好 Elo1482LMArena Text (style control)2026-08-28独立复测
Artificial Analysis Intelligence IndexAA 综合指数61Artificial Analysis Intelligence Index v32026-08-28独立复测
Terminal-Bench终端 agent88.8%OpenAI 发布公告2026-08-28厂商公布
Artificial Analysis Intelligence IndexAA 综合指数61Artificial Analysis (v4.1.1)2026-08-28独立复测
GPQA Diamond研究生级科学问答94.1%Artificial Analysis (v4.1.1)2026-08-28独立复测
Humanity's Last Exam人类最后考试49.5%Artificial Analysis (v4.1.1)2026-08-28独立复测
SciCode科学计算编程56.1%Artificial Analysis (v4.1.1)2026-08-28独立复测
Terminal-Bench Hard终端 agent(AA 困难子集)65.9%Artificial Analysis (v4.1.1)2026-08-28独立复测
τ²-Bench Telecom工具调用 agent(电信域)85.1%Artificial Analysis (v4.1.1)2026-08-28独立复测
MMMU-Pro多模态理解(Pro)83.4%Artificial Analysis (v4.1.1)2026-08-28独立复测
IFBench指令遵循72.7%Artificial Analysis (v4.1.1)2026-08-28独立复测
Terminal-Bench终端 agent88%Artificial Analysis · Terminal-Bench 2.12026-08-28独立复测
τ³-Bench Banking工具调用 agent(银行域)44.3%Artificial Analysis · τ³-Bench Banking2026-08-28独立复测
LMArena Chinese Elo中文人类偏好 Elo1538LMArena Text · Chinese (style control)2026-08-28独立复测

更新 2026-08-28 · 排名供选型参考,基准会饱和、会泄漏、会过时。