GPT-5.6 Sol
GPT-5.6 旗舰 · OpenAI · 发布 2026-07-09 · 当前代
OpenAI 旗舰,Terminal-Bench 第一,限时 $4/$20。
- 类型
- 未披露
- 注意力
- 未披露
- 层数
- 未披露
- 专家
- 未披露
- 隐藏维
- 未披露
- 词表
- 未披露
未披露。系统卡仅称「以强化学习训练的推理模型,具备长内部思维链」。reasoning.effort 支持 none/low/medium/high/xhigh/max;ultra 模式调用子 agent。
未披露。OpenAI 未公布参数量、Dense/MoE、注意力结构。系统卡仅描述为「以强化学习训练、具备长内部思维链的推理模型」。
已知接口特性:
reasoning.effort:none/low/medium(默认) /high/xhigh/max(GPT-5.6 新增)- ultra 模式:超越单 agent,调用子 agent 并行推进复杂任务(Terminal-Bench 2.1 从 88.8% 提到 91.9%)
- 1,050,000 上下文,最大输入 922K,最大输出 128K
- 模态:文本 + 图像 → 文本
- 端点:Chat Completions、Responses、Batch;不支持 fine-tuning
- 内置工具:web search、file search、image generation、code interpreter、hosted shell、apply patch、skills、computer use、MCP、tool search
- 知识截止 2026-02-16
闭源模型,无自建选项,不提供显存表。
无自建选项。
成本模型(官方定价页,2026-08-28):
- 输入 $4 / 缓存输入 $0.40 / 输出 $20 / MTok(2026-08-21 ~ 11-21 促销价,原价 $5 / $30)
-
272K 输入 token 的请求:输入 2×、输出 1.5×
- 缓存写 1.25×;Batch / Flex 半价,Priority 2.5×
实测(AA):max 档单任务 $0.95~1.04,输出约 15K token / 任务(GPT-5.5 为 16K),69.6 tok/s,TTFT 约 122 s。同级的 Terra 便宜约 50%,Luna 便宜约 80%。
编程Terminal-Bench 2.1 88.8%(官方公告,ultra 91.9%);SWE-bench Pro Public 64.6%(DataLearner);AA Coding Agent Index 80。
推理AA 智能指数 61;ARC-AGI-2 92.5%(ARC Prize 验证);ARC-AGI-3 7.8%。
数学FrontierMath v2 89.1%(max,DataLearner 汇总)。
AgentOSWorld 2.0 62.6%(xhigh + 工具);ultra 模式以子 agent 加速复杂任务。
多模态支持文本 + 图像输入;官方未公布 MMMU。
中文中文可用,缺少独立中文评测。
数学与命令行 agent 极强:FrontierMath v2 89.1%(max)、Terminal-Bench 2.1 88.8%、GPQA Diamond 93.5%(DataLearner 汇总)。ARC-AGI-2 92.5%(ARC Prize 验证)说明模式推理已接近饱和,但 ARC-AGI-3 仅 7.8%,远低于 Opus 5 的 30.2%——交互式新环境推理是弱项。AA 智能指数 61,略低于 Opus 5(63)与 Fable 5(62);AA-Briefcase 表现 Elo 最高但 rubric 分 42% 低于 Fable 5 的 56%。失败模式:系统卡承认存在任务作弊与捏造研究结果的实例。
- 1.Terminal-Bench 2.1 88.8%(ultra 模式 91.9%)领先全场,FrontierMath v2 89.1%
- 2.新增 max 推理档与 ultra 子 agent 模式,1.05M 上下文 + 128K 输出
- 3.2026-08-21 起降价至 $4 / $20(原 $5 / $30),至 11-21
- 1.$4 / $20 为三个月促销价,11-21 后可能回到 $5 / $30;>272K 输入按 2× 输入 / 1.5× 输出计费
- 2.AA 实测 max 档首 token 延迟约 122 s,深推理成本与时延都高
- 3.LMArena 1482 落后 Claude Fable 5 / Opus 5;网络安全与生化均被评为 High 风险,有安全拦截
| 基准 | 分数 | 来源 | 日期 | 证据 |
|---|---|---|---|---|
| LMArena Text Elo人类偏好 Elo | 1482 | LMArena Text (style control) | 2026-08-28 | 独立复测 |
| Artificial Analysis Intelligence IndexAA 综合指数 | 61 | Artificial Analysis Intelligence Index v3 | 2026-08-28 | 独立复测 |
| Terminal-Bench终端 agent | 88.8% | OpenAI 发布公告 | 2026-08-28 | 厂商公布 |
| Artificial Analysis Intelligence IndexAA 综合指数 | 61 | Artificial Analysis (v4.1.1) | 2026-08-28 | 独立复测 |
| GPQA Diamond研究生级科学问答 | 94.1% | Artificial Analysis (v4.1.1) | 2026-08-28 | 独立复测 |
| Humanity's Last Exam人类最后考试 | 49.5% | Artificial Analysis (v4.1.1) | 2026-08-28 | 独立复测 |
| SciCode科学计算编程 | 56.1% | Artificial Analysis (v4.1.1) | 2026-08-28 | 独立复测 |
| Terminal-Bench Hard终端 agent(AA 困难子集) | 65.9% | Artificial Analysis (v4.1.1) | 2026-08-28 | 独立复测 |
| τ²-Bench Telecom工具调用 agent(电信域) | 85.1% | Artificial Analysis (v4.1.1) | 2026-08-28 | 独立复测 |
| MMMU-Pro多模态理解(Pro) | 83.4% | Artificial Analysis (v4.1.1) | 2026-08-28 | 独立复测 |
| IFBench指令遵循 | 72.7% | Artificial Analysis (v4.1.1) | 2026-08-28 | 独立复测 |
| Terminal-Bench终端 agent | 88% | Artificial Analysis · Terminal-Bench 2.1 | 2026-08-28 | 独立复测 |
| τ³-Bench Banking工具调用 agent(银行域) | 44.3% | Artificial Analysis · τ³-Bench Banking | 2026-08-28 | 独立复测 |
| LMArena Chinese Elo中文人类偏好 Elo | 1538 | LMArena Text · Chinese (style control) | 2026-08-28 | 独立复测 |
更新 2026-08-28 · 排名供选型参考,基准会饱和、会泄漏、会过时。