闭源仅 API推理模型多模态已被替代可商用 · Proprietary
GPT-5
GPT-5 旗舰 · OpenAI · 发布 2025-08-07 · 已被替代 → GPT-5.6 Sol
输入价格极低的推理旗舰,数学与科学问答顶级。
参数
未披露
上下文
400K
输出 125K
价格 / 1M tok
$1.25 / $10
OpenAI 定价页 · 2025-12-20
API 速度
API
无自建选项
Arena Elo1440
2025-12-20
AA 综合指数—
真实仓库修 bug74.9
2025-12-20
GPQA 推理85.7
2025-12-20
架构简图
- 类型
- 未披露
- 注意力
- 未披露
- 层数
- 未披露
- 专家
- 未披露
- 隐藏维
- 未披露
- 词表
- 未披露
未披露。API 提供 reasoning_effort(minimal/low/medium/high)与 verbosity 参数;ChatGPT 端为路由器 + 多模型组合。
未披露。OpenAI 未公开 GPT-5 的参数量或结构。
已知接口层信息:
reasoning_effort:minimal / low / medium / highverbosity:low / medium / high- 400K 上下文(输入 272K + 输出 128K)
- 自定义工具(custom tools)支持自由文本工具调用
ChatGPT 端为「路由 + 快模型 + 推理模型」的系统,API 端 gpt-5 为单一推理模型。
闭源模型,无自建选项,不提供显存表。
无自建选项。
成本参考:输入 $1.25 / 输出 $10;缓存输入 $0.125。
警示:推理 token 按输出计费且不可见,high effort 下一条复杂请求可能产生 10K+ 推理 token。
编程SWE-bench Verified 74.9%、Aider Polyglot 88%(官方)。
推理GPQA 85.7%、HLE 24.8%(无工具,官方)。
数学AIME 2025 94.6%(无工具,官方)。
多模态MMMU 84.2%(官方)。
中文中文良好,缺独立榜单。
逻辑能力
考试型推理是其强项:AIME、GPQA、HLE 都居前。工程型推理(SWE-bench 74.9%)扎实但略逊于 Claude Opus 4.5。reasoning_effort 是主要调节旋钮:high 下更少幻觉、更多自我校验;minimal 接近非推理模型。常见问题:在 low effort 时会跳过验证直接给结论。
亮点
- 1.AIME 2025 94.6%(无工具)、GPQA 85.7%,考试型推理顶级
- 2.输入 $1.25 / 百万 token,同档位里最便宜的旗舰
- 3.400K 上下文、128K 最大输出,长输出任务友好
坑
- 1.默认开推理,minimal effort 下能力下滑明显,需按任务调 effort
- 2.输出 $10 与推理 token 叠加后,长任务实际成本并不低
- 3.API 不暴露原始思维链,调试推理错误困难
适合:数学 / 科学 / 数据分析 · 低输入成本的批量处理 · 长文本生成
不适合:需要私有化部署 · 对延迟极敏感的实时交互(用 mini / nano)
| 基准 | 分数 | 来源 | 日期 | 证据 |
|---|---|---|---|---|
| LMArena Text Elo人类偏好 Elo | 1440 | LMArena Text (style control) | 2025-12-20 | 独立复测 |
| SWE-bench Verified真实仓库修 bug | 74.9% | OpenAI GPT-5 发布公告 | 2025-12-20 | 厂商公布 |
| GPQA Diamond研究生级科学问答 | 85.7% | OpenAI GPT-5 发布公告 | 2025-12-20 | 厂商公布 |
| Humanity's Last Exam人类最后考试 | 24.8% | OpenAI GPT-5 发布公告 | 2025-12-20 | 厂商公布 |
| AIME 2025美国数学邀请赛 | 94.6% | OpenAI GPT-5 发布公告 | 2025-12-20 | 厂商公布 |
| τ²-bench工具调用 agent | 81.1% | OpenAI GPT-5 发布公告 | 2025-12-20 | 厂商公布 |
| MMMU多模态理解 | 84.2% | OpenAI GPT-5 发布公告 | 2025-12-20 | 厂商公布 |
| LMArena Chinese Elo中文人类偏好 Elo | 1445 | LMArena Text · Chinese | 2025-12-20 | 独立复测 |
更新 2025-12-20 · 排名供选型参考,基准会饱和、会泄漏、会过时。