- 类型
- 未披露
- 注意力
- 未披露
- 层数
- 未披露
- 专家
- 未披露
- 隐藏维
- 未披露
- 词表
- 未披露
未披露。强化学习规模化训练的推理模型,可在推理链中调用工具(搜索、Python、图像操作)。
未披露。OpenAI 未公开 o3 的参数量或结构。
已知接口层信息:
reasoning_effort:low / medium / high- 200K 上下文,100K 最大输出
- 推理链中可自主调用工具:网页搜索、Python、文件分析、图像处理
- 支持视觉输入,可在推理中裁剪 / 旋转图像
- o3-pro(2025-06)为更多算力的版本
闭源模型,无自建选项,不提供显存表。
无自建选项。
成本参考(2025-06-10 后):输入 $2 / 输出 $8;缓存输入 $0.5。发布时为 $10 / $40。
警示:推理 token 计入输出计费,high effort 下单次请求可达数万 token。
编程SWE-bench Verified 69.1%、Aider Polyglot 81.3%、Codeforces 2706(官方)。
推理GPQA 83.3%、HLE 20.32%(无工具)/ 24.90%(Python + 浏览)(官方)。
数学AIME 2024 91.6%、AIME 2025 88.9%(无工具,官方)。
AgentTau-bench airline 52.0%、retail 70.4%(官方)。
多模态MMMU 82.9%、MathVista 86.8%(官方)。
中文中文良好,缺独立榜单。
逻辑能力
考试型与工程型推理在 2025 年上半年均为第一梯队。工具增强推理是关键:HLE 带 Python + 浏览可到 24.9%。问题:过度自信,会编造工具执行过程。
亮点
- 1.AIME 2025 88.9%、GPQA 83.3%、HLE 20.3%(无工具)
- 2.推理链内调用搜索 / Python / 图像缩放,"用图思考"
- 3.SWE-bench Verified 69.1%,Codeforces 2706
坑
- 1.系统卡显示幻觉率高于 o1(PersonQA 33%)
- 2.推理 token 不可见,长任务成本难预估
- 3.2025-08 被 GPT-5 替代
适合:数学 / 科学研究 · 多步工具调用的分析任务 · 历史对照
不适合:低延迟场景 · 新项目
| 基准 | 分数 | 来源 | 日期 | 证据 |
|---|---|---|---|---|
| SWE-bench Verified真实仓库修 bug | 69.1% | OpenAI o3 / o4-mini 发布公告(无工具) | 2025-04-16 | 厂商公布 |
| GPQA Diamond研究生级科学问答 | 83.3% | OpenAI o3 / o4-mini 发布公告(无工具) | 2025-04-16 | 厂商公布 |
| Humanity's Last Exam人类最后考试 | 20.3% | OpenAI o3 / o4-mini 发布公告(无工具) | 2025-04-16 | 厂商公布 |
| AIME 2025美国数学邀请赛 | 88.9% | OpenAI o3 / o4-mini 发布公告(无工具) | 2025-04-16 | 厂商公布 |
| MMMU多模态理解 | 82.9% | OpenAI o3 / o4-mini 发布公告(无工具) | 2025-04-16 | 厂商公布 |
更新 2026-08-28 · 排名供选型参考,基准会饱和、会泄漏、会过时。