闭源仅 API推理模型多模态已被替代可商用 · Proprietary
OpenAI logo

OpenAI o3

OpenAI · 发布 2025-04-16 · 已被替代GPT-5

首个能在思考中用工具的旗舰推理模型。

参数
未披露
上下文
200K
输出 98K
价格 / 1M tok
$2.00 / $8.00
OpenAI 定价页(202 · 2025-06-10
API 速度
API
无自建选项
Arena Elo
AA 综合指数
真实仓库修 bug69.1
2025-04-16
GPQA 推理83.3
2025-04-16
类型
未披露
注意力
未披露
层数
未披露
专家
未披露
隐藏维
未披露
词表
未披露

未披露。强化学习规模化训练的推理模型,可在推理链中调用工具(搜索、Python、图像操作)。

未披露。OpenAI 未公开 o3 的参数量或结构。

已知接口层信息:

  • reasoning_effort:low / medium / high
  • 200K 上下文,100K 最大输出
  • 推理链中可自主调用工具:网页搜索、Python、文件分析、图像处理
  • 支持视觉输入,可在推理中裁剪 / 旋转图像
  • o3-pro(2025-06)为更多算力的版本
Token Embedding未披露× ? 层注意力(未披露)FFN / MoE(未披露)厂商未公开内部结构LM Head参数未披露实线 = 已公开 · 虚线 = 未披露

闭源模型,无自建选项,不提供显存表。

无自建选项。

成本参考(2025-06-10 后):输入 $2 / 输出 $8;缓存输入 $0.5。发布时为 $10 / $40。

警示:推理 token 计入输出计费,high effort 下单次请求可达数万 token。

编程SWE-bench Verified 69.1%、Aider Polyglot 81.3%、Codeforces 2706(官方)。

推理GPQA 83.3%、HLE 20.32%(无工具)/ 24.90%(Python + 浏览)(官方)。

数学AIME 2024 91.6%、AIME 2025 88.9%(无工具,官方)。

AgentTau-bench airline 52.0%、retail 70.4%(官方)。

多模态MMMU 82.9%、MathVista 86.8%(官方)。

中文中文良好,缺独立榜单。

逻辑能力

考试型与工程型推理在 2025 年上半年均为第一梯队。工具增强推理是关键:HLE 带 Python + 浏览可到 24.9%。问题:过度自信,会编造工具执行过程。

亮点
  1. 1.AIME 2025 88.9%、GPQA 83.3%、HLE 20.3%(无工具)
  2. 2.推理链内调用搜索 / Python / 图像缩放,"用图思考"
  3. 3.SWE-bench Verified 69.1%,Codeforces 2706
  1. 1.系统卡显示幻觉率高于 o1(PersonQA 33%)
  2. 2.推理 token 不可见,长任务成本难预估
  3. 3.2025-08 被 GPT-5 替代
适合:数学 / 科学研究 · 多步工具调用的分析任务 · 历史对照
不适合:低延迟场景 · 新项目
基准分数来源日期证据
SWE-bench Verified真实仓库修 bug69.1%OpenAI o3 / o4-mini 发布公告(无工具)2025-04-16厂商公布
GPQA Diamond研究生级科学问答83.3%OpenAI o3 / o4-mini 发布公告(无工具)2025-04-16厂商公布
Humanity's Last Exam人类最后考试20.3%OpenAI o3 / o4-mini 发布公告(无工具)2025-04-16厂商公布
AIME 2025美国数学邀请赛88.9%OpenAI o3 / o4-mini 发布公告(无工具)2025-04-16厂商公布
MMMU多模态理解82.9%OpenAI o3 / o4-mini 发布公告(无工具)2025-04-16厂商公布

更新 2026-08-28 · 排名供选型参考,基准会饱和、会泄漏、会过时。