- 类型
- 未披露
- 注意力
- 未披露
- 层数
- 未披露
- 专家
- 未披露
- 隐藏维
- 未披露
- 词表
- 未披露
未披露。强化学习训练的推理模型,API 提供 reasoning_effort 参数。
完善中
闭源模型,无自建选项,不提供显存表。
完善中
完善中
逻辑能力
考试型推理跃迁:数学、物理、化学博士级问题上首次超过人类专家均值。工程型推理仍一般。
亮点
- 1.GPQA 78.0%、AIME 2024 83.3%,开创推理模型范式
- 2.200K 上下文、100K 最大输出
- 3.正式版比 o1-preview 快、错误率降低 34%(官方)
坑
- 1.$15 / $60,推理 token 不可见但计费
- 2.不支持流式 / system 提示的早期限制
- 3.SWE-bench Verified 48.9%,工程能力不及后来 o3
适合:历史对照
不适合:新项目
| 基准 | 分数 | 来源 | 日期 | 证据 |
|---|---|---|---|---|
| SWE-bench Verified真实仓库修 bug | 48.9% | OpenAI o1-2024-12-17 发布表(o1 and new tools for developers) | 2024-12-17 | 厂商公布 |
| GPQA Diamond研究生级科学问答 | 75.7% | OpenAI o1-2024-12-17 发布表(o1 and new tools for developers) | 2024-12-17 | 厂商公布 |
| MMMU多模态理解 | 77.3% | OpenAI o1-2024-12-17 发布表(o1 and new tools for developers) | 2024-12-17 | 厂商公布 |
更新 2026-08-28 · 排名供选型参考,基准会饱和、会泄漏、会过时。