- 类型
- 未披露
- 注意力
- 未披露
- 层数
- 未披露
- 专家
- 未披露
- 隐藏维
- 未披露
- 词表
- 未披露
完善中
闭源模型,无自建选项,不提供显存表。
完善中
完善中
逻辑能力
靠规模提升的直觉式推理,知识与常识判断强,但无推理链,数学与代码弱于 o 系列。
亮点
- 1.GPQA 71.4%、SimpleQA 幻觉率大幅降低
- 2.写作、情商、审美是当时最佳
- 3.LMArena 发布即登顶
坑
- 1.$75 / $150,是 GPT-4o 的 30 倍
- 2.AIME 2024 36.7%,不适合数学 / 推理
- 3.2025-07-14 已从 API 退役
适合:历史对照
不适合:新项目
| 基准 | 分数 | 来源 | 日期 | 证据 |
|---|---|---|---|---|
| SWE-bench Verified真实仓库修 bug | 38% | OpenAI GPT-4.5 发布公告 | 2025-02-27 | 厂商公布 |
| GPQA Diamond研究生级科学问答 | 71.4% | OpenAI GPT-4.5 发布公告 | 2025-02-27 | 厂商公布 |
| MMMU多模态理解 | 74.4% | OpenAI GPT-4.5 发布公告 | 2025-02-27 | 厂商公布 |
更新 2026-08-28 · 排名供选型参考,基准会饱和、会泄漏、会过时。