- 类型
- 未披露
- 注意力
- 未披露
- 层数
- 未披露
- 专家
- 未披露
- 隐藏维
- 未披露
- 词表
- 未披露
完善中
闭源模型,无自建选项,不提供显存表。
完善中
完善中
逻辑能力
非推理模型中的工程型推理强者,Aider Polyglot 52.9%;复杂数学需要 o 系列。
亮点
- 1.SWE-bench Verified 54.6%,比 GPT-4o 高 21 个百分点
- 2.1M 上下文,长文档 needle 检索稳定
- 3.指令遵循与 diff 生成明显改进
坑
- 1.无推理模式,GPQA 66.3%
- 2.起初仅 API,不在 ChatGPT
- 3.4 个月后被 GPT-5 替代
适合:历史对照
不适合:新项目
| 基准 | 分数 | 来源 | 日期 | 证据 |
|---|---|---|---|---|
| SWE-bench Verified真实仓库修 bug | 54.6% | OpenAI GPT-4.1 发布公告 | 2025-04-14 | 厂商公布 |
| GPQA Diamond研究生级科学问答 | 66.3% | OpenAI GPT-4.1 发布公告 | 2025-04-14 | 厂商公布 |
| MMMU多模态理解 | 74.8% | OpenAI GPT-4.1 发布公告 | 2025-04-14 | 厂商公布 |
更新 2026-08-28 · 排名供选型参考,基准会饱和、会泄漏、会过时。