- 类型
- 未披露
- 注意力
- 未披露
- 层数
- 未披露
- 专家
- 未披露
- 隐藏维
- 未披露
- 词表
- 未披露
未披露。官方称为端到端训练的单一模型,统一处理文本、图像、音频输入输出("omni")。
未披露。OpenAI 未公开参数量。
已知信息:
- 单一端到端模型,文本、视觉、音频共用一套网络(官方称之为 "omni")
- 新分词器 o200k_base,非英语语言 token 数明显减少
- 128K 上下文;08-06 版起最大输出 16K
- 支持结构化输出(Structured Outputs,08-06 版起)
闭源模型,无自建选项,不提供显存表。
无自建选项。
成本参考(08-06 版):输入 $2.5 / 输出 $10;缓存输入 $1.25;Batch API 半价。
发布时(05-13 版)为 $5 / $15。
编程HumanEval 90.2%(官方);SWE-bench Verified 33.2%(OpenAI 2024-08 SWE-bench Verified 博文)。
推理GPQA 53.6%(官方)。
数学MATH 76.6%、MGSM 90.5%(官方)。
多模态MMMU 69.1%、MathVista 63.8%(官方),原生音频输入输出。
中文中文良好,新分词器使中文 token 数减少约 1.4 倍。
逻辑能力
非推理模型的天花板级别:GPQA 53.6%、MATH 76.6%。多步推理靠提示词,复杂代理任务容易半途放弃。1120 版本的写作与指令遵循更好但数学略退。
亮点
- 1.原生文本 / 图像 / 音频统一模型,实时语音延迟 320ms
- 2.MMLU 88.7%、MMMU 69.1%,发布时多模态第一
- 3.价格从 GPT-4 Turbo 的 $10 / $30 降到 $5 / $15(后再降至 $2.5 / $10)
坑
- 1.无推理模式,SWE-bench Verified 仅 33.2%
- 2.版本迭代多(05-13 / 08-06 / 11-20),行为差异大
- 3.2025-08 随 GPT-5 发布从 ChatGPT 下线,引发用户反弹
适合:多模态 / 语音交互 · 高性价比通用对话(当年) · 历史对照
不适合:复杂推理与代理编程 · 新项目
| 基准 | 分数 | 来源 | 日期 | 证据 |
|---|---|---|---|---|
| SWE-bench Verified真实仓库修 bug | 33.2% | OpenAI GPT-4o 发布公告 / SWE-bench Verified 博客(未核实项已移除) | 2024-08-13 | 厂商公布 |
| GPQA Diamond研究生级科学问答 | 53.6% | OpenAI GPT-4o 发布公告 / SWE-bench Verified 博客(未核实项已移除) | 2024-08-13 | 厂商公布 |
| MMMU多模态理解 | 69.1% | OpenAI GPT-4o 发布公告 / SWE-bench Verified 博客(未核实项已移除) | 2024-08-13 | 厂商公布 |
更新 2026-08-28 · 排名供选型参考,基准会饱和、会泄漏、会过时。