闭源仅 API推理模型·可关多模态已被替代可商用 · Proprietary
Claude Opus 4
Anthropic · 发布 2025-05-22 · 已被替代 → Claude Opus 4.1
长时间自主编程的旗舰,Terminal-bench 43.2%。
参数
未披露
上下文
200K
输出 31K
价格 / 1M tok
$15 / $75
Anthropic 定价页 · 2025-05-22
API 速度
API
无自建选项
Arena Elo—
AA 综合指数—
真实仓库修 bug72.5
2025-05-22
GPQA 推理79.6
2025-05-22
架构简图
- 类型
- 未披露
- 注意力
- 未披露
- 层数
- 未披露
- 专家
- 未披露
- 隐藏维
- 未披露
- 词表
- 未披露
完善中
闭源模型,无自建选项,不提供显存表。
完善中
完善中
逻辑能力
工程型推理第一梯队,长程任务保持目标;考试型 GPQA 79.6%、AIME 2025 75.5%(扩展思考)。
亮点
- 1.SWE-bench Verified 72.5%、Terminal-bench 43.2%
- 2.可连续自主工作数小时的代理稳定性
- 3.思考中可交替调用工具、记忆文件
坑
- 1.$15 / $75,SWE-bench 与 Sonnet 4 几乎一样
- 2.系统卡披露"告密"等高能动性行为引发讨论
- 3.2.5 个月后被 Opus 4.1 替代
适合:历史对照
不适合:新项目
| 基准 | 分数 | 来源 | 日期 | 证据 |
|---|---|---|---|---|
| SWE-bench Verified真实仓库修 bug | 72.5% | Anthropic Claude 4 公告(GPQA/AIME/MMMU 为扩展思考) | 2025-05-22 | 厂商公布 |
| GPQA Diamond研究生级科学问答 | 79.6% | Anthropic Claude 4 公告(GPQA/AIME/MMMU 为扩展思考) | 2025-05-22 | 厂商公布 |
| AIME 2025美国数学邀请赛 | 75.5% | Anthropic Claude 4 公告(GPQA/AIME/MMMU 为扩展思考) | 2025-05-22 | 厂商公布 |
| Terminal-Bench终端 agent | 43.2% | Anthropic Claude 4 公告(GPQA/AIME/MMMU 为扩展思考) | 2025-05-22 | 厂商公布 |
| MMMU多模态理解 | 76.5% | Anthropic Claude 4 公告(GPQA/AIME/MMMU 为扩展思考) | 2025-05-22 | 厂商公布 |
更新 2026-08-28 · 排名供选型参考,基准会饱和、会泄漏、会过时。