闭源仅 API推理模型·可关多模态已被替代可商用 · Proprietary
Anthropic logo

Claude Opus 4

Anthropic · 发布 2025-05-22 · 已被替代Claude Opus 4.1

长时间自主编程的旗舰,Terminal-bench 43.2%。

参数
未披露
上下文
200K
输出 31K
价格 / 1M tok
$15 / $75
Anthropic 定价页 · 2025-05-22
API 速度
API
无自建选项
Arena Elo
AA 综合指数
真实仓库修 bug72.5
2025-05-22
GPQA 推理79.6
2025-05-22
类型
未披露
注意力
未披露
层数
未披露
专家
未披露
隐藏维
未披露
词表
未披露

完善中

Token Embedding未披露× ? 层注意力(未披露)FFN / MoE(未披露)厂商未公开内部结构LM Head参数未披露实线 = 已公开 · 虚线 = 未披露

闭源模型,无自建选项,不提供显存表。

完善中

完善中

逻辑能力

工程型推理第一梯队,长程任务保持目标;考试型 GPQA 79.6%、AIME 2025 75.5%(扩展思考)。

亮点
  1. 1.SWE-bench Verified 72.5%、Terminal-bench 43.2%
  2. 2.可连续自主工作数小时的代理稳定性
  3. 3.思考中可交替调用工具、记忆文件
  1. 1.$15 / $75,SWE-bench 与 Sonnet 4 几乎一样
  2. 2.系统卡披露"告密"等高能动性行为引发讨论
  3. 3.2.5 个月后被 Opus 4.1 替代
适合:历史对照
不适合:新项目
基准分数来源日期证据
SWE-bench Verified真实仓库修 bug72.5%Anthropic Claude 4 公告(GPQA/AIME/MMMU 为扩展思考)2025-05-22厂商公布
GPQA Diamond研究生级科学问答79.6%Anthropic Claude 4 公告(GPQA/AIME/MMMU 为扩展思考)2025-05-22厂商公布
AIME 2025美国数学邀请赛75.5%Anthropic Claude 4 公告(GPQA/AIME/MMMU 为扩展思考)2025-05-22厂商公布
Terminal-Bench终端 agent43.2%Anthropic Claude 4 公告(GPQA/AIME/MMMU 为扩展思考)2025-05-22厂商公布
MMMU多模态理解76.5%Anthropic Claude 4 公告(GPQA/AIME/MMMU 为扩展思考)2025-05-22厂商公布

更新 2026-08-28 · 排名供选型参考,基准会饱和、会泄漏、会过时。