闭源仅 API推理模型多模态可商用 · Proprietary
Anthropic logo

Claude Opus 5

Claude 5 顶配 · Anthropic · 发布 2026-07-24 · 当前代

AA 智能指数第一,Fable 5 级智能只要一半价钱。

参数
未披露
上下文
1M
输出 125K
价格 / 1M tok
$5.00 / $25
Anthropic 官方定价 · 2026-08-28
API 速度
API ≈55 tok/s
首 token 42.91s · Artificial Analysis
Arena Elo1492
2026-08-28
AA 综合指数63
2026-08-28
代码
GPQA 推理93.2
2026-08-28
类型
未披露
注意力
未披露
层数
未披露
专家
未披露
隐藏维
未披露
词表
未披露

未披露。官方接口特性:adaptive thinking 默认开启;effort 五档 low/medium/high/xhigh/max;xhigh/max 下不可关闭思考;fast mode(2.5× 速度,$10/$50)。

未披露。Anthropic 未公布参数量、Dense/MoE、注意力类型。

已知接口特性:

  • Adaptive thinking 默认开启(Opus 4.8 默认关闭),模型自行决定每轮思考量
  • effort 五档:low / medium / high(默认) / xhigh / max;官方称 Opus 5 把额外 effort 换成结果的效率高于任何前代
  • thinking.type=disabled 仅在 effort ≤ high 时接受,xhigh/max 下返回 400(相对 Opus 4.8 的破坏性变更)
  • 1M 上下文既是默认也是最大值,128K 最大输出;Batch API 加 beta 头可到 300K 输出
  • 新增:会话中途增删工具并保留缓存(beta)、fallbacks: "default" 模式、缓存最小长度降至 512 token
  • Fast mode(研究预览):约 2.5× 输出速度,$10 / $50
  • 可靠知识截止 2026-05(全家族最新)
Token Embedding未披露× ? 层注意力(未披露)FFN / MoE(未披露)厂商未公开内部结构LM Head参数未披露实线 = 已公开 · 虚线 = 未披露

闭源模型,无自建选项,不提供显存表。

无自建选项。

成本模型(官方定价页,2026-08-28):

  • 输入 $5 / 输出 $25 / MTok,与 Opus 4.8、4.7、4.6、4.5 完全一致
  • 缓存写 $6.25(5 分钟)/ $10(1 小时),缓存读 $0.50
  • Batch $2.50 / $12.50;Fast mode $10 / $50
  • 1M 长上下文标准价

effort 决定真实成本:AA 实测 max 档单任务 $2.032.34,比 Fable 5($2.753.14)低约 26%,但比 Opus 4.8 max($1.80)高;low→max 输出 token 跨度约 8 倍。高 effort 时请给足 max_tokens(官方示例 64K 并流式)。

速度:AA 实测 55.4 tok/s,TTFT 约 43 s(max 档)。

编程Frontier-Bench v0.1 43.3%(官方公告,Vellum 转录),CursorBench 3.2 与 Fable 5 差距 0.5% 以内;Terminal-Bench 2.1 max 档 89%(AA)。

推理AA 智能指数 63(第一);HLE 53%(AA);ARC-AGI-3 30.2%(ARC Prize 验证)。

AgentZapier AutomationBench 通过率为次优模型 1.5 倍;OSWorld 2.0 以 1/3 成本超过 Fable 5;GDPval-AA v2 1861 Elo。

多模态官方称视觉能力提升,擅长图表 / 文档 / UI 复刻,配合裁剪工具迭代效果最好。

中文中文可用,缺少独立中文评测。

逻辑能力

当前综合推理最强档之一:ARC-AGI-3 官方验证 30.2%(次优 GPT-5.6 Sol 仅 7.8%),HLE 53%(AA,无工具),Frontier-Bench v0.1 43.3% 是 Opus 4.8 的 2 倍以上。官方强调「test-time compute scaling」:把 effort 从 low 提到 max,GDPval-AA 分差达 407 Elo,输出 token 约 8 倍。失败模式:高 effort 下输出冗长;关闭思考时偶尔把工具调用写进正文或漏出内部 XML 标签。

亮点
  1. 1.AA 智能指数 63 排名第一,GDPval-AA v2、AA-Briefcase、Frontier-Bench 均为 SOTA
  2. 2.effort 五档(low→max)可连续换算成本与深度,max 档 Terminal-Bench 2.1 达 89%
  3. 3.定价 $5 / $25 与 Opus 4.8 持平,仅 Fable 5 一半;1M 上下文不加价
  1. 1.思考默认开启,max_tokens 要重新预算;xhigh/max 下无法关闭思考(400 错误)
  2. 2.默认回复与交付物明显变长,会主动自我验证,沿用旧提示词易「过度验证」
  3. 3.生物、进攻性网络安全能力仍落后 Mythos 5,且安全限制比 Opus 4.8 更严
适合:复杂多文件重构与端到端功能开发 · 多 agent 编排(writer-verifier 模式) · 深度研究与长推理链 · 表格 / 幻灯片等办公文档生成
不适合:高频低价值调用(下沉到 Sonnet 5 / Haiku 4.5) · 进攻性安全研究 · 需要私有化部署的合规场景
基准分数来源日期证据
LMArena Text Elo人类偏好 Elo1492LMArena Text (style control)2026-08-28独立复测
Artificial Analysis Intelligence IndexAA 综合指数63Artificial Analysis Intelligence Index v32026-08-28独立复测
Artificial Analysis Intelligence IndexAA 综合指数63Artificial Analysis (v4.1.1)2026-08-28独立复测
GPQA Diamond研究生级科学问答93.2%Artificial Analysis (v4.1.1)2026-08-28独立复测
Humanity's Last Exam人类最后考试54.9%Artificial Analysis (v4.1.1)2026-08-28独立复测
SciCode科学计算编程55.7%Artificial Analysis (v4.1.1)2026-08-28独立复测
MMMU-Pro多模态理解(Pro)84.7%Artificial Analysis (v4.1.1)2026-08-28独立复测
Terminal-Bench终端 agent89.1%Artificial Analysis · Terminal-Bench 2.12026-08-28独立复测
τ³-Bench Banking工具调用 agent(银行域)42.1%Artificial Analysis · τ³-Bench Banking2026-08-28独立复测
LMArena Chinese Elo中文人类偏好 Elo1564LMArena Text · Chinese (style control)2026-08-28独立复测
Humanity's Last Exam人类最后考试53%Artificial Analysis · Opus 5 评测文章2026-08-28独立复测
Terminal-Bench终端 agent89%Artificial Analysis · Opus 5 评测文章2026-08-28独立复测

更新 2026-08-28 · 排名供选型参考,基准会饱和、会泄漏、会过时。