Claude Opus 5
Claude 5 顶配 · Anthropic · 发布 2026-07-24 · 当前代
AA 智能指数第一,Fable 5 级智能只要一半价钱。
- 类型
- 未披露
- 注意力
- 未披露
- 层数
- 未披露
- 专家
- 未披露
- 隐藏维
- 未披露
- 词表
- 未披露
未披露。官方接口特性:adaptive thinking 默认开启;effort 五档 low/medium/high/xhigh/max;xhigh/max 下不可关闭思考;fast mode(2.5× 速度,$10/$50)。
未披露。Anthropic 未公布参数量、Dense/MoE、注意力类型。
已知接口特性:
- Adaptive thinking 默认开启(Opus 4.8 默认关闭),模型自行决定每轮思考量
effort五档:low/medium/high(默认) /xhigh/max;官方称 Opus 5 把额外 effort 换成结果的效率高于任何前代thinking.type=disabled仅在 effort ≤ high 时接受,xhigh/max 下返回 400(相对 Opus 4.8 的破坏性变更)- 1M 上下文既是默认也是最大值,128K 最大输出;Batch API 加 beta 头可到 300K 输出
- 新增:会话中途增删工具并保留缓存(beta)、
fallbacks: "default"模式、缓存最小长度降至 512 token - Fast mode(研究预览):约 2.5× 输出速度,$10 / $50
- 可靠知识截止 2026-05(全家族最新)
闭源模型,无自建选项,不提供显存表。
无自建选项。
成本模型(官方定价页,2026-08-28):
- 输入 $5 / 输出 $25 / MTok,与 Opus 4.8、4.7、4.6、4.5 完全一致
- 缓存写 $6.25(5 分钟)/ $10(1 小时),缓存读 $0.50
- Batch $2.50 / $12.50;Fast mode $10 / $50
- 1M 长上下文标准价
effort 决定真实成本:AA 实测 max 档单任务 $2.032.34,比 Fable 5($2.753.14)低约 26%,但比 Opus 4.8 max($1.80)高;low→max 输出 token 跨度约 8 倍。高 effort 时请给足 max_tokens(官方示例 64K 并流式)。
速度:AA 实测 55.4 tok/s,TTFT 约 43 s(max 档)。
编程Frontier-Bench v0.1 43.3%(官方公告,Vellum 转录),CursorBench 3.2 与 Fable 5 差距 0.5% 以内;Terminal-Bench 2.1 max 档 89%(AA)。
推理AA 智能指数 63(第一);HLE 53%(AA);ARC-AGI-3 30.2%(ARC Prize 验证)。
AgentZapier AutomationBench 通过率为次优模型 1.5 倍;OSWorld 2.0 以 1/3 成本超过 Fable 5;GDPval-AA v2 1861 Elo。
多模态官方称视觉能力提升,擅长图表 / 文档 / UI 复刻,配合裁剪工具迭代效果最好。
中文中文可用,缺少独立中文评测。
当前综合推理最强档之一:ARC-AGI-3 官方验证 30.2%(次优 GPT-5.6 Sol 仅 7.8%),HLE 53%(AA,无工具),Frontier-Bench v0.1 43.3% 是 Opus 4.8 的 2 倍以上。官方强调「test-time compute scaling」:把 effort 从 low 提到 max,GDPval-AA 分差达 407 Elo,输出 token 约 8 倍。失败模式:高 effort 下输出冗长;关闭思考时偶尔把工具调用写进正文或漏出内部 XML 标签。
- 1.AA 智能指数 63 排名第一,GDPval-AA v2、AA-Briefcase、Frontier-Bench 均为 SOTA
- 2.effort 五档(low→max)可连续换算成本与深度,max 档 Terminal-Bench 2.1 达 89%
- 3.定价 $5 / $25 与 Opus 4.8 持平,仅 Fable 5 一半;1M 上下文不加价
- 1.思考默认开启,max_tokens 要重新预算;xhigh/max 下无法关闭思考(400 错误)
- 2.默认回复与交付物明显变长,会主动自我验证,沿用旧提示词易「过度验证」
- 3.生物、进攻性网络安全能力仍落后 Mythos 5,且安全限制比 Opus 4.8 更严
| 基准 | 分数 | 来源 | 日期 | 证据 |
|---|---|---|---|---|
| LMArena Text Elo人类偏好 Elo | 1492 | LMArena Text (style control) | 2026-08-28 | 独立复测 |
| Artificial Analysis Intelligence IndexAA 综合指数 | 63 | Artificial Analysis Intelligence Index v3 | 2026-08-28 | 独立复测 |
| Artificial Analysis Intelligence IndexAA 综合指数 | 63 | Artificial Analysis (v4.1.1) | 2026-08-28 | 独立复测 |
| GPQA Diamond研究生级科学问答 | 93.2% | Artificial Analysis (v4.1.1) | 2026-08-28 | 独立复测 |
| Humanity's Last Exam人类最后考试 | 54.9% | Artificial Analysis (v4.1.1) | 2026-08-28 | 独立复测 |
| SciCode科学计算编程 | 55.7% | Artificial Analysis (v4.1.1) | 2026-08-28 | 独立复测 |
| MMMU-Pro多模态理解(Pro) | 84.7% | Artificial Analysis (v4.1.1) | 2026-08-28 | 独立复测 |
| Terminal-Bench终端 agent | 89.1% | Artificial Analysis · Terminal-Bench 2.1 | 2026-08-28 | 独立复测 |
| τ³-Bench Banking工具调用 agent(银行域) | 42.1% | Artificial Analysis · τ³-Bench Banking | 2026-08-28 | 独立复测 |
| LMArena Chinese Elo中文人类偏好 Elo | 1564 | LMArena Text · Chinese (style control) | 2026-08-28 | 独立复测 |
| Humanity's Last Exam人类最后考试 | 53% | Artificial Analysis · Opus 5 评测文章 | 2026-08-28 | 独立复测 |
| Terminal-Bench终端 agent | 89% | Artificial Analysis · Opus 5 评测文章 | 2026-08-28 | 独立复测 |
更新 2026-08-28 · 排名供选型参考,基准会饱和、会泄漏、会过时。