闭源仅 API推理模型·可关多模态已被替代可商用 · Proprietary
Anthropic logo

Claude Opus 4.5

Claude 4.5 顶配 · Anthropic · 发布 2025-11-24 · 已被替代Claude Opus 5

2025 年底最强编程模型之一,价格降到 Sonnet 级别的 1.7 倍。

参数
未披露
上下文
200K
输出 63K
价格 / 1M tok
$5.00 / $25
Anthropic 定价页 · 2025-12-20
API 速度
API
无自建选项
Arena Elo1470
2025-12-20
AA 综合指数
真实仓库修 bug80.9
2025-12-20
GPQA 推理87
2025-12-20
类型
未披露
注意力
未披露
层数
未披露
专家
未披露
隐藏维
未披露
词表
未披露

未披露。公开能力:extended thinking、effort 参数(low/medium/high)控制思考深度。

未披露。Anthropic 未公布参数量、Dense/MoE、注意力类型。

已知接口特性:

  • effort 参数(low / medium / high)控制推理投入
  • extended thinking,思考可跨工具调用保持(interleaved thinking)
  • 200K 上下文、64K 最大输出
Token Embedding未披露× ? 层注意力(未披露)FFN / MoE(未披露)厂商未公开内部结构LM Head参数未披露实线 = 已公开 · 虚线 = 未披露

闭源模型,无自建选项,不提供显存表。

无自建选项。成本角度看:输入 $5 / 输出 $25,是 Sonnet 4.5 的 1.67 倍,Opus 4.1 的 1/3。

高 effort 模式下单次请求 thinking token 可达数万,请用 max_tokens 与 effort 联合限制预算。

编程SWE-bench Verified 80.9%、Terminal-bench 59.3%(官方)。

推理GPQA Diamond 87.0%、ARC-AGI-2 37.6%(官方)。

Agenttau2-bench、OSWorld 官方领先,长任务稳定。

多模态MMMU 80.7%,图像理解良好。

中文中文可用,缺少独立中文评测。

逻辑能力

工程型与考试型兼备:ARC-AGI-2 37.6%、GPQA 87% 与 SWE-bench 80.9% 同时领先,是少数在「抽象推理 / 科学问答 / 真实软件工程」三类上都靠前的模型。effort=high 时会长时间自我验证,token 消耗大;effort=low 接近 Sonnet 4.5 的行为。失败模式:在模糊需求下倾向于给出过度完整的方案而非追问。

亮点
  1. 1.SWE-bench Verified 80.9%,首个突破 80% 的公开模型
  2. 2.effort 参数让同一模型在成本与深度之间连续调节
  3. 3.定价 $5 / $25,比 Opus 4.1 便宜 67%
  1. 1.仍是全场最贵档之一,日常吞吐任务应下沉到 Sonnet / Haiku
  2. 2.200K 上下文在多文件大仓库场景仍会不够,需要检索配合
  3. 3.closed-source:参数、架构完全不透明,合规审计只能看服务协议
适合:复杂重构与跨文件修改 · 需要高可靠性的 agent 编排 · 研究型分析、长推理链
不适合:高频低价值调用 · 需要私有化部署的合规场景
基准分数来源日期证据
LMArena Text Elo人类偏好 Elo1470LMArena Text (style control)2025-12-20独立复测
SWE-bench Verified真实仓库修 bug80.9%Anthropic 发布公告2025-12-20厂商公布
GPQA Diamond研究生级科学问答87%Anthropic 发布公告2025-12-20厂商公布
τ²-bench工具调用 agent88.9%Anthropic 发布公告2025-12-20厂商公布
Terminal-Bench终端 agent59.3%Anthropic 发布公告2025-12-20厂商公布
MMMU多模态理解80.7%Anthropic 发布公告2025-12-20厂商公布
LMArena Chinese Elo中文人类偏好 Elo1462LMArena Text · Chinese2025-12-20独立复测

更新 2025-12-20 · 排名供选型参考,基准会饱和、会泄漏、会过时。