闭源仅 API推理模型·可关多模态已被替代可商用 · Proprietary
Claude Opus 4.5
Claude 4.5 顶配 · Anthropic · 发布 2025-11-24 · 已被替代 → Claude Opus 5
2025 年底最强编程模型之一,价格降到 Sonnet 级别的 1.7 倍。
参数
未披露
上下文
200K
输出 63K
价格 / 1M tok
$5.00 / $25
Anthropic 定价页 · 2025-12-20
API 速度
API
无自建选项
Arena Elo1470
2025-12-20
AA 综合指数—
真实仓库修 bug80.9
2025-12-20
GPQA 推理87
2025-12-20
架构简图
- 类型
- 未披露
- 注意力
- 未披露
- 层数
- 未披露
- 专家
- 未披露
- 隐藏维
- 未披露
- 词表
- 未披露
未披露。公开能力:extended thinking、effort 参数(low/medium/high)控制思考深度。
未披露。Anthropic 未公布参数量、Dense/MoE、注意力类型。
已知接口特性:
effort参数(low / medium / high)控制推理投入- extended thinking,思考可跨工具调用保持(interleaved thinking)
- 200K 上下文、64K 最大输出
闭源模型,无自建选项,不提供显存表。
无自建选项。成本角度看:输入 $5 / 输出 $25,是 Sonnet 4.5 的 1.67 倍,Opus 4.1 的 1/3。
高 effort 模式下单次请求 thinking token 可达数万,请用 max_tokens 与 effort 联合限制预算。
编程SWE-bench Verified 80.9%、Terminal-bench 59.3%(官方)。
推理GPQA Diamond 87.0%、ARC-AGI-2 37.6%(官方)。
Agenttau2-bench、OSWorld 官方领先,长任务稳定。
多模态MMMU 80.7%,图像理解良好。
中文中文可用,缺少独立中文评测。
逻辑能力
工程型与考试型兼备:ARC-AGI-2 37.6%、GPQA 87% 与 SWE-bench 80.9% 同时领先,是少数在「抽象推理 / 科学问答 / 真实软件工程」三类上都靠前的模型。effort=high 时会长时间自我验证,token 消耗大;effort=low 接近 Sonnet 4.5 的行为。失败模式:在模糊需求下倾向于给出过度完整的方案而非追问。
亮点
- 1.SWE-bench Verified 80.9%,首个突破 80% 的公开模型
- 2.effort 参数让同一模型在成本与深度之间连续调节
- 3.定价 $5 / $25,比 Opus 4.1 便宜 67%
坑
- 1.仍是全场最贵档之一,日常吞吐任务应下沉到 Sonnet / Haiku
- 2.200K 上下文在多文件大仓库场景仍会不够,需要检索配合
- 3.closed-source:参数、架构完全不透明,合规审计只能看服务协议
适合:复杂重构与跨文件修改 · 需要高可靠性的 agent 编排 · 研究型分析、长推理链
不适合:高频低价值调用 · 需要私有化部署的合规场景
| 基准 | 分数 | 来源 | 日期 | 证据 |
|---|---|---|---|---|
| LMArena Text Elo人类偏好 Elo | 1470 | LMArena Text (style control) | 2025-12-20 | 独立复测 |
| SWE-bench Verified真实仓库修 bug | 80.9% | Anthropic 发布公告 | 2025-12-20 | 厂商公布 |
| GPQA Diamond研究生级科学问答 | 87% | Anthropic 发布公告 | 2025-12-20 | 厂商公布 |
| τ²-bench工具调用 agent | 88.9% | Anthropic 发布公告 | 2025-12-20 | 厂商公布 |
| Terminal-Bench终端 agent | 59.3% | Anthropic 发布公告 | 2025-12-20 | 厂商公布 |
| MMMU多模态理解 | 80.7% | Anthropic 发布公告 | 2025-12-20 | 厂商公布 |
| LMArena Chinese Elo中文人类偏好 Elo | 1462 | LMArena Text · Chinese | 2025-12-20 | 独立复测 |
更新 2025-12-20 · 排名供选型参考,基准会饱和、会泄漏、会过时。