Claude Sonnet 4.5
Claude 4.5 中档旗舰 · Anthropic · 发布 2025-09-29 · 已被替代 → Claude Sonnet 5
编程与 Agent 场景的性价比主力,长时程任务稳定。
- 类型
- 未披露
- 注意力
- 未披露
- 层数
- 未披露
- 专家
- 未披露
- 隐藏维
- 未披露
- 词表
- 未披露
Anthropic 未披露参数量、层数与注意力结构。仅公开:支持 extended thinking(可调思考预算)、上下文 200K(beta 1M)。
类型:未披露(Anthropic 不公开 Dense/MoE、参数量或层结构)。
已公开的结构性信息:
- 支持 extended thinking:可设
budget_tokens,思考内容可返回摘要 - 上下文 200K,1M 为 beta(需 header 开启,价格上浮)
- 原生支持工具调用、并行工具调用、计算机使用(screenshot → action)
- 支持 prompt caching、批处理(Batch API 半价)
架构简图中的一切内部结构均以虚线标「未披露」。
闭源模型,无自建选项,不提供显存表。
闭源模型,没有自建选项,因此没有显存表。
成本视角:
- 输入 $3 / 输出 $15(每百万 token)
- 缓存命中输入 $0.30,长 system prompt 场景务必开缓存
- Batch API 打 5 折,离线批量任务优先用
警示:思考模式产生的 thinking token 按输出计费,开启后单次请求成本可能翻数倍。
编程SWE-bench Verified 77.2%(官方),在真实仓库修 bug 场景非常稳。
推理GPQA Diamond 83.4%,推理扎实但非顶尖。
数学AIME 2025 无工具 87%,有 Python 工具 100%(官方)。
Agenttau2-bench、OSWorld 领先,30 小时级长任务官方演示。
多模态图像理解可用,MMMU 77.8%,弱于 Gemini 系。
中文中文流畅,但缺少独立中文榜单数据。
工程型推理强于考试型推理:在 SWE-bench、Terminal-bench 这类需要读代码、规划多步、验证结果的任务上表现稳定;AIME 类竞赛题略逊于 GPT-5 / Gemini 3 Pro。默认不思考,开启 extended thinking 后规划与自我修正能力提升。常见失败模式:长任务里过度自信地宣布完成、未运行验证。
- 1.SWE-bench Verified 77.2%,同价位段最强代码模型之一
- 2.计算机使用(OSWorld)与长时程 agent 稳定性明显优于上代
- 3.$3 / $15 的价格远低于 Opus,工程团队日常可用
- 1.纯知识问答与多语种创作不如 Opus 系与 Gemini 3 Pro
- 2.extended thinking 开启后延迟与成本会显著上升,需按任务开关
- 3.200K 之上的 1M 上下文为 beta 且加价,别把它当默认能力
| 基准 | 分数 | 来源 | 日期 | 证据 |
|---|---|---|---|---|
| LMArena Text Elo人类偏好 Elo | 1450 | LMArena Text (style control) | 2025-12-20 | 独立复测 |
| SWE-bench Verified真实仓库修 bug | 77.2% | Anthropic 发布公告 | 2025-12-20 | 厂商公布 |
| GPQA Diamond研究生级科学问答 | 83.4% | Anthropic 发布公告 | 2025-12-20 | 厂商公布 |
| AIME 2025美国数学邀请赛 | 87% | Anthropic 发布公告 | 2025-12-20 | 厂商公布 |
| τ²-bench工具调用 agent | 84.7% | Anthropic 发布公告 | 2025-12-20 | 厂商公布 |
| Terminal-Bench终端 agent | 50% | Anthropic 发布公告 | 2025-12-20 | 厂商公布 |
| MMMU多模态理解 | 77.8% | Anthropic 发布公告 | 2025-12-20 | 厂商公布 |
| LMArena Chinese Elo中文人类偏好 Elo | 1440 | LMArena Text · Chinese | 2025-12-20 | 独立复测 |
更新 2025-12-20 · 排名供选型参考,基准会饱和、会泄漏、会过时。