闭源仅 API推理模型·可关多模态已被替代可商用 · Proprietary
Anthropic logo

Claude Sonnet 4.5

Claude 4.5 中档旗舰 · Anthropic · 发布 2025-09-29 · 已被替代Claude Sonnet 5

编程与 Agent 场景的性价比主力,长时程任务稳定。

参数
未披露
上下文
200K
输出 63K
价格 / 1M tok
$3.00 / $15
Anthropic 定价页 · 2025-12-20
API 速度
API ≈60 tok/s
无自建选项
Arena Elo1450
2025-12-20
AA 综合指数
真实仓库修 bug77.2
2025-12-20
GPQA 推理83.4
2025-12-20
类型
未披露
注意力
未披露
层数
未披露
专家
未披露
隐藏维
未披露
词表
未披露

Anthropic 未披露参数量、层数与注意力结构。仅公开:支持 extended thinking(可调思考预算)、上下文 200K(beta 1M)。

类型:未披露(Anthropic 不公开 Dense/MoE、参数量或层结构)。

已公开的结构性信息

  • 支持 extended thinking:可设 budget_tokens,思考内容可返回摘要
  • 上下文 200K,1M 为 beta(需 header 开启,价格上浮)
  • 原生支持工具调用、并行工具调用、计算机使用(screenshot → action)
  • 支持 prompt caching、批处理(Batch API 半价)

架构简图中的一切内部结构均以虚线标「未披露」。

Token Embedding未披露× ? 层注意力(未披露)FFN / MoE(未披露)厂商未公开内部结构LM Head参数未披露实线 = 已公开 · 虚线 = 未披露

闭源模型,无自建选项,不提供显存表。

闭源模型,没有自建选项,因此没有显存表。

成本视角:

  • 输入 $3 / 输出 $15(每百万 token)
  • 缓存命中输入 $0.30,长 system prompt 场景务必开缓存
  • Batch API 打 5 折,离线批量任务优先用

警示:思考模式产生的 thinking token 按输出计费,开启后单次请求成本可能翻数倍。

编程SWE-bench Verified 77.2%(官方),在真实仓库修 bug 场景非常稳。

推理GPQA Diamond 83.4%,推理扎实但非顶尖。

数学AIME 2025 无工具 87%,有 Python 工具 100%(官方)。

Agenttau2-bench、OSWorld 领先,30 小时级长任务官方演示。

多模态图像理解可用,MMMU 77.8%,弱于 Gemini 系。

中文中文流畅,但缺少独立中文榜单数据。

逻辑能力

工程型推理强于考试型推理:在 SWE-bench、Terminal-bench 这类需要读代码、规划多步、验证结果的任务上表现稳定;AIME 类竞赛题略逊于 GPT-5 / Gemini 3 Pro。默认不思考,开启 extended thinking 后规划与自我修正能力提升。常见失败模式:长任务里过度自信地宣布完成、未运行验证。

亮点
  1. 1.SWE-bench Verified 77.2%,同价位段最强代码模型之一
  2. 2.计算机使用(OSWorld)与长时程 agent 稳定性明显优于上代
  3. 3.$3 / $15 的价格远低于 Opus,工程团队日常可用
  1. 1.纯知识问答与多语种创作不如 Opus 系与 Gemini 3 Pro
  2. 2.extended thinking 开启后延迟与成本会显著上升,需按任务开关
  3. 3.200K 之上的 1M 上下文为 beta 且加价,别把它当默认能力
适合:代码助手 / Coding Agent · 计算机使用与浏览器自动化 · 需要工具调用的多步任务
不适合:预算极低的高频简单任务(用 Haiku 4.5) · 超长文档(>200K)常规处理
基准分数来源日期证据
LMArena Text Elo人类偏好 Elo1450LMArena Text (style control)2025-12-20独立复测
SWE-bench Verified真实仓库修 bug77.2%Anthropic 发布公告2025-12-20厂商公布
GPQA Diamond研究生级科学问答83.4%Anthropic 发布公告2025-12-20厂商公布
AIME 2025美国数学邀请赛87%Anthropic 发布公告2025-12-20厂商公布
τ²-bench工具调用 agent84.7%Anthropic 发布公告2025-12-20厂商公布
Terminal-Bench终端 agent50%Anthropic 发布公告2025-12-20厂商公布
MMMU多模态理解77.8%Anthropic 发布公告2025-12-20厂商公布
LMArena Chinese Elo中文人类偏好 Elo1440LMArena Text · Chinese2025-12-20独立复测

更新 2025-12-20 · 排名供选型参考,基准会饱和、会泄漏、会过时。