闭源仅 API推理模型·可关多模态已被替代可商用 · Proprietary
Anthropic logo

Claude Sonnet 4

Anthropic · 发布 2025-05-22 · 已被替代Claude Sonnet 4.5

与 Opus 4 同分的性价比编程主力,GitHub Copilot 默认。

参数
未披露
上下文
200K(后 1M beta)
输出 63K
价格 / 1M tok
$3.00 / $15
Anthropic 定价页 · 2025-05-22
API 速度
API
无自建选项
Arena Elo
AA 综合指数
真实仓库修 bug72.7
2025-05-22
GPQA 推理75.4
2025-05-22
类型
未披露
注意力
未披露
层数
未披露
专家
未披露
隐藏维
未披露
词表
未披露

混合推理模型,扩展思考可选、预算可控;2025-08 起 API 提供 1M 上下文 beta。

未披露。Anthropic 未公开参数量。

已知接口层信息:

  • 200K 上下文(2025-08 起 1M beta),64K 最大输出
  • 扩展思考:budget_tokens 控制,思考摘要返回
  • 思考中可交替调用工具(interleaved thinking,beta)
  • 支持 computer use、文件 API、代码执行工具
Token Embedding未披露× ? 层注意力(未披露)FFN / MoE(未披露)厂商未公开内部结构LM Head参数未披露实线 = 已公开 · 虚线 = 未披露

闭源模型,无自建选项,不提供显存表。

无自建选项。

成本参考:输入 $3 / 输出 $15;缓存写 $3.75、读 $0.30;Batch 半价。1M beta 超过 200K 部分 $6 / $22.5。

警示:思考 token 计入输出,长思考预算下费用显著上升。

编程SWE-bench Verified 72.7%(并行计算 80.2%)、Terminal-bench 35.5%(官方)。

推理GPQA Diamond 75.4%(扩展思考;并行 83.8%)(官方)。

数学AIME 2025 70.5%(并行 85.0%)(官方)。

AgentTAU-bench retail 80.5%、airline 60.0%(官方)。

多模态MMMU 74.4%(官方)。

中文MMMLU 86.5%(官方),中文良好。

逻辑能力

工程型推理极佳:代码导航、精确编辑、减少 3.7 版的"过度工程化"。考试型推理中上,扩展思考下 GPQA 75.4%。常见问题:思考预算过小时推理浅、过大时啰嗦。

亮点
  1. 1.SWE-bench Verified 72.7%,与 Opus 4 持平、价格 1/5
  2. 2.被 GitHub Copilot 选为新 coding agent 底座
  3. 3.2025-08 起 1M 上下文 beta
  1. 1.Terminal-bench 35.5%,长程代理稳定性不及 Opus
  2. 2.考试型推理 AIME 2025 70.5%,落后 o3 / Gemini 2.5 Pro
  3. 3.扩展思考 token 按输出计费,实际成本可能翻倍
适合:代理编程(当年主力) · 工具调用与结构化任务 · 历史对照
不适合:竞赛数学 · 新项目
基准分数来源日期证据
SWE-bench Verified真实仓库修 bug72.7%Anthropic Claude 4 公告(GPQA/AIME/MMMU 为扩展思考)2025-05-22厂商公布
GPQA Diamond研究生级科学问答75.4%Anthropic Claude 4 公告(GPQA/AIME/MMMU 为扩展思考)2025-05-22厂商公布
AIME 2025美国数学邀请赛70.5%Anthropic Claude 4 公告(GPQA/AIME/MMMU 为扩展思考)2025-05-22厂商公布
Terminal-Bench终端 agent35.5%Anthropic Claude 4 公告(GPQA/AIME/MMMU 为扩展思考)2025-05-22厂商公布
MMMU多模态理解74.4%Anthropic Claude 4 公告(GPQA/AIME/MMMU 为扩展思考)2025-05-22厂商公布

更新 2026-08-28 · 排名供选型参考,基准会饱和、会泄漏、会过时。