闭源仅 API推理模型·可关多模态已被替代可商用 · Proprietary
Claude Sonnet 4
Anthropic · 发布 2025-05-22 · 已被替代 → Claude Sonnet 4.5
与 Opus 4 同分的性价比编程主力,GitHub Copilot 默认。
参数
未披露
上下文
200K(后 1M beta)
输出 63K
价格 / 1M tok
$3.00 / $15
Anthropic 定价页 · 2025-05-22
API 速度
API
无自建选项
Arena Elo—
AA 综合指数—
真实仓库修 bug72.7
2025-05-22
GPQA 推理75.4
2025-05-22
架构简图
- 类型
- 未披露
- 注意力
- 未披露
- 层数
- 未披露
- 专家
- 未披露
- 隐藏维
- 未披露
- 词表
- 未披露
混合推理模型,扩展思考可选、预算可控;2025-08 起 API 提供 1M 上下文 beta。
未披露。Anthropic 未公开参数量。
已知接口层信息:
- 200K 上下文(2025-08 起 1M beta),64K 最大输出
- 扩展思考:
budget_tokens控制,思考摘要返回 - 思考中可交替调用工具(interleaved thinking,beta)
- 支持 computer use、文件 API、代码执行工具
闭源模型,无自建选项,不提供显存表。
无自建选项。
成本参考:输入 $3 / 输出 $15;缓存写 $3.75、读 $0.30;Batch 半价。1M beta 超过 200K 部分 $6 / $22.5。
警示:思考 token 计入输出,长思考预算下费用显著上升。
编程SWE-bench Verified 72.7%(并行计算 80.2%)、Terminal-bench 35.5%(官方)。
推理GPQA Diamond 75.4%(扩展思考;并行 83.8%)(官方)。
数学AIME 2025 70.5%(并行 85.0%)(官方)。
AgentTAU-bench retail 80.5%、airline 60.0%(官方)。
多模态MMMU 74.4%(官方)。
中文MMMLU 86.5%(官方),中文良好。
逻辑能力
工程型推理极佳:代码导航、精确编辑、减少 3.7 版的"过度工程化"。考试型推理中上,扩展思考下 GPQA 75.4%。常见问题:思考预算过小时推理浅、过大时啰嗦。
亮点
- 1.SWE-bench Verified 72.7%,与 Opus 4 持平、价格 1/5
- 2.被 GitHub Copilot 选为新 coding agent 底座
- 3.2025-08 起 1M 上下文 beta
坑
- 1.Terminal-bench 35.5%,长程代理稳定性不及 Opus
- 2.考试型推理 AIME 2025 70.5%,落后 o3 / Gemini 2.5 Pro
- 3.扩展思考 token 按输出计费,实际成本可能翻倍
适合:代理编程(当年主力) · 工具调用与结构化任务 · 历史对照
不适合:竞赛数学 · 新项目
| 基准 | 分数 | 来源 | 日期 | 证据 |
|---|---|---|---|---|
| SWE-bench Verified真实仓库修 bug | 72.7% | Anthropic Claude 4 公告(GPQA/AIME/MMMU 为扩展思考) | 2025-05-22 | 厂商公布 |
| GPQA Diamond研究生级科学问答 | 75.4% | Anthropic Claude 4 公告(GPQA/AIME/MMMU 为扩展思考) | 2025-05-22 | 厂商公布 |
| AIME 2025美国数学邀请赛 | 70.5% | Anthropic Claude 4 公告(GPQA/AIME/MMMU 为扩展思考) | 2025-05-22 | 厂商公布 |
| Terminal-Bench终端 agent | 35.5% | Anthropic Claude 4 公告(GPQA/AIME/MMMU 为扩展思考) | 2025-05-22 | 厂商公布 |
| MMMU多模态理解 | 74.4% | Anthropic Claude 4 公告(GPQA/AIME/MMMU 为扩展思考) | 2025-05-22 | 厂商公布 |
更新 2026-08-28 · 排名供选型参考,基准会饱和、会泄漏、会过时。