闭源仅 API多模态已被替代可商用 · Proprietary
Anthropic logo

Claude 3.5 Sonnet

Claude 3.5 Sonnet(含 10-22 新版) · Anthropic · 发布 2024-06-20 · 已被替代Claude 3.7 Sonnet

确立 Claude 编程口碑的一代,首个 computer use 模型。

参数
未披露
上下文
200K
输出 8K
价格 / 1M tok
$3.00 / $15
Anthropic 定价页 · 2024-10-22
API 速度
API
无自建选项
Arena Elo
AA 综合指数
真实仓库修 bug49
2024-10-22
GPQA 推理65
2024-10-22
类型
未披露
注意力
未披露
层数
未披露
专家
未披露
隐藏维
未披露
词表
未披露

未披露。2024-10-22 版(同名升级,社区称 3.6)首次加入 computer use(beta)。

未披露。Anthropic 未公开参数量。

已知信息:

  • 200K 上下文,最大输出 8K(0620 版初期 4K,后放开到 8K)
  • 支持视觉输入、工具调用、提示缓存(2024-08)
  • 1022 版新增 computer use API(beta):截图 + 鼠标键盘动作
  • 速度约为 Claude 3 Opus 的 2 倍
Token Embedding未披露× ? 层注意力(未披露)FFN / MoE(未披露)厂商未公开内部结构LM Head参数未披露实线 = 已公开 · 虚线 = 未披露

闭源模型,无自建选项,不提供显存表。

无自建选项。

成本参考:输入 $3 / 输出 $15;缓存写 $3.75、读 $0.30;Batch API 半价。

编程HumanEval 92.0%(0620);SWE-bench Verified 33.4%(0620)→ 49.0%(1022)(官方)。

推理GPQA Diamond 59.4%(0620)→ 65.0%(1022)(官方)。

数学MATH 71.1%、GSM8K 96.4%(0620,官方)。

AgentTAU-bench retail 69.2%、airline 46.0%(1022,官方);OSWorld 14.9%。

多模态MMMU 68.3%(0620)→ 70.4%(1022)(官方)。

中文中文良好,缺独立榜单。

逻辑能力

工程型推理在非推理模型中最强,代码修改与多文件重构可靠;考试型推理 GPQA 59.4% → 65.0%(新版)。常见问题:长代理任务中偶尔"偷懒"省略代码。

亮点
  1. 1.10-22 版 SWE-bench Verified 49.0%,当时闭源第一
  2. 2.Artifacts + 代码体验让其成为开发者首选
  3. 3.首个官方 computer use(OSWorld 14.9%)
  1. 1.同名两版(0620 / 1022)行为差异大,易混淆
  2. 2.无推理模式,AIME 类竞赛数学弱
  3. 3.最大输出 8K
适合:代理编程(当年) · 文档分析与写作 · 历史对照
不适合:竞赛数学 · 新项目
基准分数来源日期证据
SWE-bench Verified真实仓库修 bug49%Anthropic 3.5 Sonnet(20241022)公告2024-10-22厂商公布
GPQA Diamond研究生级科学问答65%Anthropic 3.5 Sonnet(20241022)公告2024-10-22厂商公布
MMMU多模态理解70.4%Anthropic 3.5 Sonnet(20241022)公告2024-10-22厂商公布

更新 2026-08-28 · 排名供选型参考,基准会饱和、会泄漏、会过时。