闭源仅 API多模态已被替代可商用 · Proprietary
Claude 3.5 Sonnet
Claude 3.5 Sonnet(含 10-22 新版) · Anthropic · 发布 2024-06-20 · 已被替代 → Claude 3.7 Sonnet
确立 Claude 编程口碑的一代,首个 computer use 模型。
参数
未披露
上下文
200K
输出 8K
价格 / 1M tok
$3.00 / $15
Anthropic 定价页 · 2024-10-22
API 速度
API
无自建选项
Arena Elo—
AA 综合指数—
真实仓库修 bug49
2024-10-22
GPQA 推理65
2024-10-22
架构简图
- 类型
- 未披露
- 注意力
- 未披露
- 层数
- 未披露
- 专家
- 未披露
- 隐藏维
- 未披露
- 词表
- 未披露
未披露。2024-10-22 版(同名升级,社区称 3.6)首次加入 computer use(beta)。
未披露。Anthropic 未公开参数量。
已知信息:
- 200K 上下文,最大输出 8K(0620 版初期 4K,后放开到 8K)
- 支持视觉输入、工具调用、提示缓存(2024-08)
- 1022 版新增 computer use API(beta):截图 + 鼠标键盘动作
- 速度约为 Claude 3 Opus 的 2 倍
闭源模型,无自建选项,不提供显存表。
无自建选项。
成本参考:输入 $3 / 输出 $15;缓存写 $3.75、读 $0.30;Batch API 半价。
编程HumanEval 92.0%(0620);SWE-bench Verified 33.4%(0620)→ 49.0%(1022)(官方)。
推理GPQA Diamond 59.4%(0620)→ 65.0%(1022)(官方)。
数学MATH 71.1%、GSM8K 96.4%(0620,官方)。
AgentTAU-bench retail 69.2%、airline 46.0%(1022,官方);OSWorld 14.9%。
多模态MMMU 68.3%(0620)→ 70.4%(1022)(官方)。
中文中文良好,缺独立榜单。
逻辑能力
工程型推理在非推理模型中最强,代码修改与多文件重构可靠;考试型推理 GPQA 59.4% → 65.0%(新版)。常见问题:长代理任务中偶尔"偷懒"省略代码。
亮点
- 1.10-22 版 SWE-bench Verified 49.0%,当时闭源第一
- 2.Artifacts + 代码体验让其成为开发者首选
- 3.首个官方 computer use(OSWorld 14.9%)
坑
- 1.同名两版(0620 / 1022)行为差异大,易混淆
- 2.无推理模式,AIME 类竞赛数学弱
- 3.最大输出 8K
适合:代理编程(当年) · 文档分析与写作 · 历史对照
不适合:竞赛数学 · 新项目
| 基准 | 分数 | 来源 | 日期 | 证据 |
|---|---|---|---|---|
| SWE-bench Verified真实仓库修 bug | 49% | Anthropic 3.5 Sonnet(20241022)公告 | 2024-10-22 | 厂商公布 |
| GPQA Diamond研究生级科学问答 | 65% | Anthropic 3.5 Sonnet(20241022)公告 | 2024-10-22 | 厂商公布 |
| MMMU多模态理解 | 70.4% | Anthropic 3.5 Sonnet(20241022)公告 | 2024-10-22 | 厂商公布 |
更新 2026-08-28 · 排名供选型参考,基准会饱和、会泄漏、会过时。