Claude Sonnet 5
Claude 5 中档 · Anthropic · 发布 2026-06-30 · 当前代
接近 Opus 4.8 的 agent 能力,$2 / $10 永久定价。
- 类型
- 未披露
- 注意力
- 未披露
- 层数
- 未披露
- 专家
- 未披露
- 隐藏维
- 未披露
- 词表
- 未披露
未披露。adaptive thinking 默认开启(effort 默认 high,五档 low/medium/high/xhigh/max);不再接受手动 extended thinking 与非默认 temperature/top_p/top_k(400 错误);新分词器(同文本约多 30% token)。
未披露。Anthropic 未公布参数量、Dense/MoE、注意力类型。
已知接口特性(官方文档,2026-08-28):
- Adaptive thinking 默认开启:不传
thinking字段即带思考;关闭需显式thinking: {type: "disabled"} effort五档low/medium/high(默认)/xhigh/max,与 Opus 4.8 对齐;xhigh为 Sonnet 线新增- 三个破坏性变更(相对 Sonnet 4.6):手动 extended thinking(
budget_tokens)返回 400;temperature/top_p/top_k非默认值返回 400;assistant 预填仍不支持 - 1M 上下文既是默认也是最大(无更小档),128K 最大输出;Batch API 加
output-300k-2026-03-24beta 头可到 300K 输出 - 输入:文本 + 图像;输出:文本
- 新分词器:同文本约多 30%(官方公告口径 1.0~1.35×),
max_tokens、缓存断点、上下文容量都要重新计算 - 工具集与 Sonnet 4.6 相同,另支持 browser use 工具和稳定版
computer_toolset_20260801(Claude API / Google Cloud);不提供 Priority Tier - 首个带实时网络安全防护的 Sonnet:被拦截时返回 HTTP 200 +
stop_reason: "refusal" - 可靠知识截止 2026-01(训练数据截止同为 2026-01)
闭源模型,无自建选项,不提供显存表。
无自建选项。
成本模型(官方定价页,2026-08-28):
- 输入 $2 / 输出 $10 / MTok;原定 2026-09-01 涨回 $3 / $15 的计划已于 2026-08-10 取消,$2 / $10 为永久标准价
- 缓存写 $2.50(5 分钟)/ $4(1 小时),缓存读 $0.20(基价 10%)
- Batch 五折:$1 / $5
- 1M 长上下文不加价;Bedrock / Vertex / Foundry 按各自价目
什么时候会变贵:
- 新分词器让同一段文本多约 30% token,标价降 1/3 但等价请求账单降幅明显小于此
- AA 实测 max 档单任务 $1.72~2.29,约为 Sonnet 4.6 的 2 倍、与 Opus 4.8 相当——因为输出 token 多 ~40%、知识工作类 agent 轮次约 3 倍;max 比 low 多约 6 倍轮次
- 思考默认开启,
max_tokens是思考 + 正文总上限,旧的无思考预算会截断
速度:AA 实测约 95 tok/s(max 档),高于均值;高 effort 下 TTFT 很长(AA 记录 max 档 225 s),交互场景请降 effort 或流式。
编程Terminal-Bench 2.1 80.4%、SWE-bench Pro 63.2%、CursorBench 57%(官方公告表,Vellum 转录);AA 实测 Terminal-Bench 较 Sonnet 4.6 +9 分。
推理HLE(带工具)57.4%(官方公告表);AA 智能指数 55(max 档,2026-08-28);CritPt 17%,较 Sonnet 4.6 +14 分(AA)。
指令遵循官方称幻觉率与谄媚率均低于 Sonnet 4.6;不支持 assistant 预填,需改用 structured outputs(官方文档)。
AgentOSWorld-Verified 81.2%、GDPval-AA v2 1618(官方公告表,与 Opus 4.8 的 1615 持平);BrowseComp 相对 Sonnet 4.6 大幅提升(官方)。
多模态支持文本 + 图像输入、文本输出;官方未公布 MMMU 等视觉基准。
中文中文可用,缺少独立中文评测。
工程型推理接近 Opus 4.8:Terminal-Bench 2.1 80.4% 甚至高于 Opus 4.8 的 74.6%,HLE(带工具)57.4% 对 57.9%,GDPval-AA v2 1618 对 1615(官方公告表,Vellum 转录)。考试型推理略弱:SWE-bench Pro 63.2% 低于 Opus 4.8 的 69.2%,官方未公布 GPQA Diamond。失败模式:默认 effort 高时输出偏长;复杂多文件重构仍应上 Opus 5。
- 1.Terminal-Bench 2.1 80.4%(Sonnet 4.6 为 67.0%,+13.4),OSWorld-Verified 81.2% 与 Opus 4.8 基本持平
- 2.$2 / $10 原为限时价,2026-08 起改为永久标准价,比 Sonnet 4.6 便宜 1/3
- 3.1M 上下文 + 128K 输出,AA 智能指数 55,Free / Pro 计划默认模型
- 1.新分词器使同文本 token 数多 1.0~1.35 倍,实际账单降幅小于标价降幅
- 2.temperature / top_p / top_k 非默认值直接 400,旧代码需清理采样参数
- 3.官方分数均为默认 effort;misalignment 率高于 Opus 4.8,漏洞利用类能力被刻意压低
| 基准 | 分数 | 来源 | 日期 | 证据 |
|---|---|---|---|---|
| Artificial Analysis Intelligence IndexAA 综合指数 | 55 | Artificial Analysis Intelligence Index v3 | 2026-08-28 | 独立复测 |
| Terminal-Bench终端 agent | 80.4% | Anthropic 发布公告 | 2026-08-28 | 厂商公布 |
| Artificial Analysis Intelligence IndexAA 综合指数 | 55 | Artificial Analysis (v4.1.1) | 2026-08-28 | 独立复测 |
| GPQA Diamond研究生级科学问答 | 91.1% | Artificial Analysis (v4.1.1) | 2026-08-28 | 独立复测 |
| Humanity's Last Exam人类最后考试 | 41.3% | Artificial Analysis (v4.1.1) | 2026-08-28 | 独立复测 |
| SciCode科学计算编程 | 53.6% | Artificial Analysis (v4.1.1) | 2026-08-28 | 独立复测 |
| MMMU-Pro多模态理解(Pro) | 77.3% | Artificial Analysis (v4.1.1) | 2026-08-28 | 独立复测 |
| Terminal-Bench终端 agent | 80.5% | Artificial Analysis · Terminal-Bench 2.1 | 2026-08-28 | 独立复测 |
| τ³-Bench Banking工具调用 agent(银行域) | 37.3% | Artificial Analysis · τ³-Bench Banking | 2026-08-28 | 独立复测 |
| LMArena Chinese Elo中文人类偏好 Elo | 1503 | LMArena Text · Chinese (style control) | 2026-08-28 | 独立复测 |
更新 2026-08-28 · 排名供选型参考,基准会饱和、会泄漏、会过时。