闭源仅 API推理模型多模态可商用 · Proprietary
Anthropic logo

Claude Sonnet 5

Claude 5 中档 · Anthropic · 发布 2026-06-30 · 当前代

接近 Opus 4.8 的 agent 能力,$2 / $10 永久定价。

参数
未披露
上下文
1M
输出 125K
价格 / 1M tok
$2.00 / $10
Anthropic 官方定价 · 2026-08-28
API 速度
API ≈95 tok/s
首 token 225.59s · Artificial Analysis
Arena Elo
AA 综合指数55
2026-08-28
代码
GPQA 推理91.1
2026-08-28
类型
未披露
注意力
未披露
层数
未披露
专家
未披露
隐藏维
未披露
词表
未披露

未披露。adaptive thinking 默认开启(effort 默认 high,五档 low/medium/high/xhigh/max);不再接受手动 extended thinking 与非默认 temperature/top_p/top_k(400 错误);新分词器(同文本约多 30% token)。

未披露。Anthropic 未公布参数量、Dense/MoE、注意力类型。

已知接口特性(官方文档,2026-08-28):

  • Adaptive thinking 默认开启:不传 thinking 字段即带思考;关闭需显式 thinking: {type: "disabled"}
  • effort 五档 low / medium / high(默认)/ xhigh / max,与 Opus 4.8 对齐;xhigh 为 Sonnet 线新增
  • 三个破坏性变更(相对 Sonnet 4.6):手动 extended thinking(budget_tokens)返回 400;temperature / top_p / top_k 非默认值返回 400;assistant 预填仍不支持
  • 1M 上下文既是默认也是最大(无更小档),128K 最大输出;Batch API 加 output-300k-2026-03-24 beta 头可到 300K 输出
  • 输入:文本 + 图像;输出:文本
  • 新分词器:同文本约多 30%(官方公告口径 1.0~1.35×),max_tokens、缓存断点、上下文容量都要重新计算
  • 工具集与 Sonnet 4.6 相同,另支持 browser use 工具和稳定版 computer_toolset_20260801(Claude API / Google Cloud);不提供 Priority Tier
  • 首个带实时网络安全防护的 Sonnet:被拦截时返回 HTTP 200 + stop_reason: "refusal"
  • 可靠知识截止 2026-01(训练数据截止同为 2026-01)
Token Embedding未披露× ? 层注意力(未披露)FFN / MoE(未披露)厂商未公开内部结构LM Head参数未披露实线 = 已公开 · 虚线 = 未披露

闭源模型,无自建选项,不提供显存表。

无自建选项。

成本模型(官方定价页,2026-08-28):

  • 输入 $2 / 输出 $10 / MTok;原定 2026-09-01 涨回 $3 / $15 的计划已于 2026-08-10 取消,$2 / $10 为永久标准价
  • 缓存写 $2.50(5 分钟)/ $4(1 小时),缓存读 $0.20(基价 10%)
  • Batch 五折:$1 / $5
  • 1M 长上下文不加价;Bedrock / Vertex / Foundry 按各自价目

什么时候会变贵

  • 新分词器让同一段文本多约 30% token,标价降 1/3 但等价请求账单降幅明显小于此
  • AA 实测 max 档单任务 $1.72~2.29,约为 Sonnet 4.6 的 2 倍、与 Opus 4.8 相当——因为输出 token 多 ~40%、知识工作类 agent 轮次约 3 倍;max 比 low 多约 6 倍轮次
  • 思考默认开启,max_tokens 是思考 + 正文总上限,旧的无思考预算会截断

速度:AA 实测约 95 tok/s(max 档),高于均值;高 effort 下 TTFT 很长(AA 记录 max 档 225 s),交互场景请降 effort 或流式。

编程Terminal-Bench 2.1 80.4%、SWE-bench Pro 63.2%、CursorBench 57%(官方公告表,Vellum 转录);AA 实测 Terminal-Bench 较 Sonnet 4.6 +9 分。

推理HLE(带工具)57.4%(官方公告表);AA 智能指数 55(max 档,2026-08-28);CritPt 17%,较 Sonnet 4.6 +14 分(AA)。

指令遵循官方称幻觉率与谄媚率均低于 Sonnet 4.6;不支持 assistant 预填,需改用 structured outputs(官方文档)。

AgentOSWorld-Verified 81.2%、GDPval-AA v2 1618(官方公告表,与 Opus 4.8 的 1615 持平);BrowseComp 相对 Sonnet 4.6 大幅提升(官方)。

多模态支持文本 + 图像输入、文本输出;官方未公布 MMMU 等视觉基准。

中文中文可用,缺少独立中文评测。

逻辑能力

工程型推理接近 Opus 4.8:Terminal-Bench 2.1 80.4% 甚至高于 Opus 4.8 的 74.6%,HLE(带工具)57.4% 对 57.9%,GDPval-AA v2 1618 对 1615(官方公告表,Vellum 转录)。考试型推理略弱:SWE-bench Pro 63.2% 低于 Opus 4.8 的 69.2%,官方未公布 GPQA Diamond。失败模式:默认 effort 高时输出偏长;复杂多文件重构仍应上 Opus 5。

亮点
  1. 1.Terminal-Bench 2.1 80.4%(Sonnet 4.6 为 67.0%,+13.4),OSWorld-Verified 81.2% 与 Opus 4.8 基本持平
  2. 2.$2 / $10 原为限时价,2026-08 起改为永久标准价,比 Sonnet 4.6 便宜 1/3
  3. 3.1M 上下文 + 128K 输出,AA 智能指数 55,Free / Pro 计划默认模型
  1. 1.新分词器使同文本 token 数多 1.0~1.35 倍,实际账单降幅小于标价降幅
  2. 2.temperature / top_p / top_k 非默认值直接 400,旧代码需清理采样参数
  3. 3.官方分数均为默认 effort;misalignment 率高于 Opus 4.8,漏洞利用类能力被刻意压低
适合:生产环境 agent(浏览器 / 终端工具使用) · 高吞吐编码助手 · 对话产品默认模型
不适合:最难的跨仓库重构 · 需要私有化部署的合规场景
基准分数来源日期证据
Artificial Analysis Intelligence IndexAA 综合指数55Artificial Analysis Intelligence Index v32026-08-28独立复测
Terminal-Bench终端 agent80.4%Anthropic 发布公告2026-08-28厂商公布
Artificial Analysis Intelligence IndexAA 综合指数55Artificial Analysis (v4.1.1)2026-08-28独立复测
GPQA Diamond研究生级科学问答91.1%Artificial Analysis (v4.1.1)2026-08-28独立复测
Humanity's Last Exam人类最后考试41.3%Artificial Analysis (v4.1.1)2026-08-28独立复测
SciCode科学计算编程53.6%Artificial Analysis (v4.1.1)2026-08-28独立复测
MMMU-Pro多模态理解(Pro)77.3%Artificial Analysis (v4.1.1)2026-08-28独立复测
Terminal-Bench终端 agent80.5%Artificial Analysis · Terminal-Bench 2.12026-08-28独立复测
τ³-Bench Banking工具调用 agent(银行域)37.3%Artificial Analysis · τ³-Bench Banking2026-08-28独立复测
LMArena Chinese Elo中文人类偏好 Elo1503LMArena Text · Chinese (style control)2026-08-28独立复测

更新 2026-08-28 · 排名供选型参考,基准会饱和、会泄漏、会过时。