闭源仅 API推理模型·可关多模态可商用 · Proprietary
Claude Haiku 4.5
Claude 4.5 轻量版 · Anthropic · 发布 2025-10-15 · 当前代
接近 Sonnet 4 的编程能力,1/3 价格、2 倍速度。
参数
未披露
上下文
200K
输出 63K
价格 / 1M tok
$1.00 / $5.00
Anthropic 定价页 · 2025-12-20
API 速度
API ≈119 tok/s
首 token 16.59s · Artificial Analysis
Arena Elo1400
2025-12-20
AA 综合指数30
2026-08-28
真实仓库修 bug73.3
2025-12-20
GPQA 推理67.2
2026-08-28
架构简图
- 类型
- 未披露
- 注意力
- 未披露
- 层数
- 未披露
- 专家
- 未披露
- 隐藏维
- 未披露
- 词表
- 未披露
完善中
闭源模型,无自建选项,不提供显存表。
完善中
完善中
逻辑能力
工程型推理在同价位里领先;考试型推理中等。适合做多 agent 系统里的执行者。
亮点
- 1.SWE-bench Verified 73.3%,小模型里最强代码
- 2.$1 / $5,支持 extended thinking
- 3.延迟低,适合子 agent
坑
- 1.知识广度与复杂推理弱于 Sonnet 4.5
- 2.长任务规划能力有限
- 3.无自建
适合:高频代码补全 / 小任务 · 多 agent 子任务
不适合:复杂长任务
| 基准 | 分数 | 来源 | 日期 | 证据 |
|---|---|---|---|---|
| LMArena Text Elo人类偏好 Elo | 1400 | LMArena Text (style control) | 2025-12-20 | 独立复测 |
| SWE-bench Verified真实仓库修 bug | 73.3% | Anthropic 发布公告 | 2025-12-20 | 厂商公布 |
| GPQA Diamond研究生级科学问答 | 73% | Anthropic 发布公告 | 2025-12-20 | 厂商公布 |
| AIME 2025美国数学邀请赛 | 80.6% | Anthropic 发布公告 | 2025-12-20 | 厂商公布 |
| τ²-bench工具调用 agent | 79.6% | Anthropic 发布公告 | 2025-12-20 | 厂商公布 |
| Terminal-Bench终端 agent | 41% | Anthropic 发布公告 | 2025-12-20 | 厂商公布 |
| MMMU多模态理解 | 70% | Anthropic 发布公告 | 2025-12-20 | 厂商公布 |
| Artificial Analysis Intelligence IndexAA 综合指数 | 30 | Artificial Analysis (v4.1.1) | 2026-08-28 | 独立复测 |
| GPQA Diamond研究生级科学问答 | 67.2% | Artificial Analysis (v4.1.1) | 2026-08-28 | 独立复测 |
| Humanity's Last Exam人类最后考试 | 10.4% | Artificial Analysis (v4.1.1) | 2026-08-28 | 独立复测 |
| AIME 2025美国数学邀请赛 | 83.7% | Artificial Analysis (v4.1.1) | 2026-08-28 | 独立复测 |
| LiveCodeBench竞赛编程 | 61.5% | Artificial Analysis (v4.1.1) | 2026-08-28 | 独立复测 |
| SciCode科学计算编程 | 43.3% | Artificial Analysis (v4.1.1) | 2026-08-28 | 独立复测 |
| Terminal-Bench Hard终端 agent(AA 困难子集) | 27.3% | Artificial Analysis (v4.1.1) | 2026-08-28 | 独立复测 |
| τ²-Bench Telecom工具调用 agent(电信域) | 54.7% | Artificial Analysis (v4.1.1) | 2026-08-28 | 独立复测 |
| MMMU-Pro多模态理解(Pro) | 58.6% | Artificial Analysis (v4.1.1) | 2026-08-28 | 独立复测 |
| IFBench指令遵循 | 54.3% | Artificial Analysis (v4.1.1) | 2026-08-28 | 独立复测 |
| Terminal-Bench终端 agent | 44.2% | Artificial Analysis · Terminal-Bench 2.1 | 2026-08-28 | 独立复测 |
| τ³-Bench Banking工具调用 agent(银行域) | 9.3% | Artificial Analysis · τ³-Bench Banking | 2026-08-28 | 独立复测 |
| LMArena Chinese Elo中文人类偏好 Elo | 1434 | LMArena Text · Chinese (style control) | 2026-08-28 | 独立复测 |
更新 2025-12-20 · 排名供选型参考,基准会饱和、会泄漏、会过时。