Anthropic 发布 Claude Haiku 5.5:成本降低约 75%,专为高吞吐量任务设计
Anthropic 正式推出其最新的小型模型 Claude Haiku 5.5。该模型定位为最便宜、最快且能力强劲的小型模型,专门针对高量级且对成本敏感的任务场景进行优化。

Claude Haiku 5.5 能够可靠地处理快速重复的工作负载,包括摘要生成、数据压缩、数据库查询以及分类请求。在编码工作流中,它可作为 Opus 5.5 和 Sonnet 5.5 的辅助代理(sub-agent)协同工作。得益于其作为 Anthropic 迄今为止速度最快的模型这一特性,Haiku 5.5 特别适用于实时客户支持和浏览器自动化等对延迟高度敏感的任务。
在定价方面,Claude Haiku 5.5 的平均运行成本较上一代 Haiku 4.5 降低了约 75%。
伴随此次发布,Anthropic 还调整了其模型系列的价值策略:Claude Sonnet 5.5 的缓存读取价格减半,使得该模型在大多数代理任务中的成本降低约 20%;同时,面向 Claude Max 和 Team 用户推出了新的月度 API 信用额度。
基准测试表现
以下是 Claude Haiku 5.5 在多项基准测试中与 Haiku 4.5、GPT-6 Moon 及参考模型 Sonnet 5.5 的表现对比:
| Haiku 5.5 | Haiku 4.5 | GPT-6 Moon | Sonnet 5.5 (参考) | ||
|---|---|---|---|---|---|
| 知识工作 GDPval-AA v2.1 | |||||
| GDPval-AA v2.1 | 1620 | 735 | 1437 | 1840 | |
| 知识工作 AA-Briefing v1.1 | |||||
| AA-Briefing v1.1 | 1578 | 614 | 1336 | 1824 | |
| 计算机使用 OSWorld 2.1 | |||||
| OSWorld 2.1 (离线部分) | 72.4% | 15.7% | 48.9% | 83.9% | |
| 多学科推理 Humanity's Last Exam | |||||
| Humanity's Last Exam | 45.9% (无工具) | 10.2% (无工具) | — | 56.9% (无工具) | |
| 57.4% (使用工具) | 18.7% (使用工具) | — | 64.5% (使用工具) | ||
| 代理编码 Terminal-Bench 4.0 | |||||
| Terminal-Bench 4.0 | 39.2% | 0.0% | 16.4% | 70.6% | |
| 代理编码 FrontierCode 1.1 (主要) | |||||
| FrontierCode 1.1 (主要) | 46.4% | — | 42.4% | 52.1% (较高) | |
| 视觉推理 | |||||
| 视觉推理 (无工具) | 46.4% | 6.4% | 29.1% | 61.6% | |
这是 Anthropic 首款具备可调算力(tunable power)的 Haiku 级模型。这意味着用户可以像操作其他大型模型一样,根据需求在成本和智能之间进行权衡。以下图表展示了 Haiku 5.5 在不同努力设置下的三项基准指标表现:
- Computer use: OSWorld
- Knowledge work: GDPval-AA
- Multidisciplinary reasoning: Humanity’s Last Exam
OSWorld 2.1 衡量代理如何在真实计算机上执行漫长的多步骤任务。
人工分析的 GDPval-AA v2.1 评估了涵盖 44 个职业的实际专业工作人员表现。
Humanity’s Last Exam (HLE) 是对专家水平学术知识和推理能力的测试。
企业客户反馈
早期测试显示,客户报告的性能提升和成本改进结果与上述基准测试一致。多家企业分享了他们的使用体验:
Asana — Aaron Vinh, Staff Software Engineer
“我们对 Claude Haiku 5.5 的速度非常感兴趣。在我们的 AI Teammates 评估套件中,涵盖了错误分类、项目设置以及搜索大型投资组合以发现高风险或逾期工作等用例。与我们当前使用的模型相比,任务完成延迟时间减少了 30%,每个代理轮次的推断速度提高了 2.5 倍。这带来了明显更快的用户体验。”
HubSpot — Ze’ev Klapow, Distinguished Software Engineer
“在 HubSpot,我们使用模拟门户来评估 CRM 任务的新模型。我们主要测试较小、更高效的模型,Claude Haiku 5.5 在我们的测试套件中取得了最佳分数。在一个要求模型识别过时但模糊记录的 CRM 审计任务中,Haiku 5.5 完成任务的速度快于所有其他测试模型。”
AlphaSense — Daniel Campos, Distinguished Engineer
“我们在生产过程中每周处理 800 万个电话查询,通常是在一个或几个文件之上回答非常具体的问题。在运行的 400 个查询中,Claude Haiku 5.5 相比 Haiku 4.5 有显著进步。”
Box — Yashodha Bhavnani, VP of AI Products
“我们的客户在大量企业内容中使用 Box AI。随着广泛的使用,需要管理效率和成本,并找到最适合任务的最佳模型。在早期测试中,Claude Haiku 5.5 比 Haiku 4.5 得分高 11 分,延迟约为后者的一半。我们将把它用于从成本报告到财务总结和每周反复审查等规模化的分析工作。”
Rogo — Alex Wang, Applied AI
“对于简短且大量的工作,例如快速查找、副代理和摘要,Claude Haiku 5.5 非常适合。当使用更大的模型构建甲板时,一个 Haiku 5.5 的子代理进入 10K 并拉出甲板所需的细分收入线。它足够准确让我们信任,而且速度快、价格便宜,我们可以大量运行。”
Cognition — Walden Yan, Co-Founder & CPO
“Claude Haiku 5.5 加入了 Devin Fusion 中的助手阵容,成为一个优秀的选择。随着 Haiku 5.5 的支持,Fusion 拥有 66.2 的顶级 FrontierCode 分数,同时降低了成本和延迟。现在可以在 Devin CLI 中使用 Opus 5.5 进行测试。”
定价详情
下表展示了 Claude Haiku 5.5 与其他模型的每百万 token 价格对比。对于提示词长度不超过 100,000 个 token 的任务,Haiku 5.5 具有极高的性价比,此类请求约占上一代 Haiku 模型总请求量的 90%。
| 每百万代币价格 | Haiku 5.5 (提示 ≤/> 100k) | Haiku 4.5 | Sonnet 5.5 |
|---|---|---|---|
| 缓存读取 | $0.01 / $0.05 | $0.10 | $0.10 |
| 缓存写入 | $0.125 / $0.625 | $1.25 | $2.50 |
| 输入 Token | $0.10 / $0.50 | $1.00 | $2.00 |
| 输出 Token | $0.50 / $2.50 | $5.00 | $10.00 |
安全性
对齐性 (Alignment)。 相对于 Haiku 4.5,Claude Haiku 5.5 在几乎所有对齐评估中都显示出重大改进。具体而言,未对齐行为实例大幅减少,且配合滥用的意愿降低。模型的详细评估过程和结果描述见其系统卡。
防护措施 (Safeguards)。 与其能力相匹配,Haiku 5.5 的网络安全防护限制比 Haiku 4.5 更严格,但略低于近期其他模型的限制。在网络安全方面,它允许比 Sonnet 5.5 防护范围更广的防御性任务,但仍会阻止渗透测试及其他更可能被攻击者利用的技术。
Haiku 5.5 的生物安全防护措施与 Sonnet 5、Sonnet 5.5 和 Opus 5 相同。这些措施允许研究性的生物学问题,但限制访问那些被认为可能造成危害的请求。从事更广泛生物学和网络活动的组织可以申请加入生命科学验证计划(Life Sciences Verification Program)和网络验证计划(Cyber Verification Program)。
可用性与更新
Claude Haiku 5.5 现已在所有平台上线,包括 Amazon Web Services、Google Cloud 和 Microsoft Azure。在 Claude Platform 上,开发者可以通过 claude-haiku-5-5 开始使用。迁移指南已提供相关细节。
除了新定价外,Anthropic 还进行了以下产品价值优化:
首先,即日起,Claude Sonnet 5.5 的缓存读取价格降低 50%,从每百万 token $0.20 降至 $0.10。由于缓存读取占据了模型 token 消耗的大部分,这使得 Sonnet 5.5 在大多数代理任务上的成本降低约 20%。
下图展示了降价后 Sonnet 5.5 在 Terminal-Bench 4.0 上的性能与成本关系:
Terminal-Bench 4.0 衡量模型在命令行界面中完成复杂多步骤专业任务的能力。
该图表揭示了 Haiku 5.5 与更大模型之间的关键差异。Sonnet 5.5 和 Opus 5.5 仍然是 Terminal-Bench 4.0 所衡量的复杂代理编码任务的更好选择。相比之下,Haiku 5.5 最适合范围较窄的任务,如压缩、摘要或子代理工作,这些任务在使用旧版 Claude 时可能因成本过高而难以实施。
其次,本周将向所有 Max 和 Team 订阅用户推出新的月度 API 信用额度,用于 Claude Platform。Max 5x 用户每月将获得 $100 信用额度,Max 20x 用户获得 $200,Team 订阅用户可获得高达 $500 的池化信用额度。这些信用额度旨在让用户尝试构建调用 API 的工具、应用程序和代理,可用于任何模型。
此外,Anthropic 正在更新 Claude Python 和 TypeScript SDK,以添加对计算机使用和浏览器使用的 Beta 支持。鉴于 Haiku 5.5 在速度、能力和价格方面的结合,它特别适合此类任务。
脚注
1 Claude Haiku 5.5 是 Anthropic 迄今为止在标准速度下最快的模型,尽管它在 Fast Mode 下的运行速度不如 Opus 模型快。
2 对于不超过 100,000 个 token 的请求,Claude Haiku 5.5 的价格比 Claude Haiku 4.5 低 90%;对于超过 100,000 个 token 的请求,价格低 50%。在 Haiku 4.5 中,90% 的请求属于前者类别。此计算还考虑了 Haiku 4.5 和 Haiku 5.5 在完成给定工作时使用 token 数量的变化:Haiku 5.5 采用了更新的 tokenizer(类似于 Sonnet 5.5 和 Opus 5.5),这意味着它每项任务使用的 token 数量略多。





