Anthropic发布Claude Sonnet 5.5:速度提升30%性能跃升

Anthropic发布Claude Sonnet 5.5,速度提升超30%。该模型在代理编码基准中得分大幅跃升,实测任务成本降低约30%,并首次引入最高级别网络安全措施,定位为Opus 5.5的快速低成本补充方案。

Claude Sonnet 5.5 发布:性能大幅跃升,速度提升超30%

Anthropic 近日推出 Claude 5.5 系列的第二款模型——Claude Sonnet 5.5。作为 Claude Sonnet 5 的升级版,该模型运行速度提升了 30% 以上,定位为 Claude Opus 5.5 的快速、低成本补充方案。

Terminal-Bench得分70.6%

Opus 5.5 主要面向需要谨慎判断和复杂设计眼光的高难度任务,而 Sonnet 5.5 则在保持高性能的同时,显著优化了响应速度与成本效率。未来几周内,Claude 5.5 系列还将加入更多成员。

核心改进:性能、协作与成本

性能表现:Sonnet 5.5 在代理编码基准 Terminal-Bench 4.0 中取得 70.6% 的成绩,远超 Sonnet 5 的 10.3%。在 GDPval-AA(针对真实职业工作的测试)中,其得分仅比 Opus 5.5 低两分。值得注意的是,它是首个仅通过屏幕截图即可击败此前所有 Sonnet 模型的版本。

协作体验:与 Opus 5.5 类似,Sonnet 5.5 的输出风格更加清晰自然。早期测试者将其评价为优于 Sonnet 5 的合作伙伴。其高速特性使其非常适合处理非复杂的快速迭代任务。

成本效益:Sonnet 5.5 维持与 Sonnet 5 相同的价格体系:每百万输入代币 2 美元,输出代币 10 美元,缓存读取 0.20 美元。但由于完成相同任务所需的代币数量减少,实测显示每项任务的平均成本降低了约 30%。

速度与对齐安全:作为迄今最快的 Sonnet 模型,其输出速度较前代提升逾 30%。在自动行为审计中,Sonnet 5.5 在大多数对齐指标上与 Sonnet 5 持平或有所提升。鉴于其网络安全能力接近 Opus 5,它成为首个引入 Anthropic 最高级别网络安全措施及备用方案的 Sonnet 模型。生物安全保护措施则与 Sonnet 5 保持一致,主要针对狭窄的高风险请求,常规软件开发及大部分生命科学工作不受影响。

详细基准测试数据

Sonnet 5.5 在各领域均展现出显著进步,部分评估中即便在最大努力值(Max effort)设置下,其表现也可与 Opus 5.5 相媲美。然而,基准分数仅反映模型能力的一个侧面;在外部测试人员的复杂任务评估中,Opus 5.5 仍占据优势。

Sonnet 5.5 Sonnet 5 Opus 5.5 GPT-6 Sol
代理编码: Terminal-Bench 4.0 70.6% 10.3% 66.4%¹ —
代理编码: FrontierCode 1.1 (High) 46.2% 42.4% 54.4% 49.3%
代理编码: FrontierCode 1.1 (Max) 52.1%
代理编码: CursorBench 4.0 55.5% 34.1% 57.8% —
知识工作: GDPval-AA v2.13 1844 1449 1846 1487⁴
知识工作: AA-Briefcase v1.13 1811 1359 1822 1483⁴
多学科推理: HLE (使用工具) 64.5% 54.9% 67.7% —
计算机使用: OSWorld 2.1 (部分) 80.1% 57.0% 81.8% —
视觉识别: ChartQA (无工具) 61.6% 15.6% 64.4% 53.6%⁴

注:有关评估方法的详细信息,请参阅 Sonnet 5.5 系统卡。

在多个基准测试中,处于低或中等努力值的 Sonnet 5.5 已超越 Sonnet 5 的最佳成绩,且每项任务成本约为前代的十分之一。相比之下,Opus 5.5 在较低努力值设置下运行更具成本效益,而在高努力值设置下,两者以相似成本提供相似性能。

编码能力评估

在编码任务上,Sonnet 5.5 的优势尤为明显。在 FrontierCode 的高努力值测试中,其得分比同设置下的 Sonnet 5 高出 10 分,每项任务成本仅为后者的十五分之一。在模拟真实 Cursor 编码会话的 CursorBench 测试中,其最佳得分距 Opus 5.5 仅差两分。

早期测试者指出,Sonnet 5.5 能更快理解代码库,且在正确运行的情况下,集成工具调用次数多于 Sonnet 5,从而减少了步骤并降低了成本。

“在 Epic 的早期测试中,Claude Sonnet 5.5 的质量标准与高层模型一致,在系统设计审核和数据流审查中保持稳定。新模型管理了游戏系统架构中的数万行代码,保持快速响应,处理多小时任务,且所需的规范性提示更少。”

“Claude Sonnet 5.5 是位快手。编码迅速,能在代理工作流程中快速引导,必要时也能长时间工作。它拥有 Opus 5.5 的自然写作升级,这使得合作过程更加愉悦。”

“Claude Sonnet 5.5 在不同复杂度的任务中表现出比 Sonnet 5 更好的判断力,同时消耗更少的输出代币。Sonnet 5 过于频繁的网络搜索和高代币使用趋势在新模式中消失了。”

“Claude Sonnet 5.5 在 CursorBench 4.0 上交付了前沿级别的性能,得分为 55.5%,仅次于 Opus 5.5。我们认为它将受到寻求平衡性能与成本的开发者的欢迎。”

“在 118 个真实应用构建中,Claude Sonnet 5.5 生成的应用评分与 Opus 5 持平。平均每个构建仅需 3.6 次迭代,而 Opus 5 需要 7.7 次。它的失败工具调用次数最少,且很少中途停止询问用户,减少了构建停滞的情况。”

“在 Unity,我们对任务完成率有很高的要求。项目会被重新打开并在运行时检查结果,因此只有当更改生效时才算完成任务。Claude Sonnet 5.5 的大部分工作都通过了这一检查。在我们的多步 Unity Editor 和编码基准测试中,它完成了 90% 的任务,超越了同类模型。”

“当 Claude Opus 5.5 设定游戏的架构和总体框架时,我有信心让 Sonnet 5.5 去实现它。我对 Sonnet 5.5 处理长期复杂任务的能力印象深刻。”

知识工作与专业应用

Sonnet 5.5 在知识工作领域也取得了多项进展。在涵盖 44 种职业和九大行业真实任务的 GDPval-AA 测试中,其得分几乎与 Opus 5.5 持平,比 Sonnet 5 高出约 400 分。在计算机使用和图表识别方面,它接近 Opus 5.5 的水平,并在长周期知识工作中明显优于 Sonnet 5 和 GPT-6 Sol。

早期测试者还强调了难以量化的改进:对话更自然,具备设计敏感度,能为用户界面增添润色,并能遵循幻灯片模板制作只需极少编辑的演示文稿。在一项内部测试中,模型根据上市公司季度财报材料、电话会议记录及幻灯片模板生成了一份 10 页运营回顾,两位专家判定其初稿可直接发送。

“在不改变任何提示词的情况下,Claude Sonnet 5.5 在我们几乎所有的离线 Slackbot 评估中都优于 Sonnet 5,步骤更少,输出代币减少约 14%。对于 Slackbot 而言,质量和速度至关重要,Sonnet 5.5 能让其为更快地为用户提供更好的结果。”

“我们将数百个真实支持用例输入 Claude Sonnet 5.5。相比目前生产环境中使用的 Claude 模型,它做出的错误决策更少,工单解决速度更快。工单处理速度提高了 20%,让客户无需等待即可获得帮助。”

“在我们包含问答、提取、分析和预测的 2,441 个私人金融任务套件中,Claude Sonnet 5.5 得分高于 Sonnet 5,每个答案平均使用约 121k 代币,而 Sonnet 5 使用了 497k。在高容量工作流中,它在七个对比模型中拥有最佳的质量成本比。”

“Claude Sonnet 5.5 将增强金融服务和医疗保健客户对其最敏感工作使用该模型的信心。它能重新检查源文档中的数据,捕捉到 Sonnet 5 未能发现的错误。与上一代模型相比,Sonnet 5.5 更准确,速度快 2.4 倍,总代币使用量减少 12%。”

“Claude Sonnet 5.5 以更少、更稳健的步骤进行思考,因此开发者等待进度的时间更短。我们的编码评估显示,完成任务的工具调用次数减少了三分之一,Shell 运行次数大约减半。这意味着更快的迭代和更顺畅的构建循环。”

“每月有数百万次由 Rovo 辅助的操作驱动着客户的工作流,执行速度至关重要。Claude Sonnet 5.5 将使团队能够以比 Sonnet 5 快 30% 的速度运行他们的 Rovo Agents。”

定价与速度细节

每百万代币价格 Claude Sonnet 5.5 Claude Opus 5.5
缓存读取 $0.20 $0.20
缓存写入 $2.50 $5
输入代币 $2 $4
输出代币 $10 $20

Sonnet 5.5 不仅单价与前代持平,且因所需代币更少,实际运行成本更低。其输出速度提升超过 30%,效率提升立竿见影。

用户可以通过调整努力值(Effort Level)来平衡成本、速度与质量。在 Claude Code 和应用中,默认设置为 Medium;在 Claude Platform 中默认为 High。较低设置适合日常任务,响应更快且代币消耗更少;较高设置则延长推理时间并进行更彻底的工作检查。

安全性与对齐评估

Sonnet 5.5 并未推进模型能力的边界,因此对齐评估主要集中在适用于任何能力水平模型的一组特定风险上,包括违背用户利益、误导用户以及配合高风险滥用等。

在涵盖约 1,850 种场景的自动行为审计中,Sonnet 5.5 在大多数对齐、抗滥用和诚实性指标上优于或持平于 Sonnet 5。在新的遏制评估中,Sonnet 5.5 的表现接近我们测试过的最佳模型 Opus 5.5,显示出极低的违规倾向。

评论 0

0/500

评论需审核后展示,请文明发言

💬
还没有评论,来说两句

相关阅读