Anthropic发布Claude Opus 5.5,成本降40%

Anthropic发布Claude Opus 5.5,成本降40%。该模型性能接近Fable 5.1,缓存读取价格下降60%,输出速度提升超30%,并增强了抗即时注射攻击等安全能力。

Anthropic 正式发布 Claude Opus 5.5,这是其最新一代模型家族中的首个成员。该模型在大多数任务中达到了 Claude Fable 5.1 的性能水平,同时运行成本较前代 Opus 5 降低了 40%。

Opus 5.5成本比Opus 5低40%

Claude Opus 5.5 是 Anthropic 自“步行到边境”倡议以来的首次重大发布。在正式推出前,Frontier Design 和 METR 等外部评估机构对该模型进行了测试。官方称其为迄今测试过的最强模型,并配备了针对高能力模型开发的保护措施。

核心改进与性能表现

性能提升:Opus 5.5 相比 Opus 5 有显著进步,成为新的领先模型。早期测试显示其在处理复杂工作时性能飞跃明显。例如,一位测试者在不到一天的时间内完成了 680,000 行代码的迁移,而这项工程团队通常需要数周时间。在软件低效问题修复方面,当被要求缩短 Web 应用所有页面的加载时间时,Opus 5.5 在 40 次尝试中成功了 39 次;相比之下,Opus 5 虽然也有改进,但幅度较小且改变了应用行为。此外,在一项让多个 Claude 模型根据单个提示构建游戏的测试中,凭借图形效果和整体打磨,Opus 5.5 得分高于其他任何模型。

安全性增强:通过自动行为审计和对齐套件测试,Claude 在成千上万的模拟场景中接受了验证。Opus 5.5 比近期模型更不可能采取难以逆转的行动或超出赋予界限,且比 Opus 5 更能抵抗即时注射攻击。对齐测试范围已扩大至较长任务、不可能的任务及基于真实事件的场景,尽管仍存在局限性。详细评估数据可在 Opus 5.5 系统卡中查阅。

生物与安全限制:鉴于 Opus 5.5 在生物学和网络安全方面的能力与 Claude Mythos 5.1 相似,Anthropic 部署了类似 Claude Fable 5.1 的保护措施。经过验证的组织可申请使用 Opus 5.5 进行生命科学研究;经认证的网络安全从业者也可获准使用。

沟通方式优化:Opus 5.5 的交流风格比前代模型更自然清晰,解决了用户对 Opus 5 的一些常见反馈。它将重要信息前置,适合长时间协作,使得工作过程更易跟踪和检查,兼具安全与实用价值。

成本效益与定价

Opus 5.5 需要更少的计算资源,价格相应调整。默认设置下,典型工作负载的成本比 Opus 5 低 40%。具体定价如下:

每百万代币价格 Claude Opus 5.5 Claude Opus 5
缓存读取 $0.20 $0.50
输入代币 $4 $5
输出代币 $20 $25
缓存写入 $5 $6.25

其中,缓存读取(占代理和编码工作成本的大头)价格下降 60%,输入和输出代币价格分别下降 20%。Opus 5.5 的输出速度比 Opus 5 快 30% 以上。此外,Pro、Max、Team 及企业计划的五小时使用限制有所增加,订阅用户现在可以随时保存和使用利率限制重置。

快速模式也在 Claude Code 和 Claude 平台上线,速度可达 2.5 倍,定价为每百万输入代币 8 美元,每百万输出代币 40 美元。

基准测试结果

在代理编码、计算机使用和知识工作等基准测试中,Claude Opus 5.5 处于领先地位。不过,Anthropic 指出,在这些能力水平上,基准分数对现实差异的反映可靠性正在降低。内部测试显示,Opus 5.5 与 Claude Fable 5.1 之间的实际差距小于分数所示。

Opus 5.5 Fable 5.1 Opus 5 GPT-6 Astra GPT-5.6 Sol
代理编码 Terminal-Bench 4.0
代理编码 Terminal-Bench 4.0 66.4% 55.8% 52.3% 57.9% 37.3%
代理编码 FrontierCode v1.1 (主)
代理编码 FrontierCode v1.1 (主) 54.4% 50.3% 48.0% 53.3% 47.5%
代理编码 CursorBench 4.0
代理编码 CursorBench 4.0 57.8% 51.8% 46.6% 41.7%
知识工作 GDPval-AA v2.1
知识工作 GDPval-AA v2.1 1846 1735 1708 1542 1588
业务工作流程
业务工作流程 40.0% 31.4% 26.9% 41.4% 28.8%
多学科推理 HLE
多学科推理 HLE 67.7% (使用工具) 65.6% (使用工具) 63.6% (使用工具) 57.2% (使用工具)
代理科学研究 Terminal-Bench Science 0.1
代理科学研究 Terminal-Bench Science 0.1 58.7% 52.6% 29.0% 64.6% 22.4%
计算机使用 OSWorld 2.0
计算机使用 OSWorld 2.0 81.8% (部分完成) 80.7% (部分完成) 74.0% (部分完成)
视觉识别图表
视觉识别图表 89.0% (使用工具) 88.4% (使用工具) 83.4% (使用工具)
除非另有说明,所有 Claude Opus 5.5 的结果均使用最大努力适应性思维。据 OpenAI 报道,高力度 Claude Opus 5.5 和高力度 GPT-6 Astra 报告了 Terminal-Bench 4.0 的最高分。Claude Opus 5.5 在启用生产保护措施的情况下进行评估,若介入则网络安全任务由 Claude Opus 4.8 完成,生物学和前沿 LLM 开发任务由 Claude Opus 5 完成,这可能影响基准表现。Terminal-Bench 4.0 标准误差:Claude Opus 5.5 为 ±2.6 pts,其他 Claude 模型为 ±1.622 pts。AutomationBench 结果由 Zapier 运行,无备用模型,保护干预视为失败。

Opus 5.5 的主要优势在于效率。其代币成本低于 Opus 5,且每项任务使用的代币数量更少,导致总成本下降 40%。

编程能力实测

Opus 5.5 在处理代码库级迁移和审计等长周期、大规模任务时表现尤为突出。一位早期测试者利用它在不到三小时内完成了一个 200,000 行代码库的审计与修复,而 Opus 5 耗时超过 20 小时,token 用量高出 2.5 倍。

在一项内部测试中,Anthropic 让 Opus 5.5 和 Fable 5.1 将 HAProxy(一款广泛使用的负载均衡软件)从 C 语言翻译为 Rust。两者的重写版本均通过了几乎全部的回归测试,但 Opus 5.5 仅用时 9.5 小时,而 Fable 5.1 耗时 12 小时,且 Opus 5.5 成本低了 51%。

在 FrontierCode 默认工作水平上,Opus 5.5 超过了 GPT-6 Astra,每任务成本约为后者的 20%。在 Terminal-Bench 4.0 上,它与 Astra 匹配,成本约为 40%。在 CursorBench 上,它以 11 个百分点的优势超越 GPT-5.6 Sol,成本仅为三分之一。

最安全的编码代理

对于在企业系统中自主运行数小时的代理,安全性至关重要。Opus 5.5 配备了动作分类器,在运行前筛选每个动作;提供开源沙盒供安全团队审计;并在合并前通过代码审查捕捉漏洞。

模型本身的防御能力也更强。在即时注射攻击测试中,Opus 5.5 在编码、工具使用、计算机使用和网页浏览等所有设置中均持平或优于 Opus 5。在 AI 安全公司 Gray Swan 进行的基准测试中,Opus 5.5 与 Fable 5.1 并列,拥有所有被测模型中最低的即时注射成功率。

知识工作与商业应用

Opus 5.5 在研究任务中表现出色。在一次内部测试中,要求 Opus 5.5、Fable 5.1 和 Opus 5 仅凭网络上难以定位的信息撰写某公司季度业绩报告。自动评分器对照来源检查了每个数字和引用。在不同努力设置下,Opus 5.5 的 18 份报告中有 16 份达到质量标准(任何虚构数字或引用都会导致失败),而 Fable 5.1 和 Opus 5 在任何尝试中均未达标。

在金融分析和商业工作中,Opus 5.5 同样强劲。投资公司 Walleye Capital 报告称,Opus 5.5 在最低设置下基本解决了他们的评估套件;在更高设置下表现更好,甚至发现并纠正了评估指令中的一个错误,此前没有其他模型能捕捉到此错误。

另一项测试中,Opus 5.5 和 Opus 5 被要求分析两家虚构 HR 软件公司的拟议合并案。两者均在 Excel 中建立财务模型,并将其转化为关于交易是否合理的执行演示文稿。

行业早期测试反馈

多家科技和金融公司分享了 Opus 5.5 的实际应用体验:

  • GitHub: 首席产品官 Mario Rodriguez 表示,在 GitHub Copilot CLI 和 VS Code 的测试中,Claude Opus 5.5 使用了他们测量到的最少 token 和步骤。在 VS Code 中,它用不到 Opus 5 一半的步骤解决了更多终端任务,使大型项目更具可行性。
  • Clio: 高级软件开发人员 Sean Heintz 提到,他将一个跨六个仓库的大型工程任务交给 Claude Opus 5.5 无人值守运行过夜。模型持续工作了 18 小时以上,定义服务间通信并实施应用。相比 Opus 5,它更快达成里程碑且返工极少,代码注释简洁有用。
  • Lovable: CTO Fabian Hedin 指出,对于 Lovable 构建者,Opus 5.5 意味着以同等质量实现更快的构建。它一次性收集上下文,进行更少且更完整的编辑,避免陷入重试循环,步骤减少三分之一到一半,token 消耗显著降低。
  • Quantium: AI 技术执行经理 Harley Barnes 分享道,在一个复杂的编码任务中,之前需要四天 38 个提示词的工作,现在仅需三小时 11 个提示词,产出更接近生产环境且返工更少。这节省了迭代时间,让团队有更多精力验证假设和优化方案。
  • Spotify: 高级工程师 Aleksandar Mitic 确认,内部评估显示 token 效率有明显提升,能够以更便宜和更快的速度完成相同任务。
  • Optiver: 全球 AI 工程主管 Noyan Tokgozoglu 表示,在代理编码任务中,Claude Opus 5.5 在约一半的轮次、时间和输出 token 内达到了 Opus 5 的质量,将该工作负载成本降低了 40% 到 50%。它在某个交易支持套件上取得了最高分,通过了早期 Claude 模型未能完成的任务,并在分析任务中位居八款模型之首。
  • Column: 工程师 Mitch Fierro 提到,Claude Opus 5.5 更有效地委托子代理并以创造性方式自我检查。自我验证循环更容易设置。它在云账单中发现了以前模型遗漏的节省机会,并在代码审查中通过检查第三方集成的外部文档,捕捉到了几个提交前建模错误的 bug。
  • Kiro: Agentic AI 副总裁 Deepak Singh 指出,在公开的真实命令行任务基准测试中,Claude Opus 5.5 解决的任务多于 Opus 5,但调用次数减少约 40%,token 用量减半。这意味着开发者可以使用 Kiro 获得更快、更实惠的代理会话。Opus 5.5 即将在 Kiro 中可用。

Claude Sonnet 5.5 和 Claude Haiku 5.5 预计将在接下来的几周内推出。

评论 0

0/500

评论需审核后展示,请文明发言

💬
还没有评论,来说两句

相关阅读