Anthropic 正式发布 Claude Opus 5.5,这是其最新一代模型家族中的首个成员。该模型在大多数任务中达到了 Claude Fable 5.1 的性能水平,同时运行成本较前代 Opus 5 降低了 40%。

Claude Opus 5.5 是 Anthropic 自“步行到边境”倡议以来的首次重大发布。在正式推出前,Frontier Design 和 METR 等外部评估机构对该模型进行了测试。官方称其为迄今测试过的最强模型,并配备了针对高能力模型开发的保护措施。
核心改进与性能表现
性能提升:Opus 5.5 相比 Opus 5 有显著进步,成为新的领先模型。早期测试显示其在处理复杂工作时性能飞跃明显。例如,一位测试者在不到一天的时间内完成了 680,000 行代码的迁移,而这项工程团队通常需要数周时间。在软件低效问题修复方面,当被要求缩短 Web 应用所有页面的加载时间时,Opus 5.5 在 40 次尝试中成功了 39 次;相比之下,Opus 5 虽然也有改进,但幅度较小且改变了应用行为。此外,在一项让多个 Claude 模型根据单个提示构建游戏的测试中,凭借图形效果和整体打磨,Opus 5.5 得分高于其他任何模型。
安全性增强:通过自动行为审计和对齐套件测试,Claude 在成千上万的模拟场景中接受了验证。Opus 5.5 比近期模型更不可能采取难以逆转的行动或超出赋予界限,且比 Opus 5 更能抵抗即时注射攻击。对齐测试范围已扩大至较长任务、不可能的任务及基于真实事件的场景,尽管仍存在局限性。详细评估数据可在 Opus 5.5 系统卡中查阅。
生物与安全限制:鉴于 Opus 5.5 在生物学和网络安全方面的能力与 Claude Mythos 5.1 相似,Anthropic 部署了类似 Claude Fable 5.1 的保护措施。经过验证的组织可申请使用 Opus 5.5 进行生命科学研究;经认证的网络安全从业者也可获准使用。
沟通方式优化:Opus 5.5 的交流风格比前代模型更自然清晰,解决了用户对 Opus 5 的一些常见反馈。它将重要信息前置,适合长时间协作,使得工作过程更易跟踪和检查,兼具安全与实用价值。
成本效益与定价
Opus 5.5 需要更少的计算资源,价格相应调整。默认设置下,典型工作负载的成本比 Opus 5 低 40%。具体定价如下:
| 每百万代币价格 | Claude Opus 5.5 | Claude Opus 5 |
|---|---|---|
| 缓存读取 | $0.20 | $0.50 |
| 输入代币 | $4 | $5 |
| 输出代币 | $20 | $25 |
| 缓存写入 | $5 | $6.25 |
其中,缓存读取(占代理和编码工作成本的大头)价格下降 60%,输入和输出代币价格分别下降 20%。Opus 5.5 的输出速度比 Opus 5 快 30% 以上。此外,Pro、Max、Team 及企业计划的五小时使用限制有所增加,订阅用户现在可以随时保存和使用利率限制重置。
快速模式也在 Claude Code 和 Claude 平台上线,速度可达 2.5 倍,定价为每百万输入代币 8 美元,每百万输出代币 40 美元。
基准测试结果
在代理编码、计算机使用和知识工作等基准测试中,Claude Opus 5.5 处于领先地位。不过,Anthropic 指出,在这些能力水平上,基准分数对现实差异的反映可靠性正在降低。内部测试显示,Opus 5.5 与 Claude Fable 5.1 之间的实际差距小于分数所示。
| Opus 5.5 | Fable 5.1 | Opus 5 | GPT-6 Astra | GPT-5.6 Sol | |
|---|---|---|---|---|---|
| 代理编码 Terminal-Bench 4.0 | |||||
| 代理编码 Terminal-Bench 4.0 | 66.4% | 55.8% | 52.3% | 57.9% | 37.3% |
| 代理编码 FrontierCode v1.1 (主) | |||||
| 代理编码 FrontierCode v1.1 (主) | 54.4% | 50.3% | 48.0% | 53.3% | 47.5% |
| 代理编码 CursorBench 4.0 | |||||
| 代理编码 CursorBench 4.0 | 57.8% | 51.8% | 46.6% | — | 41.7% |
| 知识工作 GDPval-AA v2.1 | |||||
| 知识工作 GDPval-AA v2.1 | 1846 | 1735 | 1708 | 1542 | 1588 |
| 业务工作流程 | |||||
| 业务工作流程 | 40.0% | 31.4% | 26.9% | 41.4% | 28.8% |
| 多学科推理 HLE | |||||
| 多学科推理 HLE | 67.7% (使用工具) | 65.6% (使用工具) | 63.6% (使用工具) | 57.2% (使用工具) | — |
| 代理科学研究 Terminal-Bench Science 0.1 | |||||
| 代理科学研究 Terminal-Bench Science 0.1 | 58.7% | 52.6% | 29.0% | 64.6% | 22.4% |
| 计算机使用 OSWorld 2.0 | |||||
| 计算机使用 OSWorld 2.0 | 81.8% (部分完成) | 80.7% (部分完成) | 74.0% (部分完成) | — | — |
| 视觉识别图表 | |||||
| 视觉识别图表 | 89.0% (使用工具) | 88.4% (使用工具) | 83.4% (使用工具) | — | — |
Opus 5.5 的主要优势在于效率。其代币成本低于 Opus 5,且每项任务使用的代币数量更少,导致总成本下降 40%。
编程能力实测
Opus 5.5 在处理代码库级迁移和审计等长周期、大规模任务时表现尤为突出。一位早期测试者利用它在不到三小时内完成了一个 200,000 行代码库的审计与修复,而 Opus 5 耗时超过 20 小时,token 用量高出 2.5 倍。
在一项内部测试中,Anthropic 让 Opus 5.5 和 Fable 5.1 将 HAProxy(一款广泛使用的负载均衡软件)从 C 语言翻译为 Rust。两者的重写版本均通过了几乎全部的回归测试,但 Opus 5.5 仅用时 9.5 小时,而 Fable 5.1 耗时 12 小时,且 Opus 5.5 成本低了 51%。
在 FrontierCode 默认工作水平上,Opus 5.5 超过了 GPT-6 Astra,每任务成本约为后者的 20%。在 Terminal-Bench 4.0 上,它与 Astra 匹配,成本约为 40%。在 CursorBench 上,它以 11 个百分点的优势超越 GPT-5.6 Sol,成本仅为三分之一。
最安全的编码代理
对于在企业系统中自主运行数小时的代理,安全性至关重要。Opus 5.5 配备了动作分类器,在运行前筛选每个动作;提供开源沙盒供安全团队审计;并在合并前通过代码审查捕捉漏洞。
模型本身的防御能力也更强。在即时注射攻击测试中,Opus 5.5 在编码、工具使用、计算机使用和网页浏览等所有设置中均持平或优于 Opus 5。在 AI 安全公司 Gray Swan 进行的基准测试中,Opus 5.5 与 Fable 5.1 并列,拥有所有被测模型中最低的即时注射成功率。
知识工作与商业应用
Opus 5.5 在研究任务中表现出色。在一次内部测试中,要求 Opus 5.5、Fable 5.1 和 Opus 5 仅凭网络上难以定位的信息撰写某公司季度业绩报告。自动评分器对照来源检查了每个数字和引用。在不同努力设置下,Opus 5.5 的 18 份报告中有 16 份达到质量标准(任何虚构数字或引用都会导致失败),而 Fable 5.1 和 Opus 5 在任何尝试中均未达标。
在金融分析和商业工作中,Opus 5.5 同样强劲。投资公司 Walleye Capital 报告称,Opus 5.5 在最低设置下基本解决了他们的评估套件;在更高设置下表现更好,甚至发现并纠正了评估指令中的一个错误,此前没有其他模型能捕捉到此错误。
另一项测试中,Opus 5.5 和 Opus 5 被要求分析两家虚构 HR 软件公司的拟议合并案。两者均在 Excel 中建立财务模型,并将其转化为关于交易是否合理的执行演示文稿。
行业早期测试反馈
多家科技和金融公司分享了 Opus 5.5 的实际应用体验:
- GitHub: 首席产品官 Mario Rodriguez 表示,在 GitHub Copilot CLI 和 VS Code 的测试中,Claude Opus 5.5 使用了他们测量到的最少 token 和步骤。在 VS Code 中,它用不到 Opus 5 一半的步骤解决了更多终端任务,使大型项目更具可行性。
- Clio: 高级软件开发人员 Sean Heintz 提到,他将一个跨六个仓库的大型工程任务交给 Claude Opus 5.5 无人值守运行过夜。模型持续工作了 18 小时以上,定义服务间通信并实施应用。相比 Opus 5,它更快达成里程碑且返工极少,代码注释简洁有用。
- Lovable: CTO Fabian Hedin 指出,对于 Lovable 构建者,Opus 5.5 意味着以同等质量实现更快的构建。它一次性收集上下文,进行更少且更完整的编辑,避免陷入重试循环,步骤减少三分之一到一半,token 消耗显著降低。
- Quantium: AI 技术执行经理 Harley Barnes 分享道,在一个复杂的编码任务中,之前需要四天 38 个提示词的工作,现在仅需三小时 11 个提示词,产出更接近生产环境且返工更少。这节省了迭代时间,让团队有更多精力验证假设和优化方案。
- Spotify: 高级工程师 Aleksandar Mitic 确认,内部评估显示 token 效率有明显提升,能够以更便宜和更快的速度完成相同任务。
- Optiver: 全球 AI 工程主管 Noyan Tokgozoglu 表示,在代理编码任务中,Claude Opus 5.5 在约一半的轮次、时间和输出 token 内达到了 Opus 5 的质量,将该工作负载成本降低了 40% 到 50%。它在某个交易支持套件上取得了最高分,通过了早期 Claude 模型未能完成的任务,并在分析任务中位居八款模型之首。
- Column: 工程师 Mitch Fierro 提到,Claude Opus 5.5 更有效地委托子代理并以创造性方式自我检查。自我验证循环更容易设置。它在云账单中发现了以前模型遗漏的节省机会,并在代码审查中通过检查第三方集成的外部文档,捕捉到了几个提交前建模错误的 bug。
- Kiro: Agentic AI 副总裁 Deepak Singh 指出,在公开的真实命令行任务基准测试中,Claude Opus 5.5 解决的任务多于 Opus 5,但调用次数减少约 40%,token 用量减半。这意味着开发者可以使用 Kiro 获得更快、更实惠的代理会话。Opus 5.5 即将在 Kiro 中可用。
Claude Sonnet 5.5 和 Claude Haiku 5.5 预计将在接下来的几周内推出。





