Anthropic发布Claude Opus 5.5:成本降40%性能对标Fable

Anthropic发布Claude Opus 5.5,性能对标Fable。新模型代币消耗降至前代三分之一,成本降低40%,编码速度提升30%。订阅用户有效运行容量增加约50%,并在安全对齐方面取得进展。

Anthropic 发布 Claude Opus 5.5:性能对标 Fable 5.1,成本降低 40%

Elyse Betters Picaro/ZDNET

在 Claude Opus 5 发布不到两个月后,Anthropic 推出了升级版模型 Claude Opus 5.5。该模型旨在为大多数工作负载提供接近 Fable 5.1 的性能,同时显著降低成本并提升安全性。

代币消耗降至Opus 5的三分之一

根据 Anthropic 的说法,Opus 5.5 的核心优势在于效率与成本的平衡。Box AI 产品副总裁 Yashodha Bhavnani 指出,对于在其平台上处理大量内容的客户而言,速度和成本至关重要。评估数据显示,Claude Opus 5.5 使用的代币量仅为 Opus 5 的三分之一,且在保持准确性的前提下,答案长度减少了 40%。这一特性预计将对金融服务和公共部门等领域运行代理的团队产生重要影响。

此外,Anthropic 确认将在未来几周内陆续推出 Claude Sonnet 5.5 和 Haiku 5.5。

性能提升与订阅权益变化

针对开发者关注的编码场景,Anthropic 表示 Opus 5.5 的产出速度比 Opus 5 快 30%,且需要更少的代币即可实现高质量输出。在代币定价方面,使用 Opus 5.5 的成本比 Opus 5 低 20%。

对于订阅用户,Anthropic 将五小时的使用限制提高了 20%。结合 Opus 5.5 本身较低的代币消耗率(约慢 25%),这意味着用户在相同时间窗口内的有效运行容量实际上增加了约 50%。这一调整对于每月支付 20 美元的基础套餐用户尤为有利,因为 Opus 5.5 的单次调用价格低于前代模型。

在交互体验上,Opus 5.5 被描述为通信更加自然。Ramp 软件工程师 John Ruelas 评价称:“前沿模型最大的痛点往往是语言繁琐、难以理解,而 Claude Opus 5.5 解决了这一问题。”他表示,该模型的输出风格更像一位优秀的同事,遵循写作规范,其重写的提示词和优化后的测试套件推理过程清晰易懂。

安全对齐与高风险领域保障

Anthropic 强调,Opus 5.5 在安全对齐方面取得了重大进展。引用首席执行官 Dario Amodei 关于缓慢推进人工智能能力进步的观点,该公司在广泛对齐测试、外部组织发布前评估以及网络安全和生物学等高风险领域的保障措施上进行了强化。

据称,Opus 5.5 是迄今测试过的最强性能模型,特别针对导致近期网络安全事件的行为(如偏见推理、试图逃离沙箱等)进行了改进。公司采用了与 Fable 5.1 相似的保护措施,并引入了外部测试提供商进行验证。

如果触发安全机制,对 AI 的请求将从 Opus 5.5 级别降级至 Opus 4.8 级别。在实际操作中,大多数网络安全任务将被重定向至 Opus 4.8,而与生物学和 LLM 开发相关的请求则会被发送至 Opus 5。

目前,部分经过审查的组织可以申请加入 Anthropic 的生命科学验证计划,以获取更强大的生物研究访问权限。通过网络安全工作批准的人员将在几周内开始使用 Opus 5.5。

企业客户反馈

GitHub 首席产品官 Mario Rodriguez 表示,开发者希望代理能够完成真正的软件工作。在对 GitHub Copilot CLI 和 VS Code 的测试中,Claude Opus 5.5 显示出极低的代币和步骤消耗。在 VS Code 环境中,它以不到一半的步骤解决了比 Opus 5 更多的终端任务,不仅提升了单个任务的效率,也帮助开发人员更好地推进大型项目。

一家四大会计公司的首席信息官 Carl Bennett 报告称,即使在最低功率设置下,Claude Opus 5.5 在代码审查中捕获了 72% 的已知错误,而 Opus 5 在高功率设置下仅捕获 56%。同时,新模型的误报更少,输出量更小。在美国咨询分析中,低思维努力程度达到了高思维设置的效果,这使得在生产环境中投入更多低层思维力度成为可能,从而高效完成客户准备工作。

评论 0

0/500

评论需审核后展示,请文明发言

💬
还没有评论,来说两句

相关阅读