AWS开源智能体框架Strands,Token消耗降28%

AWS开源智能体框架Strands,主打通用场景。该框架通过默认截断长结果及自动压缩上下文等机制,在基准测试中较直接使用模型减少28%的Token消耗,且准确率持平主流编码助手。

AWS 推出开源智能体框架 Strands,宣称 Token 消耗降低约四分之一

亚马逊云科技(AWS)近日正式进军开源智能体 AI 领域,发布了名为 Strands 的新框架。该框架基于 AWS 的 Strands Harness SDK 构建,旨在提供开箱即用的开发体验,支持本地运行或配合客户选择的任意 AI 提供商进行部署。

Token消耗降低28%

AWS 在公告中指出,开发者在构建自定义智能体时往往面临底层组件连接复杂的挑战,而 Strands 的设计初衷正是为了解决这一痛点。通过该框架,用户仅需一行 Python 或 TypeScript 代码即可将智能体与所选模型对接,实现了相对即插即用的集成方式。

基准测试表现:效率提升显著

在性能方面,AWS 声称 Strands 框架在使用 Harbor 框架进行测试(测试节点分布于 AWS EC2 虚拟服务器)时,取得了与 Claude Code、Codex 及其他流行框架几乎持平的基准分数。数据显示,相较于直接使用 Claude 或 GPT 模型,Strands 在六项基准测试中消耗的 token 减少了 28%,且在部分场景下准确率甚至高于其他框架。

尽管 AWS 承认 DeepSeek 的框架在 token 效率上更高,但其指出 DeepSeek 在相同测试中的准确率相对较低。Strands 的性能优势主要归功于其默认的 prompt 缓存和上下文管理机制:

  • 默认截断超过 1,500 个 token 的工具结果;
  • 当上下文窗口使用率超过 85% 时自动压缩;
  • 在上下文溢出情况下自动尝试恢复。

定位通用智能体而非编码助手

值得注意的是,AWS 明确将 Strands 定位为“通用智能体”而非专门的“编码智能体”。然而,此次基准测试中的对比对象(包括 Claude Code、Codex、oh-my-pi、OpenCode 和 DeepSeek Harness)均被归类为编码智能体。因此,Strands 与其他通用型 AI 智能体的实际性能对比仍有待观察。亚马逊计划后续发表由研究人员撰写的论文,以披露更多基准测试细节及评估方法。

目前,Strands 框架已正式上线,提供 Python 和 TypeScript 库形式,并配有命令行界面(CLI)。该框架附带技能文件,便于接入用户偏好的工具,发布时已内置 shell、文件和 web 工具支持。AWS 表示,希望借助功能齐全的框架加速原型开发,从而创造出更具实用价值的智能体。作为另一个开源选项,Strands 现已可供试用,但尚缺乏独立的第三方性能评估。

评论 0

0/500

评论需审核后展示,请文明发言

💬
还没有评论,来说两句

相关阅读