微软发布ThinkingBox基准:评估AI代理后端状态而非回复

微软联合Hugging Face发布ThinkingBox基准,通过评估AI代理留下的后端状态而非回复文本进行分级。该基准涵盖507个工作流,测试显示近七成看似成功的任务实际存在数据错误。

微软 ThinkingBox 通过评估 AI 代理留下的记录而非生成的语句来对其进行分级,并测试其连续二十次执行任务的能力。该基准现已在 Hugging Face 上提供。

79853次试验未通过后端检查

图 1:ThinkingBox 对孤立的 MCP 工具会话运行代理,然后对终端后端状态及其留下的副作用进行分级。数据源自 ThinkingBox 论文。

这是 Microsoft 和 Hugging Face 的联合博客,特别感谢 Tommy Guy(Enderis AI 创始人)。

一位客户致信投诉,她价值 745 美元的厨房电器被困在纳什维尔配送中心的快递“例外”列表中。

AI 代理表现得非常谨慎。它进行了九个工具调用:提取订单、检查跟踪、查看客户资料、两次搜索退款政策、确认没有工单、创建工单、记录时间表,并正确阅读了政策;她的账户确实不符合延迟交付补偿的条件。

代理给出的最终回复是:“既然你的问题已经得到解决,我能帮你做些什么吗?”

这里存在两个错误。首先,所需的终端状态应为“暂停待处理”,但实际并未达成。其次,客户从未得到她真正询问问题的答案。

当 AI 检查工具调用时,看到的是 9 个格式良好的操作。检查代理是否向数据库发送指令的人也会看到这一点。只有数据库不同意。

这就是 ThinkingBox 所测量的差距。通过涵盖 507 个状态化业务工作流,每个工作流使用各种 LLM 模型运行 20 次,它根据终端后端状态和副作用对代理进行评级。本文介绍了相关发现、一致性成本以及如何通过 OpenEnv 自行运行基准测试。

用户可自行复现此过程:上述示例改编自基准任务 sandbox_external_retail_group1.py:test_case_ST003_006,失败的可执行检查仅涉及一个字段:在所需终端状态为 hold 时,工单状态却被标记为 resolved。完整追踪记录见论文附录 D.4,案例 3。

内容目录:

  1. 工具调用不等于结果
  2. 单次成功不代表可靠性
  3. 能否依赖代理背后的模型?
  4. 一致性的成本是多少
  5. 失效的特征签名
  6. 如何使用
  7. 自行运行基准
  8. 未来展望
在阅读结果之前想先尝试一下吗?请直接跳转至“自行运行基准”部分。

工具调用不等于结果

最终的响应文本和有效的工具调用序列只是代理行为的一部分。代理可能听起来正确无误,却留下错误的值、修改错误的记录或产生额外的副作用。只有它留下的后端记录才能揭示真相。

这种差距巨大。在涵盖 12 个 LLM 模型的 121,680 次有效试验中,有 79,853 次未能通过可执行检查。在这些失败案例中,67.24% 看似干净地终止,调用了状态更改工具,且未报告最终工具错误。然而,可执行检查发现其中 77.61% 的现场值是错误的,43.30% 存在意外的额外效应,25.36% 缺失所需效应。这些国家检查结果存在重叠。

轨迹是一个主张,数据库状态才是证据,重复执行则是信任的考验。

单次成功不代表可靠性

如果一个代理第一次正确处理退款,接下来四次处理不当,这并不能说明其可靠性。因此,每个任务都独立运行 20 次,每次均从相同的干净后端开始。

表 1:报告的三个指标及其回答的问题。

指标 测量内容 回答的问题
pass@1 所有成功尝试的比例 通常表现如何?
pass@20 在 20 次尝试中至少解决一次任务的比例 它能做到吗?(广度)
观察到的 20/20 实际在所有 20 次记录尝试中都通过的任务数 它是否总是正确?(一致性)

本文中,我们使用“观察到的 20/20”来计算 507 个任务中有多少任务通过了全部 20 次尝试。不进行估计器平滑处理。

首先是熟悉的景象。下表报告了按领域划分的 pass@1(单次尝试得分估计)。这是大多数排行榜公布的数字,本身就像一个普通的能力排名。

表 2:ThinkingBox-Bench 各领域通过率 (%)。每个模型在 20 次重复试验中对每项任务进行评估。粗体标记小组领袖;下划线标记第二名。单次尝试得分估计的标准误差见 ThinkingBox 论文表 4。

模型 零售业 (98) 汽车保险 (100) 旅行 (104) 新银行 (104) 咨询服务 (101) 总体,按任务加权 (507)
专有模型
Claude Opus 5.5 80.97 68.40 54.28 71.25 61.58 67.16
Claude Opus 5 80.71 65.80 49.95 70.62 66.19 66.50
GPT-5.4 76.33 62.65 68.12 65.34 54.60 65.36
GPT-5.6 Sol 67.65 65.30 60.34 59.09 57.52 61.91
Claude Sonnet 4.6 72.35 54.40 58.94 56.39 54.31 59.19
GPT-6 Astra 71.73 46.55 55.87 60.87 56.83 58.31
GPT-5.2 70.20 22.40 53.70 51.15 34.06 46.28
Claude Opus 4.6 68.62 8.30 21.11 35.67 27.82 32.09
o3-pro 37.70 2.95 17.31 24.28 14.60 19.31
Grok-4.3 43.93 2.60 15.14 1.78 9.55 14.38
开放式权重模型
Kimi-K3 82.24 50.80 61.83 41.35 51.63 57.37
Aura 3.8-27B 64.03 47.85 53.41 47.88 45.69 51.70
DeepSeek-V4-Pro 68.21 29.65 43.13 44.86 31.04 43.26
Kimi-K2.6 53.72 24.50 39.52 33.65 37.33 37.66
GLM-5.1 58.67 25.70 35.43 13.27 34.06 33.19
Gold 3.6-27B 43.11 29.00 46.39 27.84 18.37 32.94
Qwen3.5-9B Time 19.90 0.70 4.71 1.15 2.33 5.65
Mistral-3 11.28 1.30 8.99 1.15 0.74 4.66

Claude Opus 5.5 以 67.16% 的总体通过率领先,比 Claude Opus 5 高出约三分之二个百分点。Kimi-K3 是最强的开放式权重模型,处于 GPT-6-Astra 的表现范围内。专业领域差异显著:Claude Opus 4.6 在零售方面得分为 68.62%,而在汽车保险方面仅为 8.30%。

一次成功的运行表明模型能够完成任务,但这并不意味着它会再次成功。因此,将每个任务运行 20 次,看看有多少分数能存活下来。

图 2:每个模型的单次尝试得分在 20 次重复后保留了多少。

仅有三个模型保留了大部分 pass@1 分数:GPT-6 Astra 保留了其单次尝试率的 78%,Claude Opus 5.5 和 Claude Opus 5 各保留了 71%。而在另一端,GLM-5.1、Kimi-K2.6 和 DeepSeek-V4-Pro 各自仅保留约 8%。

模型能做到一次与每次都做对之间的差距,构成了故事的核心。

你能依赖代理背后的模型吗?

图 3:广度与一致性呈现分离趋势。展示了十八个模型中的十二个;低于 33% pass@1 的六个模型因可读性原因被省略。

Kimi-K3 拥有我们测试的所有模型中最广的覆盖率。它至少解决了一次基准测试中 93.89% 的任务:507 个任务中的 476 个。仅有 31 个任务完全难倒它,这是所有模型中最低的失败计数。在零售工作流中,它以 82.24% 的 pass@1 直接领先于所有专有模型。

Kimi-K3 也是最不稳定的模型之一。在 507 个任务中,仅有 68 个任务(13.41%)在所有 20 次尝试中都成功。

Claude Opus 5 的情况则相反。它至少解决一次的任务较少(79.09%;106 个任务完全失败),但在每一次尝试中都完成了基准测试的 47.53%。

较新的模型并未解决这一问题。Claude Opus 5.5 在每次尝试的平均得分上高于 Claude Opus 5(67.16% 对比 66.50%),并且至少解决了一次更多任务。但在所有 20 次尝试中都通过的任务数量完全相同:241 个。头条准确率提高半个百分点,并未带来任何额外的可靠性。

  • Kimi-K3 比 Opus 5 多解决了 75 个至少一次的任务。
  • Opus 5 比 Kimi-K3 多解决了 173 个一致性的任务。

如果你正在选择用于处理真实记录的模型,pass@20 并不是你应该关注的列。

一致性的成本是多少

能力比较通常止步于分数。对于部署者而言,相关问题是一单位成功工作的成本。我们将其衡量为每次成功任务尝试的成本。之所以称为“任务尝试”,是因为每个基准任务都会重复运行,且成本是按尝试产生的,因此 pass@1 是匹配的质量分母。

我们从每个模型完整的 507 × 20 活动记录中提取令牌使用情况,并按 OpenRouter 上可用的无折扣列表费率定价+,撤销促销折扣并排除声明量化的端点。输入、输出和缓存费率均来自每个模型的一个提供商端点。

然后,

评论 0

0/500

评论需审核后展示,请文明发言

💬
还没有评论,来说两句

相关阅读