微软 ThinkingBox 通过评估 AI 代理留下的记录而非生成的语句来对其进行分级,并测试其连续二十次执行任务的能力。该基准现已在 Hugging Face 上提供。

图 1:ThinkingBox 对孤立的 MCP 工具会话运行代理,然后对终端后端状态及其留下的副作用进行分级。数据源自 ThinkingBox 论文。
这是 Microsoft 和 Hugging Face 的联合博客,特别感谢 Tommy Guy(Enderis AI 创始人)。
一位客户致信投诉,她价值 745 美元的厨房电器被困在纳什维尔配送中心的快递“例外”列表中。
AI 代理表现得非常谨慎。它进行了九个工具调用:提取订单、检查跟踪、查看客户资料、两次搜索退款政策、确认没有工单、创建工单、记录时间表,并正确阅读了政策;她的账户确实不符合延迟交付补偿的条件。
代理给出的最终回复是:“既然你的问题已经得到解决,我能帮你做些什么吗?”
这里存在两个错误。首先,所需的终端状态应为“暂停待处理”,但实际并未达成。其次,客户从未得到她真正询问问题的答案。
当 AI 检查工具调用时,看到的是 9 个格式良好的操作。检查代理是否向数据库发送指令的人也会看到这一点。只有数据库不同意。
这就是 ThinkingBox 所测量的差距。通过涵盖 507 个状态化业务工作流,每个工作流使用各种 LLM 模型运行 20 次,它根据终端后端状态和副作用对代理进行评级。本文介绍了相关发现、一致性成本以及如何通过 OpenEnv 自行运行基准测试。
用户可自行复现此过程:上述示例改编自基准任务 sandbox_external_retail_group1.py:test_case_ST003_006,失败的可执行检查仅涉及一个字段:在所需终端状态为 hold 时,工单状态却被标记为 resolved。完整追踪记录见论文附录 D.4,案例 3。
内容目录:
- 工具调用不等于结果
- 单次成功不代表可靠性
- 能否依赖代理背后的模型?
- 一致性的成本是多少
- 失效的特征签名
- 如何使用
- 自行运行基准
- 未来展望
在阅读结果之前想先尝试一下吗?请直接跳转至“自行运行基准”部分。
工具调用不等于结果
最终的响应文本和有效的工具调用序列只是代理行为的一部分。代理可能听起来正确无误,却留下错误的值、修改错误的记录或产生额外的副作用。只有它留下的后端记录才能揭示真相。
这种差距巨大。在涵盖 12 个 LLM 模型的 121,680 次有效试验中,有 79,853 次未能通过可执行检查。在这些失败案例中,67.24% 看似干净地终止,调用了状态更改工具,且未报告最终工具错误。然而,可执行检查发现其中 77.61% 的现场值是错误的,43.30% 存在意外的额外效应,25.36% 缺失所需效应。这些国家检查结果存在重叠。
轨迹是一个主张,数据库状态才是证据,重复执行则是信任的考验。
单次成功不代表可靠性
如果一个代理第一次正确处理退款,接下来四次处理不当,这并不能说明其可靠性。因此,每个任务都独立运行 20 次,每次均从相同的干净后端开始。
表 1:报告的三个指标及其回答的问题。
| 指标 | 测量内容 | 回答的问题 |
|---|---|---|
| pass@1 | 所有成功尝试的比例 | 通常表现如何? |
| pass@20 | 在 20 次尝试中至少解决一次任务的比例 | 它能做到吗?(广度) |
| 观察到的 20/20 | 实际在所有 20 次记录尝试中都通过的任务数 | 它是否总是正确?(一致性) |
本文中,我们使用“观察到的 20/20”来计算 507 个任务中有多少任务通过了全部 20 次尝试。不进行估计器平滑处理。
首先是熟悉的景象。下表报告了按领域划分的 pass@1(单次尝试得分估计)。这是大多数排行榜公布的数字,本身就像一个普通的能力排名。
表 2:ThinkingBox-Bench 各领域通过率 (%)。每个模型在 20 次重复试验中对每项任务进行评估。粗体标记小组领袖;下划线标记第二名。单次尝试得分估计的标准误差见 ThinkingBox 论文表 4。
| 模型 | 零售业 (98) | 汽车保险 (100) | 旅行 (104) | 新银行 (104) | 咨询服务 (101) | 总体,按任务加权 (507) |
|---|---|---|---|---|---|---|
| 专有模型 | ||||||
| Claude Opus 5.5 | 80.97 | 68.40 | 54.28 | 71.25 | 61.58 | 67.16 |
| Claude Opus 5 | 80.71 | 65.80 | 49.95 | 70.62 | 66.19 | 66.50 |
| GPT-5.4 | 76.33 | 62.65 | 68.12 | 65.34 | 54.60 | 65.36 |
| GPT-5.6 Sol | 67.65 | 65.30 | 60.34 | 59.09 | 57.52 | 61.91 |
| Claude Sonnet 4.6 | 72.35 | 54.40 | 58.94 | 56.39 | 54.31 | 59.19 |
| GPT-6 Astra | 71.73 | 46.55 | 55.87 | 60.87 | 56.83 | 58.31 |
| GPT-5.2 | 70.20 | 22.40 | 53.70 | 51.15 | 34.06 | 46.28 |
| Claude Opus 4.6 | 68.62 | 8.30 | 21.11 | 35.67 | 27.82 | 32.09 |
| o3-pro | 37.70 | 2.95 | 17.31 | 24.28 | 14.60 | 19.31 |
| Grok-4.3 | 43.93 | 2.60 | 15.14 | 1.78 | 9.55 | 14.38 |
| 开放式权重模型 | ||||||
| Kimi-K3 | 82.24 | 50.80 | 61.83 | 41.35 | 51.63 | 57.37 |
| Aura 3.8-27B | 64.03 | 47.85 | 53.41 | 47.88 | 45.69 | 51.70 |
| DeepSeek-V4-Pro | 68.21 | 29.65 | 43.13 | 44.86 | 31.04 | 43.26 |
| Kimi-K2.6 | 53.72 | 24.50 | 39.52 | 33.65 | 37.33 | 37.66 |
| GLM-5.1 | 58.67 | 25.70 | 35.43 | 13.27 | 34.06 | 33.19 |
| Gold 3.6-27B | 43.11 | 29.00 | 46.39 | 27.84 | 18.37 | 32.94 |
| Qwen3.5-9B Time | 19.90 | 0.70 | 4.71 | 1.15 | 2.33 | 5.65 |
| Mistral-3 | 11.28 | 1.30 | 8.99 | 1.15 | 0.74 | 4.66 |
Claude Opus 5.5 以 67.16% 的总体通过率领先,比 Claude Opus 5 高出约三分之二个百分点。Kimi-K3 是最强的开放式权重模型,处于 GPT-6-Astra 的表现范围内。专业领域差异显著:Claude Opus 4.6 在零售方面得分为 68.62%,而在汽车保险方面仅为 8.30%。
一次成功的运行表明模型能够完成任务,但这并不意味着它会再次成功。因此,将每个任务运行 20 次,看看有多少分数能存活下来。
图 2:每个模型的单次尝试得分在 20 次重复后保留了多少。
仅有三个模型保留了大部分 pass@1 分数:GPT-6 Astra 保留了其单次尝试率的 78%,Claude Opus 5.5 和 Claude Opus 5 各保留了 71%。而在另一端,GLM-5.1、Kimi-K2.6 和 DeepSeek-V4-Pro 各自仅保留约 8%。
模型能做到一次与每次都做对之间的差距,构成了故事的核心。
你能依赖代理背后的模型吗?
图 3:广度与一致性呈现分离趋势。展示了十八个模型中的十二个;低于 33% pass@1 的六个模型因可读性原因被省略。
Kimi-K3 拥有我们测试的所有模型中最广的覆盖率。它至少解决了一次基准测试中 93.89% 的任务:507 个任务中的 476 个。仅有 31 个任务完全难倒它,这是所有模型中最低的失败计数。在零售工作流中,它以 82.24% 的 pass@1 直接领先于所有专有模型。
Kimi-K3 也是最不稳定的模型之一。在 507 个任务中,仅有 68 个任务(13.41%)在所有 20 次尝试中都成功。
Claude Opus 5 的情况则相反。它至少解决一次的任务较少(79.09%;106 个任务完全失败),但在每一次尝试中都完成了基准测试的 47.53%。
较新的模型并未解决这一问题。Claude Opus 5.5 在每次尝试的平均得分上高于 Claude Opus 5(67.16% 对比 66.50%),并且至少解决了一次更多任务。但在所有 20 次尝试中都通过的任务数量完全相同:241 个。头条准确率提高半个百分点,并未带来任何额外的可靠性。
- Kimi-K3 比 Opus 5 多解决了 75 个至少一次的任务。
- Opus 5 比 Kimi-K3 多解决了 173 个一致性的任务。
如果你正在选择用于处理真实记录的模型,pass@20 并不是你应该关注的列。
一致性的成本是多少
能力比较通常止步于分数。对于部署者而言,相关问题是一单位成功工作的成本。我们将其衡量为每次成功任务尝试的成本。之所以称为“任务尝试”,是因为每个基准任务都会重复运行,且成本是按尝试产生的,因此 pass@1 是匹配的质量分母。
我们从每个模型完整的 507 × 20 活动记录中提取令牌使用情况,并按 OpenRouter 上可用的无折扣列表费率定价+,撤销促销折扣并排除声明量化的端点。输入、输出和缓存费率均来自每个模型的一个提供商端点。
然后,





