英国 AISI 与 EvalEval 合作,推动 AI 基准测试结果公开可复现
英国人工智能安全研究所(UK AI Security Institute, AISI)宣布将采用 EvalEval Coalition 的基础设施,以公开分享其评估结果。这一举措旨在提升评估科学的透明度、可复现性与可验证性。

此次合作建立在双方此前的一项研究基础之上,该研究始于 NeurIPS 2025 期间的一场联合研讨会。AISI 的反馈对 Every Eval Ever (EEE) 架构的形成起到了关键作用。作为合作的下一阶段,双方将正式把这一共享基础设施投入实际应用。
为何可重复的评估报告至关重要?
随着人工智能部署速度的加快,评估数据已成为衡量模型和系统性能的核心证据来源。然而,目前的结果往往分散在多种格式、平台和媒体中,且缺乏足够的细节信息以支持复现。此外,重新进行评估本身成本高昂。
EvalEval 致力于通过共享报告架构“Every Eval Ever”和开放平台“Evaluation Cards”来改善这一生态。该平台将评估结果及其解读所需的信息整合到统一的结构中。
这一工作延续了 AISI 在提升评估效率(如 OptStop)、增强统计严谨性(如 HiBayES)以及在转录分析和能力激发等领域推动标准化的努力。双方正共同诊断评估报告中的缺口,并构建共享基础设施以弥补不足。
AISI 公开的具体内容
转录层面的透明度不仅关乎可复制性,对于深入分析和诊断同样重要。在新阶段的合作中,AISI 将通过评估卡提供公开报告的评估方法和结果。本次公告涵盖了其论文主要实验中的五个基准,包含经过验证的结果、背景及配置信息:
- HealthBench
- FrontierMath
- The Last Exam
- SWE-Bench Pro
- Terminal-Bench 2.0
这些结果覆盖了六种前沿模型:Claude Opus 4、Claude Opus 4.5、Claude Opus 4.6、GPT-5、GPT-5.2 和 GPT-5.4。报告还包括两项相关的网络评估结果——Cyber CTF 和 The Last Ones,采用了不同且部分重叠的模型组合。这些数据伴随 AISI 的论文《推断计算如何塑造边界 LLM 评估》(How Inference Compute Shapes Frontier LLM Evaluations),该论文研究了基准性能如何取决于推断时间计算和评估协议。
例如,The Last Exam 的表现会随评估协议和推断计算量的变化而波动。每个曲线显示了在给定 Token 数量内解决尝试任务的累积份额,使用每个任务最早观察到的成功率。当模型在每次尝试后从预言中获得正确性反馈时,随着 Token 使用的增加,它们能够解决额外的任务。
当结果与设置信息一同公开发布时,研究人员和从业者可以更仔细地审查单个研究,并在更广泛的生态系统中比较结果。在其他报告缺乏这些细节的情况下,像 AISI 这样的公告提供了经过验证的参考点,有助于在上下文中解释评估,例如帮助研究人员理解设置选择如何影响报告的性能。随着越来越多的评估者采用 EEE,这种公开比较可以支持更广泛、更可靠的元研究。
下图展示了 AISI 的 Terminal-Bench 2.0 结果与其他报道中同一模型在不同评估设置下的对比。
社区参与方式
- 模型开发者:报告经过验证的评估结果。
- 评估开发人员:使用“Every Eval Ever”模式报告基准和运行数据。
- 评估、治理和政策研究人员:通过基准或模型探索评估卡,或利用其检查整体评估报告的状态。
关于 EvalEval Coalition
EvalEval Coalition 是一个研究社区,致力于开发具有科学依据的研究成果和稳健的部署基础设施,以服务评估生态系统。其目标是提升评估科学水平,解决在记录评估适用性和实用性方面缺乏共识的问题,并扩大对科学研究和政策分析至关重要的影响领域的覆盖范围。
该联盟的旗舰项目包括 Every Eval Ever,一个共享的评估结果模式和存储库,以及 Evaluation Cards,它将基准元数据、评估运行数据和模型元数据结合到可解释的记录中。一起,它们使得更容易理解当看似相似的分数在有意义的不同条件下产生时意味着什么。
关于英国人工智能安全研究所 (AISI)
英国人工智能安全研究所是英国政府科学、创新和技术部的一个研究机构。它的使命是为政府提供对先进人工智能带来的风险的科学理解。AISI 进行研究并建立基础设施,以了解先进的人工智能能力和影响,开发和测试缓解措施,并为政策提供信息。
延伸阅读
- 推理计算如何塑造边界 LLM 评估
- HiBayES: 使用层次贝叶斯模型改进 LLM 评估
- HiBayES 相关论文
- OptStop 相关论文
- Everything About Evaluation
- Evaluation Cards





