人工智能模型众包排名平台 Arena 宣布完成 2 亿美元 B 轮融资,估值达到 31 亿美元。本轮融资由 Lightspeed Venture Partners 和 Khosla Ventures 领投,Salesforce Ventures、01 Advisors、Dell Technologies Capital、Endeavor Catalyst、a16z 及 Felicis 等机构参与跟投。

Arena 起源于 2023 年加州大学伯克利分校的一个研究项目。今年 1 月,该公司曾获得 1.5 亿美元的 A 轮融资,当时估值为 17 亿美元,年收入约为 3000 万美元。而在 6 月份,Arena 披露其年化运行率收入已突破 1 亿美元。这意味着在短短 10 个月内,该公司的估值几乎翻了一番。
作为一个面向消费者的免费众包平台,Arena 允许用户输入提示词或编码需求,并对不同人工智能模型的输出结果进行评价。据公司称,该平台每月拥有数以千万计的访客。
去年 9 月,Arena 推出了名为 AI Evaluations 的商业产品,旨在为模型实验室和企业提供基于社区反馈的详细绩效分析。这一举措恰逢其时:随着人工智能实验室逐渐意识到标准化基准测试可能被模型“应试”所操纵,企业也急需一种手段来评估哪种模型最适合其内部特定需求,而非仅仅依赖静态基准。
公司在融资公告中指出:“人工智能的发展速度超过了我们评估它的能力。当模型意识到自己正在被测试时,静态基准就会失效。世界需要一个中立的第三方,来衡量人工智能在落入真实用户手中时的安全性和一致性。”
为此,Arena 在其排行榜中新增了“对齐”类别,重点评估模型在未经授权行动(采取未被要求的行为)、错误归因(将陈述或事实归因于错误来源)以及“欺骗性完成”(谎称完成了未实际执行的任务)等方面的表现。
目前,OpenAI 的模型位居初步排行榜首位,Claude Opus 5.5 和 Claude Fable 分别位列第六和第九名。





