在人工智能领域,基准测试往往被视为企业展示模型能力、从竞争对手中脱颖而出的营销工具。然而,随着技术发展,部分公司开始通过针对性训练来“刷榜”,导致传统评估体系的有效性受到质疑。
针对这一痛点,成立于 2024 年的初创公司 Vals 试图重塑 AI 基准测试的标准。该公司宣称其使命是修复当前不完美的评估系统。经过不到两年的发展,Vals 已在科技行业建立起显著的影响力。上个月,在完成一段快速增长期后,Vals 宣布获得由 Andreessen Horowitz(a16z)领投的 4000 万美元 A 轮融资。

Vals 的联合创始人 Rayan Krishnan 现年 25 岁,曾在斯坦福大学就读期间于 Palantir 实习。Krishnan 表示,创立 Vals 源于他对行业现状的观察:现有的基准测量手段已滞后于技术的快速迭代。他指出,随着一系列高能力模型迅速进入市场,且 AI 被整合至社会各个领域,传统的评估方式显得力不从心。
在旧金山福尔索姆街的一栋历史建筑内,这座曾属于工业酿酒业、如今汇聚众多初创企业的办公楼里,Krishnan 阐述了 Vals 的核心逻辑。他认为,历史上的评估多采用抽象方式衡量智力,例如考察模型是否具备通过律师资格考试所需的信息量。
Vals 试图在这一基础上进行区分。与许多提供公开测试题目的基准系统不同——这些题目可能被用于模型训练从而导致“作弊”——Vals 不公开其特定的测试材料。此外,除了衡量通用知识,Vals 还重点评估模型在法律、金融和编码等特定行业中处理复杂任务的能力。
“我们关注的是模型的实际影响,即它们能否在各个领域产出与人类同等质量的产品。”Krishnan 说道。他强调,评估目的不仅在于验证积极结果,也在于检测负面效应,分析模型在全球范围内运行可能产生的不利影响。
目前,Vals 正在拓展其评估能力的边界。除传统行业外,该公司已进入更独特的领域,包括递归自我改进、心理健康、网络安全、生物安全以及武装冲突法等基准测试项目。
关于商业模式,企业需付费让 Vals 测试其模型。尽管为了解模型弱点而付费看似矛盾,但 Krishnan 认为有效的测量有助于企业解决问题并随时间推移实现改进。他将这种收入模式类比为学生向大学董事会支付考试费用。
与此同时,这些评估正逐渐成为企业在采购新 AI 模型时的关键决策因素。据透露,Vals 近期的收入达到去年的八倍,员工规模也增长了三倍,目前共有 25 名成员。随着公司发展,计划搬迁至更大办公室并新增 10 到 15 名员工。近期,该公司还推出了一项专门面向联邦机构提供模型评估的计划。
Krishnan 认为,Vals 的基准测试系统代表了 AI 公司未来建立业务模式和公众信任的方向。“AI 公司开始上市,太空探索技术公司已上市,Anthropic 预计将于今年晚些时候上市,OpenAI 也可能很快公开。”他表示,“随着 AI 模型成为经济核心部分并得到更广泛传播,我们所做的基准和评估类型将推动其使用,并成为这些公司在提交公开文件或讨论未来 AI 投资时的核心内容。”





