OpenAI前研究员创办TypeSafe,发布非LLM模型Jev

OpenAI前研究员阿尔梅达创办的TypeSafe AI发布新型Transformer模型Jev。该模型不输出文本而是直接产生概率,被称为“校准决策”。相比传统LLM,Jev在软件自动化场景中速度提升5至18倍,成本大幅降低,可用于替代分类器或作为智能检查层防止LLM越狱。

聊天 GPT 的问世并没有让 OpenAI 研究员阿尔梅达感到满足。

作为这款聊天机器人的开发者之一,阿尔梅达看到模型能力的同时,也感到失望。他告诉 TechCrunch:「我们手握瓶子里的闪电,却不知道如何使用它。此后我一直在思考这个问题,花了很久才得出结论——问题在于我们一直围绕人类语言做优化,而我们在这个方向上已经领先了四年。」

Jev速度快5到18倍,价格低10到20倍

两年前,阿尔梅达离开 OpenAI,创办了 TypeSafe AI。本周,这家公司发布了一款名为 Jev 的新型基于 Transformer 的模型。它不是大型语言模型(LLM),不输出文本,而是直接产生概率,公司将其称为「校准决策」。

绕开语言输出带来了几个明显的优势:由于输出由用户预先定义,模型变得极其廉价且快速——输出 token 免费,输入 token 则以十亿计。

Jev 与 OpenAI 模型对相同请求的响应对比截图。图片来源:TypeSafe

开发者对该产品的反应相当热烈,热度高到公司暂时无法为用户开放 API 服务。从目前的情况看,Jev 最有价值的应用场景是软件自动化,开发者普遍认为这是一种更便宜、更强的方法。

例如,代理基础设施公司 Vercel 的软件工程师 Pranit Sharma 介绍,Vercel 此前使用 OpenAI 的 ChatGPT Luna 5.6 运行一个分类器。当用 Jev 替换 Luna 后,结果速度快了 5 到 18 倍,同时更加准确。

另一位开发者、Bryo AI CTO Nikhil Mudholkar 测试了 Jev 与 Gemini 在商业邮件分类任务上的表现。在他的测试中,Gemini 的准确率略高,但价格高出了 10 到 20 倍。对 Mudholkar 来说,更有意思的是 Jev 给出的置信度评分。

除了在某些场景中替代 LLM,新模型还可以作为「智能检查层」来增强 LLM,防止其出现不当行为。用代理监控代理的成本会迅速失控,而 Jev 能以低成本完成这项工作。已有用户部署 Jev 来追踪 LLM 代理的行为轨迹,防止越狱。

Earendil 首席技术官 Armin Ronacher 解释说:「归根结底,它把幻觉问题部分地交给了用户来处理。」用户需要设定阈值——如果模型返回的概率只有 50%,也许就可以忽略这个结果;但如果是 95%,那就可以放心使用。

他指出,模型路由是另一个潜在用途。预测某项工作负载应该交给哪个模型很有价值,但用 LLM 来做这个判断成本太高。Jev 的低成本和高速度恰好让这种实时分类成为可能。

这正是阿尔梅达的愿景所在。模型以 19 世纪经济学家威廉·斯坦利·杰文斯(William Stanley Jevons)命名,「杰文斯悖论」描述了商品成本下降如何导致其用量激增。同样的道理,智能成本的下降应该带来智能的广泛部署。

「我们相信智能软件将无处不在,并以一种涌现的、分布式的方式出现。」

有外界观察者怀疑该模型是基于开源权重 LLM 构建的。公司将 Jev 称为「系统一」模型——专注于直觉而非推理,只做正确的任务。阿尔梅达表示,Jev 的训练完全基于合成数据。

「我们很早下了注,全力投入合成数据方向,这是我人生中最成功的赌注之一,效果远超这次发布本身,在我看来甚至优于 RLHF。公司里有一半人相当于一个实验室,基本上建立起了统计学上严谨的合成数据这一整个子领域。」

不过 Ronacher 预计,竞争对手会很快出现,因为这项技术的实用价值显而易见。「我们早该想到这一点,但可能是因为 LLM 过去太便宜、太受补贴了。」

TypeSafe 计划围绕这一模式推出更多版本。当被问到公司是否算前沿实验室时,阿尔梅达回答:「前沿实验室的主要产品是恐惧,或者宗教信仰。我希望我们的主要产品是智能……我们不是那种意义上的实验室,不会把无限财富或信仰押注在一件事上。」

Topics

AI

评论 0

0/500

评论需审核后展示,请文明发言

💬
还没有评论,来说两句

相关阅读