PrismML 是一家并不高调的人工智能实验室——其种子轮融资额仅为 2225 万美元。但这家由加州理工学院研究人员创立的公司认为,能力更强、性能更高、更理性的大型语言模型,未必需要更大的体积。
该公司正在将推理模型压缩到足以在 PC 和智能手机上本地运行的程度。本周四,PrismML 发布了其最新一代模型 Bonsai 2 27B,该模型基于阿里巴巴广泛使用的开源模型 Qwen3.8 27B 压缩而成,体积降至 5.9 GB,比原始模型减少了 9 到 10 倍的内存占用,足以安装在一台 PC 上,甚至有望装入高端智能手机。

PrismML 由加州理工学院教授、压缩技术专家巴巴克·哈西比(Babak Hassibi)领导。公司还聘请了 Ion Stoica 担任顾问——他是 Databricks 等多家公司的联合创始人,也是伯克利著名的 Sky Computing Lab 的负责人,该实验室孕育了 Letta、SGLang 等一批技术和初创公司。PrismML 的投资方包括 Khosla Ventures、Cerberus Capital 和 Caltech。
在大型语言模型压缩领域,PrismML 并非唯一玩家。另一家从事类似工作的是多元宇宙计算(Multiverse Computing),由来自西班牙 Donostia 国际物理中心的知名教授创立,且已筹集了可观资金。不过哈西比表示,PrismML 的压缩技术具有独特性。
从数据来看,Bonsai 2 与 Qwen 原始模型的总体基准匹配率达到 98%,高于今年 3 月发布的第一代 Bonsai 的 95%。该公司表示,其原始模型下载量已超过 1100 万次,而 PrismML 的压缩版模型下载量达到 2600 万次。这一趋势表明其压缩效果正在逐代改善,但能否实现 100% 的基准性能持平仍是未知数,哈西比也承认压缩总会带来一定影响。
不过,完美的基准持平本身带有相当的学术色彩。未压缩的大模型在实际使用中同样存在不准确性,而基准测试并不能完全反映真实任务场景,因此 2% 的性能折损是否会对实际体验产生实质影响,仍有待观察。
PrismML 实现压缩的方式,是将构成模型的"权重"——即模型在训练过程中学习和存储的信息——从通常需要的 16 位缩减至仅三个取值:+1、-1 或 0。这项技术被称为"外部权重"(Extropic Weights),每个权重占用的存储空间大幅减少,从而使模型的整体体积显著下降。
该公司的下一步目标是将压缩技术应用于更大的模型。哈西比表示:"我们将在未来几个月内发布的下一个模型,参数规模将达到数十亿量级。"他补充说,随着模型体积增大,在不损失智能的前提下进行压缩的空间反而更大。"从总体趋势来看,模型越大,越有可能达到 100% 的匹配度。"
这家初创公司的愿景是让先进模型能够直接在用户设备上运行——因为运行在用户已购买的设备上,所以免费,也无需将数据发送至云端。





