PrismML发布Ternary Bonsai 2:5.9GB本地运行27B模型

PrismML推出基于Qwen3.8的Ternary Bonsai 2 27B,采用三元量化技术将模型压缩至5.9GB。该模型保留全精度98.2%性能,支持多模态与长上下文,在RTX 5090上可达143 token/s,显著降低本地部署门槛。

2026 年 9 月 17 日,PrismML 发布了 Ternary Bonsai 2 27B。两个月前,该公司推出的初代 Bonsai 27B 证明了 27B 级别模型可以压缩到在本地设备上有效运行的程度;此次的二代版本在其基础上进一步提升了推理、编码、视觉与智能体能力,同时维持了该系列的核心部署特性:更小的内存占用、更高的本地吞吐量和更好的能效。

Ternary Bonsai 2 27B 基于 Qwen3.8 27B 构建。模型采用三元 {-1, 0, +1} 权重配合 FP16 分组缩放,每权重有效位数为 1.76 bit,总模型体积仅 5.9GB。低位表示方式端到端覆盖整个语言模型,支持 262K token 的上下文窗口,可处理文本与图像多模态输入,以 Apache 2.0 许可证发布。

模型体积仅5.9GB,性能保留率达98.2%

与全精度版本相比,该模型体积缩小 9 倍以上,整体基准性能保留了 98.2%。

相比初代 Bonsai 27B 的变化

初代 Bonsai 27B 验证了在本地设备运行 27B 级模型的可行性,而 Bonsai 2 27B 的重点转向模型质量与运行表现,具体改进包括:

  • 更强的基座模型:Qwen3.8 27B
  • 与全精度模型相比,整体能力保留率提升至 98.2%(前代为 95%)
  • 推理、编码、视觉与长程任务行为的改善

同一部署规格下的更高能力

在覆盖推理、数学、编码、指令遵循、视觉与工具使用的综合基准套件中,Ternary Bonsai 2 27B(思维模式)总分为 83.9,达到 Qwen3.8 27B 总分 85.4 的 98.2%。

能力 Ternary Bonsai 2 27B Qwen3.8 27B Qwen3.6 27B
智能体与工具调用(τ2-bench、BFCLv3) 77.57 79.74 80.05
编码(HumanEval+、LiveCodeBench v6、MBPP+、BigCodeBench) 81.58 82.17 82.57
指令遵循(IFBench、IFEval) 82.66 81.25 74.53
知识与推理(MMLU-Redux、GPQA Diamond、AA-LCR) 83.95 86.66 84.71
数学(AIME 2026、AIME 2025、GSM8K、MATH-500) 96.57 97.06 94.64
视觉(CharXiv、A-OKVQA、OmniDocBench v1.6、RealWorldQA、OCRBench v2) 78.59 81.64 79.82
总分 83.9 85.4 83.6
图一:Ternary Bonsai 2 27B(思维模式)与全精度 Qwen3.8 27B、Qwen3.6 27B 基线的基准分数对比。各基准的完整结果见技术白皮书。

值得注意的是模型的能力保持幅度。编码智能体、工具使用系统、多模态工作流和长程任务对模型退化尤为敏感——微小错误会在多步执行中累积。Bonsai 2 27B 在上述领域保留了全精度模型的大部分性能,而内存占用仅为后者的一小部分。

对比全精度模型及其他低位替代方案,Bonsai 2 27B 在单位体积智能密度上处于领先位置。不少低位方案只能通过牺牲编码、视觉或智能体工具使用能力才能达到可部署的体积,而 Bonsai 2 27B 在降低内存占用的同时维持了更高的综合性能。

图二:与同参数级别的其他模型相比,Ternary Bonsai 2 27B 的智能密度(每 GB)。

在应用层面,Bonsai 2 27B 使本地模型可以承担实际的知识型工作:编码智能体循环、计算机操作工作流、私人文档分析、多模态调试,以及本地模型处理敏感或高频任务、按需升级至云端的混合编排架构。

吞吐量与能效

硬件实测数据方面,Ternary Bonsai 2 27B 在 NVIDIA GeForce RTX 5090 上最高可达 143 token/s,在 M5 Max 上达到 46.8 token/s。在 RTX 4090 上,模型每 token 能耗为 0.714 mWh,比全精度运行的 8B 模型能效高出 40%。

对编码助手而言,更高吞吐量意味着更快的编辑—调试循环;对多模态智能体而言,意味着在截图、文档和工具调用上更快的生成速度;对私有本地工作流而言,更高的能效意味着同一设备上更多的可用推理、更长的电池续航,以及在后台常驻、减少云端调用的现实路径。

此次发布的意义

从初代 Bonsai 27B 到此次版本,对全精度模型的性能保留率从 95% 提升至 98% 以上,使当前版本的压缩损失已接近可忽略的水平。这一进展强化了这样一个判断:低位模型可能是部署 AI 的最优方式之一。

其影响也不限于本地推理。低位模型可能改变设备、工作站与数据中心 AI 系统的成本结构与架构设计:在相同内存中装载更大的模型、在同一硬件上服务更多用户、降低每次推理的能耗,并使混合系统能够动态决定哪些任务在本地运行、哪些任务交给云端。

随着能力评测的重心逐渐转向「在既定的内存、算力与功耗预算内能提供多少有效智能」,如果能力扩展的同时资源需求持续下降,未来模型的部署范围将从个人设备延伸至大规模数据中心。

平台支持

Bonsai 2 27B 通过 CUDA 支持 NVIDIA GPU,通过 MLX 支持 Apple 设备(Mac、iPhone、iPad),并提供自定义低位内核。模型权重已按 Apache 2.0 许可证开放下载。其压缩、评估与对比方法的完整技术细节见随附技术白皮书。

评论 0

0/500

评论需审核后展示,请文明发言

💬
还没有评论,来说两句

相关阅读