2026 年 9 月 17 日,PrismML 发布了 Ternary Bonsai 2 27B。两个月前,该公司推出的初代 Bonsai 27B 证明了 27B 级别模型可以压缩到在本地设备上有效运行的程度;此次的二代版本在其基础上进一步提升了推理、编码、视觉与智能体能力,同时维持了该系列的核心部署特性:更小的内存占用、更高的本地吞吐量和更好的能效。
Ternary Bonsai 2 27B 基于 Qwen3.8 27B 构建。模型采用三元 {-1, 0, +1} 权重配合 FP16 分组缩放,每权重有效位数为 1.76 bit,总模型体积仅 5.9GB。低位表示方式端到端覆盖整个语言模型,支持 262K token 的上下文窗口,可处理文本与图像多模态输入,以 Apache 2.0 许可证发布。

与全精度版本相比,该模型体积缩小 9 倍以上,整体基准性能保留了 98.2%。
相比初代 Bonsai 27B 的变化
初代 Bonsai 27B 验证了在本地设备运行 27B 级模型的可行性,而 Bonsai 2 27B 的重点转向模型质量与运行表现,具体改进包括:
- 更强的基座模型:Qwen3.8 27B
- 与全精度模型相比,整体能力保留率提升至 98.2%(前代为 95%)
- 推理、编码、视觉与长程任务行为的改善
同一部署规格下的更高能力
在覆盖推理、数学、编码、指令遵循、视觉与工具使用的综合基准套件中,Ternary Bonsai 2 27B(思维模式)总分为 83.9,达到 Qwen3.8 27B 总分 85.4 的 98.2%。
| 能力 | Ternary Bonsai 2 27B | Qwen3.8 27B | Qwen3.6 27B |
|---|---|---|---|
| 智能体与工具调用(τ2-bench、BFCLv3) | 77.57 | 79.74 | 80.05 |
| 编码(HumanEval+、LiveCodeBench v6、MBPP+、BigCodeBench) | 81.58 | 82.17 | 82.57 |
| 指令遵循(IFBench、IFEval) | 82.66 | 81.25 | 74.53 |
| 知识与推理(MMLU-Redux、GPQA Diamond、AA-LCR) | 83.95 | 86.66 | 84.71 |
| 数学(AIME 2026、AIME 2025、GSM8K、MATH-500) | 96.57 | 97.06 | 94.64 |
| 视觉(CharXiv、A-OKVQA、OmniDocBench v1.6、RealWorldQA、OCRBench v2) | 78.59 | 81.64 | 79.82 |
| 总分 | 83.9 | 85.4 | 83.6 |
图一:Ternary Bonsai 2 27B(思维模式)与全精度 Qwen3.8 27B、Qwen3.6 27B 基线的基准分数对比。各基准的完整结果见技术白皮书。
值得注意的是模型的能力保持幅度。编码智能体、工具使用系统、多模态工作流和长程任务对模型退化尤为敏感——微小错误会在多步执行中累积。Bonsai 2 27B 在上述领域保留了全精度模型的大部分性能,而内存占用仅为后者的一小部分。
对比全精度模型及其他低位替代方案,Bonsai 2 27B 在单位体积智能密度上处于领先位置。不少低位方案只能通过牺牲编码、视觉或智能体工具使用能力才能达到可部署的体积,而 Bonsai 2 27B 在降低内存占用的同时维持了更高的综合性能。
在应用层面,Bonsai 2 27B 使本地模型可以承担实际的知识型工作:编码智能体循环、计算机操作工作流、私人文档分析、多模态调试,以及本地模型处理敏感或高频任务、按需升级至云端的混合编排架构。
吞吐量与能效
硬件实测数据方面,Ternary Bonsai 2 27B 在 NVIDIA GeForce RTX 5090 上最高可达 143 token/s,在 M5 Max 上达到 46.8 token/s。在 RTX 4090 上,模型每 token 能耗为 0.714 mWh,比全精度运行的 8B 模型能效高出 40%。
对编码助手而言,更高吞吐量意味着更快的编辑—调试循环;对多模态智能体而言,意味着在截图、文档和工具调用上更快的生成速度;对私有本地工作流而言,更高的能效意味着同一设备上更多的可用推理、更长的电池续航,以及在后台常驻、减少云端调用的现实路径。
此次发布的意义
从初代 Bonsai 27B 到此次版本,对全精度模型的性能保留率从 95% 提升至 98% 以上,使当前版本的压缩损失已接近可忽略的水平。这一进展强化了这样一个判断:低位模型可能是部署 AI 的最优方式之一。
其影响也不限于本地推理。低位模型可能改变设备、工作站与数据中心 AI 系统的成本结构与架构设计:在相同内存中装载更大的模型、在同一硬件上服务更多用户、降低每次推理的能耗,并使混合系统能够动态决定哪些任务在本地运行、哪些任务交给云端。
随着能力评测的重心逐渐转向「在既定的内存、算力与功耗预算内能提供多少有效智能」,如果能力扩展的同时资源需求持续下降,未来模型的部署范围将从个人设备延伸至大规模数据中心。
平台支持
Bonsai 2 27B 通过 CUDA 支持 NVIDIA GPU,通过 MLX 支持 Apple 设备(Mac、iPhone、iPad),并提供自定义低位内核。模型权重已按 Apache 2.0 许可证开放下载。其压缩、评估与对比方法的完整技术细节见随附技术白皮书。





