Prism ML公司周四宣布推出Bonsai 2 27B,这是该公司超紧凑多模态生成式AI的第二代产品,体积小到可以运行在个人电脑甚至部分高端移动设备上。

该公司表示,其采用三元法(使用三个数值单位)对基于Qwen3.8 27B的模型进行了压缩。Qwen3.8在完整16位未压缩状态下体积约为56GB,而Bonsai 2将其缩减至约5.9GB,同时保留了约98.2%的性能。

虽然通过量化等其他压缩技术也可以缩小AI模型体积,但这些方法通常会削弱准确性、知识储备及其他系统性能力。Qwen3.8的最小内存占用为9.4GB。

三元法在压缩构成模型的"权重"(即参数)时提供了一种有趣的方案。权重是模型内部的数值调节器,控制着模型如何处理信息并生成输出。在全尺寸模型中,权重通常用16位表示;而PrismML的方法将其简化为三元制,即三位数值,分别用+1、0和-1表示。这使得公司能够以更小的内存占用存储信息,同时仍保持相当高的智能水平。

从本质上讲,这让Bonsai 2能够以极小的体积实现远超其规模的性能表现。

在基准测试中,Bonsai 2在智能体和工具调用方面表现与Qwen3.8接近,分差不超过三分,分别为77.6分和79.8分;在编程方面(涵盖HumanEval+、LiveCodeBench v6、MBPP+和BigCodeBench)的综合得分分别为81.6分和82.2分;在知识与推理方面(涵盖MMLU-Redux、GPQA Diamond和AA-LCR)的得分分别为82.7分和81.3分。

该模型可在英伟达GeForce GTX 5090显卡上运行且无需量化,处理速度达到每秒143个Token;在苹果公司的M5 Max芯片上则达到每秒46.8个Token。该公司表示,模型每Token的功耗极低,仅为0.714兆瓦时,相比其他以全精度(即未压缩状态)运行的8B模型,能效提升了40%。

超小型模型使用户能够在自己的设备上本地运行AI,而无需将推理任务发送至云端。每当数据通过互联网传输时,接收响应可能会产生延迟,敏感信息也可能被发送给第三方。将智能能力引入本地设备可以消除第三方数据共享,使提示词和响应内容保留在本地,有助于满足严格的隐私法规要求,并能提升安全性。

例如,简单的翻译、摘要和搜索整理任务可以在设备端运行,而长周期任务理解和研究工作可能需要发送给成本更高的云端模型。对于日常用户乃至企业用例而言,在任务简单且涉及敏感信息时运行成本更低、注重隐私保护的本地模型,同时在处理复杂、深度交互、目标导向型工作时扩展至高智能云端模型,这种模式颇具价值。

这款新模型可通过CUDA在英伟达图形处理器上运行,也可通过MLX在苹果设备(包括Mac、iPhone和iPad)上通过低位内核运行。模型权重已于今日起以Apache 2.0许可协议对外开放。

Q&A

Q1:Bonsai 2 27B是什么?

A:Bonsai 2 27B是Prism ML公司发布的第二代超紧凑多模态生成式AI模型,基于Qwen3.8 27B模型压缩而成,体积小到可以运行在个人电脑和部分高端移动设备上。

Q2:Bonsai 2是如何做到体积小还能保持高性能的?

A:该公司采用三元法压缩模型权重,将原本16位表示的参数简化为三元制(+1、0、-1)表示,使模型体积从56GB大幅缩减至5.9GB,同时保留约98.2%的原始性能。

Q3:Bonsai 2可以在哪些设备上运行?

A:该模型可通过CUDA在英伟达图形处理器(如GeForce GTX 5090)上运行,也可通过MLX在苹果设备(包括Mac、iPhone和iPad)上运行,模型权重已以Apache 2.0许可协议开放获取。

SiliconANGLE