如果人工智能实验室PrismML还没有出现在你的关注列表中,那么现在该关注了——不是因为它筹集了巨额资金(目前只完成了2225万美元的种子轮融资),而是因为其背后的技术团队及其正在开发的、可能改变行业格局的技术。

PrismML押注的方向是:具备强大能力、高性能的推理型大语言模型其实不必做得很大。

该公司正在打造体积极小的推理模型,小到可以运行在个人电脑和智能手机上。(有传言称该公司正在与苹果洽谈合作,但首席执行官巴巴克·哈西比对此向TechCrunch表示不予置评。)

周四,PrismML发布了Bonsai 2 27B,这是该公司模型家族中的最新一员,它将阿里巴巴广泛使用的开源模型Qwen3.8 27B压缩至5.9GB。这一体积足以装入个人电脑,甚至可能适配高端智能手机。与原始模型相比,内存占用减少了9到10倍。

PrismML由一批加州理工学院的研究人员创立,领导者是哈西比,他是加州理工学院教授,也是压缩技术领域的专家。该初创公司的顾问团队中还包括Ion Stoica。Stoica是Databricks(及其他多家公司)的联合创始人,同时担任加州大学伯克利分校著名的Sky Computing实验室主任,该实验室已孵化出众多技术和初创公司,包括Letta和SGLang。

PrismML的投资方还包括Khosla Ventures、Cerberus Capital和加州理工学院。

这家初创公司当然不是唯一一家从事大语言模型压缩技术的公司。由西班牙圣塞巴斯蒂安国际物理中心一位知名教授创立的Multiverse Computing也在从事相关工作。(而且Multiverse Computing已经筹集了大笔资金。)

但哈西比表示,PrismML的压缩技术之所以独特,是因为其压缩后的大语言模型与原始模型相比,性能几乎没有损失。Bonsai 2的综合基准测试得分达到了Qwen模型的98%。这一数字较几个月前(今年3月)发布的第一代Bonsai模型有所提升,后者当时达到了95%的水平。据该公司透露,第一代模型已经被下载超过1100万次,而PrismML体积更小的模型也已额外获得260万次下载。

这表明PrismML的压缩效果正在一代代产品迭代中不断提升。至于是否能最终实现与原模型100%的基准性能对等,目前仍是未知数。哈西比表示,压缩过程或许总会带来一定程度的影响。

不过,完美的基准对等其实在实际应用中意义有限。大语言模型即便在未压缩的原始状态下,其准确性也并非完美无缺,而基准测试也并不能完全反映实际任务的表现,因此2%的性能下降,在实际使用中很可能不会产生明显影响。(此外,模型运行所依托的周边软件——即所谓的运行框架——对准确性的影响也同样重要。)

PrismML表示,其实现方式是通过压缩构成模型的“权重”——权重本质上是模型在训练过程中学习并存储的信息。通常情况下,每个权重需要16位来存储。而PrismML采用的方法被称为“三元”权重,将其简化为三种取值:+1、-1或0。由于每个权重需要存储的数值大幅减小,模型所占用的空间也随之大幅下降。(关于该压缩技术的更深入解析,可参见该项目的GitHub页面。)

这家初创公司的下一个目标是将这一压缩技术应用于更大规模的模型。哈西比告诉TechCrunch:“我们希望在未来几个月内发布的下一批模型,参数规模将达到数千亿级别,我预计在这一规模下保留模型的智能能力会更容易。”

他补充说,随着模型规模的增大,“在不损失智能能力的前提下进行压缩的空间也会更大。所以总体而言,对于更大规模的模型,达到100%的性能对等会更容易实现。”

Stoica表示,他对这项技术感到兴奋,因为它使得先进模型能够在用户的设备上运行。“智能将触手可及,而且是免费的,因为它将运行在你已经购买的设备上。它同时也将是私密的,因为你不需要把数据发送到云端。”

Q&A

Q1:PrismML的Bonsai 2模型是什么?

A:Bonsai 2 27B是PrismML发布的压缩大语言模型,它将阿里巴巴的开源模型Qwen3.8 27B压缩至5.9GB,体积小到可以在个人电脑甚至高端智能手机上运行,同时保留了原模型98%的综合基准测试性能。

Q2:PrismML的压缩技术是如何实现的?

A:PrismML通过压缩模型的“权重”来实现瘦身。传统方式下每个权重需要16位存储空间,而PrismML采用“三元”权重方法,将其简化为+1、-1或0三种取值,从而大幅减少模型占用的存储空间。

Q3:PrismML未来有什么发展计划?

A:PrismML计划将压缩技术应用到更大规模的模型上,预计未来几个月内发布参数规模达数千亿级别的新模型,并认为模型规模越大,在不损失智能能力的情况下进行压缩会越容易。

Techcrunch