一台只有32GB内存的MacBook,启动了总参数量744B的GLM-5.2。模型最终答对了“比利时首都是哪里”,代价是等两分多钟才看到第一个词,后续速度约为0.1 token/s。
最近看了Better Stack的一段实测视频,作者Andras分别用M2 Max MacBook和RTX 5090工作站运行这套模型。测试中,RTX 5090大部分时间没出多少力,内存和SSD却决定了模型能不能跑、运行时要等多久。

744B参数,怎么塞进32GB内存

 
 
 
744B模型塞进32GB MacBook,等了两分钟才说话
智谱在2026年6月发布GLM-5.2,这款开放权重模型采用MIT许可证,提供100万token上下文,沿用了744B总参数、每个token激活约40B参数的MoE架构
MoE可以理解为一间装着大量专家的办公室。每次生成token时,路由器只叫少数专家干活。GLM-5.2每个token实际调用约40B参数,约占总量的5%,这个稀疏特征给普通电脑留下了运行空间。
开发者Vincenzo Fornaro制作的Colibrì,把显存、系统内存和SSD组成分层存储。注意力、共享专家和词嵌入等稠密部分约有17B参数,Int4量化后约占9.9GB,常驻内存;大量路由专家保存在SSD里,按需读取并缓存。
744B模型塞进32GB MacBook,等了两分钟才说话
这种做法很像给模型权重搭了一套“随用随取”的仓库。Colibrì的推理核心用C语言编写,运行时不要求GPU,也不依赖Python。程序会记录经常调用的专家,后续优先放进内存;MTP多token预测头可用于推测解码,MLA则把每个token的KV状态压缩约57倍。
视频使用的Int4模型约357GB;项目目前推荐的新版容器约372GB,实际下载应给NVMe预留约400GB空间。参数不用全部装进内存,硬盘容量这一关仍然躲不过去。

MacBook跑起来了,时间花在等硬盘

 
 
 
视频中的第一套设备是M2 Max MacBook,配备32GB统一内存。由于内置SSD空间不够,作者把模型放在一块读取速度约1GB/s的三星移动SSD上,经USB连接电脑。
他输入了一个极简单的问题:“比利时的首都是哪里?”GLM-5.2给出了正确答案“布鲁塞尔”,说明744B模型确实在这台笔记本上完成了推理。第一词延迟超过两分钟,生成速度只有约0.1 token/s,体感接近每10秒吐出一个词。
744B模型塞进32GB MacBook,等了两分钟才说话
Colibrì的性能分析页面显示,这一轮耗时约158秒,其中约145秒用于等待硬盘,计算只花了约7秒。32GB内存装不下足够多的专家缓存,再叠加移动SSD吞吐较低,程序只能频繁读取权重。
744B模型塞进32GB MacBook,等了两分钟才说话
项目文档显示,稠密部分常驻后,每个冷token仍可能涉及约11GB的专家权重变化。面对1GB/s左右的外置存储,十秒生成一枚token并不意外。缓存变热后速度会改善,但32GB内存留给专家的余量有限。

换上RTX 5090,主角仍是内存和SSD存

 
 
 
第二套设备是一台配备RTX 5090、64GB内存和高速内置SSD的工作站。作者让GLM-5.2用通俗语言解释量子纠缠,模型用“魔法硬币”作类比,输出质量能够正常使用。第一词延迟缩短到约17秒,生成速度达到约0.8 token/s,较MacBook测试快了约8倍。
性能面板中,磁盘等待占比降至约48%。64GB内存可以缓存更多高频专家,内置SSD也能更快供应未命中的权重,电脑终于把更多时间花在计算上。RTX 5090负载并不高,因为内存容量和存储带宽已先形成压力。
744B模型塞进32GB MacBook,等了两分钟才说话
Colibrì官网给出的高性能配置依然颇为夸张,例如六张RTX 5090全驻留运行,或拥有1TB内存的双路至强服务器。普通电脑完成一次正确推理已经成立,想让744B模型达到日常对话速度,硬件门槛依旧很高。
这段视频让“本地运行前沿模型”有了更细的衡量尺度。启动成功证明了技术路径,首token延迟、生成速度、缓存命中率和磁盘读取量,决定它能否承担真实工作。准备尝试Colibrì时,大内存和高速大容量NVMe,可能比先升级显卡更直接。
至顶网至顶AI实验室频道