视频中的第一套设备是M2 Max MacBook,配备32GB统一内存。由于内置SSD空间不够,作者把模型放在一块读取速度约1GB/s的三星移动SSD上,经USB连接电脑。他输入了一个极简单的问题:“比利时的首都是哪里?”GLM-5.2给出了正确答案“布鲁塞尔”,说明744B模型确实在这台笔记本上完成了推理。第一词延迟超过两分钟,生成速度只有约0.1 token/s,体感接近每10秒吐出一个词。Colibrì的性能分析页面显示,这一轮耗时约158秒,其中约145秒用于等待硬盘,计算只花了约7秒。32GB内存装不下足够多的专家缓存,再叠加移动SSD吞吐较低,程序只能频繁读取权重。项目文档显示,稠密部分常驻后,每个冷token仍可能涉及约11GB的专家权重变化。面对1GB/s左右的外置存储,十秒生成一枚token并不意外。缓存变热后速度会改善,但32GB内存留给专家的余量有限。