五年前,博主mamonas.dev用一台16GB内存的M1 Pro测试了几个能塞进消费级笔记本的本地小模型,结论是能跑,但和云端前沿模型的差距相当明显。GitButler联合创始人Scott Chacon想知道,五年过去,硬件和模型都换了好几代,这个差距缩小了多少——于是他用一台128GB内存的M5 Max MacBook Pro,把同样的测试思路又跑了一遍,这次换上了目前能装进消费级笔记本的最强本地模型,一共跑完1056轮测试,结果发布在他的博客上。
六个本地模型,两个云端对照组
他这次能跑的模型体量完全不同:Meta刚发布的Muse Glimmer(30B)、OpenAI的GPT-OSS(120B,MoE架构)、阿里的Qwen3 Coder(30B,MoE)和Qwen3.5(35B)、Z.ai的GLM-4.7 Flash,以及借助antirez/ds4项目的本地推理服务端、以2比特量化跑在同一台Mac上的DeepSeek V4 Flash(304B)。作为参照组,他用同样的测试套件跑了Claude Opus 5和GPT-5.6 Sol两个前沿云端模型。
测试题目由Claude设计,覆盖六大类、22道题:DuckDB SQL查询、Python代码修复、JSON信息提取、程序输出预测、常识速答、长文档检索,每题跑6次,本地部分792轮,加上云端对照共1056轮。
差距在缩小,但没消失
结果和五年前那份评测比,本地模型的进步相当明显。当年不少小模型的正确率只有五成左右,这次多数本地模型的准确率已经能逼近90%以上,其中Meta的Muse Glimmer拿到93%,OpenAI的GPT-OSS和DeepSeek V4 Flash并列92%,只比两个云端模型(94%、95%)低几个百分点。垫底的GLM-4.7 Flash是个例外,只有75%。需要说明的是,这些数字都来自这22道特定任务,并不代表本地模型在所有类型工作上都能缩小到这个差距。
速度上,不启用思维链的Qwen3 Coder是全场最快的模型,处理SQL和知识速答类问题几乎瞬间给出答案,而且正确率并不差;它的短板出现在需要"预判程序会怎么运行"的题目上,因为不思考、只靠直觉答题,这类题错得最多。有意思的是,云端模型虽然要经过网络往返,实际响应速度反而普遍快于本地跑的思维模型。
所有本地模型在一项7900 Token的运维手册检索测试中都拿到了满分,其中Qwen3的平均速度还超过了两个云端模型——说明超长上下文里精确查找信息,至少部分本地模型已经不逊于前沿模型,但整体速度领先只体现在Qwen3身上,其余本地模型仍慢于云端。
集体翻车的一道题
有一道题几乎难倒了除Opus之外的所有模型:一段涉及Python闭包变量绑定的经典陷阱代码,多数模型给出的是Python 2会打印的结果,而不是Python 3的实际行为。Opus 5是唯一一个六次全部答对的模型,GPT-5.6 Sol也只答对了一半,本地模型里表现最好的Muse Glimmer也只蒙对了三分之一。此外,部分本地模型在DuckDB查询里想当然地套用了Postgres的语法函数,暴露出对具体SQL方言掌握不够精确的问题。
电费对比云端账单
Chacon还粗略估算了成本。792次本地运行合计消耗约600万输入Token、100万输出Token,如果按云端主流模型的标价折算,整套测试理论上要花费55到110美元不等;而实际跑在自己MacBook上的边际电费,大概只要一毛美元左右——前提是这台近5000美元的电脑已经买了,这笔硬件投入不算在里面。他也承认这个对比并不完全公平——云端厂商的实际计费会因为缓存等机制远低于标价,但即便如此,"本地边际成本极低、离线可用"依然是一个有分量的论据。
测完之后,作者真正改变了什么
比起纸面上的分数,更值得关注的是Chacon测完之后自己的选择。他已经把Ollama加Qwen3 Coder用进了日常的一些简单任务里,理由很直接:够快,也够准。对于表现均衡的Muse Glimmer,他打算接下来试着用它完整地搭一个应用,看本地模型能不能撑起比基准测试更复杂的真实工作。
另外一点他提得比较隐晦但态度很明确:测试过程中Opus 5多次拒绝回答,理由是触发了所谓的网络安全违规限制,而这些提示词在他看来只是重复跑了同一批"看起来有点敏感"的测试。相比之下,本地模型不会因为这类误判而拒绝任务,这让他动了念头,想进一步拿本地模型去做一些安全相关的探索性工作。
换句话说,这次测试给他的结论不是"本地模型已经能替代云端",而是"云端仍然更快更准,但本地模型已经好到可以放心处理相当一部分日常任务,尤其是在成本和限制都要考虑的场景里"。
