一台电脑好不好,到底该怎么判断?

过去十年,所有的评测机构几乎都有一个明确的答案:看跑分。

处理器多少分,显卡多少分,一列数字排下来,谁强谁弱一目了然,这套办法在办公、游戏、视频、3D 渲染等场景上一直被反复提起,几乎成了市场上电脑性能的金标准。

直到 AI 来了。

买游戏本,你想知道这个游戏能开多高的画质,跑分能答。做视频剪辑,你想知道这段片子导出要等多久,跑分也能答。

轮到 AI,问题开始不一样了。你想在自己电脑上跑个模型,第一个难题往往不是快不快,是能不能,模型能不能装进去,Agent 能不能跑起来,生态与软件能不能兼容,真实场景下能不能用。如果不能,再高的算力也是零。这是及格线,不是分数线,而跑分这套工具,回答不了及格线。

前不久,全球最专业的硬件实验室之一,StorageReview,给出了它的答案。

8 月 13 号和 14 号,其连发了两张榜单,一张桌面工作站,一张移动工作站,标题是:2026 年最适合跑本地 AI 的机器。

StorageReview 是那种老派的评测机构,有实体实验室,机器一台台搬进来,接上电,一项项进行测试,并且在榜单中明确表示,一切数据均来自实验室实测,不接受任何厂商付费赞助。

两张榜的结果是这样的。

桌面工作站这张,先分成了桌边设备和塔式机两层。

桌边设备里,最佳本地 AI 系统给了英伟达 DGX Spark,最佳 GB10 实现给了宏碁 Veriton GN100,最佳 x86 替代方案给了 AMD 的 Strix Halo 平台,最佳集成显卡方案给了惠普 Z2 Mini G1a。

塔式机里,最佳本地 AI 塔机是戴尔Precision 7875,最佳多卡扩展平台是惠普 Z8 Fury G6i,极限配置那一档给了 Comino Grando。

移动工作站这张分得更细。综合最佳是戴尔 Pro Max 18 Plus,最适合跑大模型的是惠普 ZBook Ultra G1a 14,16 寸里性能与便携最平衡的是戴尔 Pro Max 16 Plus,最佳超便携是联想 ThinkPad P14s Gen 7,集成显卡那一档给了戴尔 Pro Precision 5 14s,纯 NPU 轻薄本那一档给了惠普 EliteBook 6 G1q。

我把这两张榜单以及评选过程从头到尾读了一遍,作为一个同样专注于本地 AI 硬件的 AI 实验室,不得不说,某些方面,确实有很大启发,但同样也有一些不同的见解。

先说启发

没进入过StorageReview实验室的机器不能参与评比。

这条听着像废话,可市面上大多数榜单,都是照着厂商参数表抄一遍再排个序,连排序的依据都懒得交代。而StorageReview把它写成明规则,宁可少写几台,也不排没见过的机器。

苹果就这么缺席的。

StorageReview专门解释了原因,不是不想测,是苹果停售了大内存的mac studio,而大内存恰恰是这台机器在 AI 上最大长处,配置没了,评测的前提也就没了。

第二个启发,是同一台机器,在不同榜单上按不同口径进行对比,一台机器并没有所谓的综合实力,只有在某件事上强不强。

一台工作站在渲染榜上是一套指标,在 AI 榜上是另一套,两张榜的冠军可以不是同一台。不同的问题,不同的数据,是不同的答案。

我们太习惯给设备发总分成绩单了,好像分高就万能,可真用起来就知道,渲染快得飞起的机器,跑 AI 可能平平无奇,反过来也一样。揉成一个总分,看着清爽,实际是把信息揉没了。

第三个启发是立场,StorageReview设置了一个门槛,要么可以跑起 300 亿参数级别的模型,要么至少可以提供 96GB 能被模型直接调用的内存。达不到的机器,压根就不让参与评比,哪怕之前付费测试过都不成。

StorageReview认为达不到这条线的不叫本地 AI 电脑,哪怕它的宣传页上印满了所谓的AI能力。

而最让我意外的,是它真的在可以在成绩栏里留空。

联想ThinkPad P14s Gen 7,超便携本,跑到某个 130 亿参数的模型时没跑完,因为这个模型要吃掉大约 12GB 显存,这张显卡只有 8GB。榜单没有把它折算成一个低分,而是直接标注未完成,达不到。

其他的榜单都在说快慢,只有它在说,这件事,这台机器做不了。对正准备掏钱的潜在购买者来说,这个结论也确实够狠。

整个榜单里,我觉得对功耗的描述最为客观,一台顶配多卡工作站,双电源加起来能到 2700瓦,超过普通家用电路能供的量,另一台极限配置的机器要求更高的电压输入,接在民用电上功率直接减半。

它提醒读者,买之前先看看自己的应用环境是否适合,否则改电路可能是这台机器最大的隐性成本。

除了启发,我同样也有一些不同的见解。

主要集中在评测的方法上,移动工作站评测用了一套固定的测试软件,在每台机器上跑同样的四个模型,这样数字才能横向对比,不统一标准就没法比较,思路很好。

但,这四个模型里,有一个是 Llama 2。

因为今天,几乎没有人还会在自己电脑上部署Llama 2,这是一个早就被淘汰的模型,所以这个评测并不贴合真实用户场景。

桌面工作站的排名是好几项数据加权算出来的,服务吞吐量,首token延迟,token速度,算力利用率,市场价格等等。这套指标专业、严谨、可复现,放在工程语境里挑不出毛病,但把它们摆在一起,会发现一个共同点,全都是过程数据。

这就像用发动机转速评价一辆车,转速真实、可测、也确实和性能有关,可用户想知道的是这车能不能每天送你上班,后备箱装不装得下你那套设备,这个性能答不了。

全场最快的移动工作站成绩是185,很快,但它能满足用户什么场景,到底能替我干什么活。

用户真正想知道的,其实还是基于场景的案例。

结合agent,丢一份两百页的年报进去,让它读完写个摘要,能不能做到,要等多久,是去倒杯水回来就好,还是可以先去开个会。

让它自己跑一个Agent任务,中间要查资料,要调工具,要来回好几轮,它能一次跑完不出岔子吗。

办公室多个人同时用这一台设备,是否可以?

这些问题,这个评测都解答不了。

所以我认为更贴近用户的评测,不是测机器跑多快,而是基于真实使用场景,看机器能不能完成。

每个场景的任务不一样,或许不大好横向对比,无法直接排名次。

贵,而且慢,跑一遍标准测试软件是几小时的事,跑通一套真实场景要几天,出了岔子还得重来。

而且可能有很多主观判断,什么叫干得好,什么叫能接受,这里面的判断,不会像纯数字那样不容置疑。

评测的责任,是把每台机器能干哪些事说清楚,而不是递给用户一张他看不懂的成绩单。

*本文所引数据来自StorageReview 于 2026 年 8 月 13 日、14 日发布的两份本地 AI硬件榜单及其方法论说明。*

Best Desktop Workstations in 2026: Lab-Tested Leaderboard
Best Laptops for Local AI in 2026: Lab-Tested Leaderboard

END
本文来自至顶AI实验室,一个专注于对AI计算机、工作站及各类AI相关硬件设备,开展基于真实使用场景评测的研究机构。
至顶网至顶AI实验室频道