今年春天,苹果正式宣布了一件事:Mac Pro已经"死了"。
在苹果使用英特尔处理器和AMD显卡的时代,可扩展、可升级的塔式机箱理念是说得通的。但苹果自研芯片将CPU、GPU和内存接口都整合在同一颗芯片上,这使得那种可升级性不仅变得多余,甚至根本不可能实现——除非牺牲这些芯片的核心优势。
而恰好,苹果自研芯片将快速CPU、强劲GPU与统一内存架构结合在一起的特性,使其非常适合当下一种真正能push高端硬件极限的"专业"工作负载:在本地运行大语言模型和智能体。
这正是M5 Ultra Mac Studio的核心受众所在——这是苹果的顶配版本,一次性跨越了两代处理器(如果你还记得的话,中间并没有M4 Ultra这一代)。长期以来,最高配的Studio对大多数人而言都显得有些过剩,但现在有一类特定人群——沉迷AI的程序员或设计师,确实能从在桌面上拥有这样一台设备中获益。
苹果显然没料到会有这么多人想购买这类设备,去运行像OpenClaw这样的软件,或是在本地跑开源权重模型。再加上AI引发的内存短缺,这就是为什么这些机型已经连续数月几乎买不到的原因。新款Mac Studio正是在这样的背景下登场的。
设计相同,硬件全新
新款Mac Studio的外观与2022年M1 Max和M1 Ultra首发时一模一样。它依然是一个小巧方正的机箱,占地面积与老款Mac mini相同,都是7.7×7.7英寸,但更高一些。Max和Ultra两个版本的Studio外观相同,但M5 Ultra版本要重两磅,因为它的散热器使用了更重但导热性更好的铜材质,以帮助为更强大的芯片散热。
两款Studio机型的接口配置几乎完全相同。背面配有四个120Gbps的Thunderbolt 5接口、一个10Gbps以太网接口、一个HDMI 2.1接口,以及一对5Gbps的USB-A接口。正面方面,两款Studio都配备了UHS-II SD读卡器,但Max版本配有两个10Gbps USB-C接口,而Ultra版本则多配了两个120Gbps的Thunderbolt 5接口。
Ultra在外接显示器支持方面也更胜一筹。M5 Max支持最多五台外接显示器,M5 Ultra则支持最多八台,不过两者的具体支持情况都会因分辨率和刷新率的不同而有所差异。
M5 Max如今已是众所周知的产品,苹果自今年3月起就已在MacBook Pro上搭载出货。相较于上一代M4 Max,它引入了新的CPU"超级"核心,并将最大内存带宽从546GB/s提升至614GB/s。GPU核心数量维持不变(40核),但每个GPU核心内置的全新神经网络加速器,提升了其在MetalFX超分辨率和帧生成等机器学习/AI辅助技术上的性能表现。
M5 Ultra的变化则更为显著,原因有几个。首先,由于没有M4 Ultra这一代,我们实际上是跨越了两代处理器,尽管产品世代只前进了一代。
其次,这颗芯片的构建方式本身发生了相当大的变化。此前的M1 Ultra、M2 Ultra和M3 Ultra本质上都是通过高速互联将两颗Max芯片拼接在一起,从而在不必承受制造一整块巨型芯片的困难的情况下,获得接近于单颗巨型芯片的大部分优势。
M5 Ultra本质上仍然是两颗M5 Max芯片拼接而成——这一点没有变。该芯片最多包含12个超级CPU核心、最多24个性能核心、最多80个GPU核心、32个神经网络引擎核心、两个视频解码引擎和四个编码引擎,以及超过1.2TB/s(没错,是TB级别)的内存带宽。这基本上是M5 Max全部主要规格的翻倍。
不同之处在于,这一代的M5 Pro和M5 Max本身就已经是通过硅片互联拼接的两个芯片单元,这意味着M5 Ultra实际上是由四块独立的硅片封装在一起。这种方案潜在的缺点是,芯片间互联的通信速度往往无法与同一硅片上的组件相媲美。总体而言,Fusion架构并未妨碍此前的Ultra芯片保持高速表现,对M5 Ultra也是如此。但Ultra芯片的性能表现从来都不是随核心数量完美线性扩展的,M5 Ultra同样如此。
还有:新的价格 :(
通常我们可以只谈硬件层面的提升,同时假设价格因素保持不变——即认为新硬件自然会比旧硬件更划算,因为售价相同。但今年由于持续的AI引发的内存紧缺,苹果全线产品都上调了价格。作为其配置最高端、内存和存储规格最顶级的电脑,Mac Studio受到的冲击比其他Mac产品更为严重。
发布之初,基础版M4 Max Mac Studio售价1999美元,可获得一颗稍微阉割版的芯片、36GB内存和512GB存储。而M5 Max Studio起售价为2499美元,上涨了500美元。一台配备阉割版芯片、96GB内存和1TB存储的M3 Ultra Mac Studio起售价为3999美元;同样配置的M5 Ultra版本则要价5499美元,暴涨1500美元。而这些还只是基础型号的价格。如果选择满血版M5 Max、64GB内存和1TB存储——我认为这是尝试本地AI的性价比甜点配置——则需要花费3799美元,比M4 Max Studio发布时的价格高出900美元。
至于Ultra版本呢?一台18个月前售价5599美元的256GB内存/1TB存储机型,如今售价高达9499美元——虽不到翻倍,但也相去不远,足以让人有翻倍之感。M5 Ultra版本还将推出512GB版本,但苹果尚未公布其定价。M3 Ultra版本的起售价为9499美元,所以我相当有信心地说,M5 Ultra版本的价格将会是2万美元起步。想要涉足高端本地AI领域,你本就需要愿意在硬件上预先投入比使用某家公司英伟达驱动的数据中心服务更多的资金。以这样的价格来看,购置一组Mac Studio集群,感觉就像是自掏腰包搭建一座数据中心。
在我们讨论性能表现时,请牢记这一点。
通用计算性能
从几乎所有的衡量指标来看,M5 Ultra都是迄今为止苹果自研芯片中速度最快的一款。唯一的例外是单核CPU性能,Mac mini上那颗朴素的M6芯片以极小的优势险胜。但差距很小——甚至比M3与M4两代之间的差距还要小——这使得它不像上一代Studio从M4 Max和M3 Ultra升级而来时那样给人以巨大的震撼感。
在我们的多项通用CPU和GPU测试中,Ultra的CPU性能比M5 Max快80%到90%,GPU性能则快50%到80%。这与我们此前在Ultra芯片上观察到的规律基本一致——CPU的性能扩展比GPU更接近于翻倍。相较于前代M3 Ultra,M5 Ultra的单核CPU速度通常快约30%,多核CPU速度快约50%,GPU性能则根据测试项目不同,快33%到66%不等。正如你所预期的,作为一次跨越两代的升级,这的确是一次巨大的提升。
但我们也观察到一些出乎意料的表现。Ultra在Geekbench多核测试中的性能只比Max快约26%,而在我们基于CPU的Handbrake视频编码测试中,Max完成H.264编码的速度反而更快(在H.265编码上则仅略慢一点)。
功耗数据或许能解释这一现象。根据powermetrics工具的数据,M5 Max和M5 Ultra在视频转码测试中平均功耗都约为75瓦。这也大致是M3 Ultra Mac Studio的功耗水平。但从以往来看,Max版Mac Studio的功耗一直低于Ultra芯片。在我看来,这似乎表明M5 Ultra正受到功耗限制,以使其保持在现有Studio设计的散热/功耗承受范围内。
但这也有可能只是个bug。在视频编码任务期间查看活动监视器时,你不会看到每一个CPU核心都被占满至100%,而这通常是该测试的典型表现。powermetrics报告显示,在整个编码测试期间,Ultra的所有CPU核心都以与M5 Max相同的持续时钟频率运行。如果真存在功耗或温度相关的降频,你本应看到更低的时钟频率。我已将这一发现反馈给苹果,如果得到回复会再作报道。
为什么AI爱好者青睐Mac
关于"氛围编程",我几乎所有的第一手了解都是在过去一周内学到的,如果有说错的地方还请见谅。包括苹果在内的许多AI模型提供商,也发布了能够规避这些"硬性事实"的模型。但总体而言,这应该算是一份准确的本地AI速成课。
当谈到在本地运行AI模型时,有两个硬件参数至关重要。第一是你拥有的GPU显存容量。第二是你的内存带宽,也就是该GPU与系统其余部分通信的速度。
你的显存容量决定了你能运行的模型规模——这些模型几乎需要完全加载进GPU显存中,因为超出部分要么会溢出到主系统内存中(速度较慢),要么在最坏情况下溢出到硬盘(速度更慢)。
除此之外,尤其是在编程场景中,你还需要额外的内存来处理"上下文",也就是单个智能体在内存耗尽前能够记住的信息量。对于基础的问答式聊天机器人交互,你并不需要太多上下文。但如果要编写一个完整的应用程序,你会希望有充足的内存用于上下文处理,这样智能体才不会在完成一项复杂任务进行到一半时就"忘记"自己正在做什么。
存在一些交接机制——一个智能体可以将一次会话浓缩为一个包含大部分相关信息的单一文件,并将其传递给另一个智能体,从而有效地重置上下文。但通过这种机制,信息不可避免地会有所遗漏,尤其是当原本可供浓缩的上下文本就不多的时候。
内存带宽并不是决定模型能以多快速度生成新词("Token")的唯一因素,但它很可能是最重要的单一因素。相比之下,即便是显存所连接的GPU本身的速度和能力,也远不如你拥有的内存容量以及计算机在其中读写数据的速度那么重要。
苹果自研芯片Mac之所以成为运行这些模型的热门选择,是因为它们恰好击中了一个甜蜜点。它们提供的内存带宽不及专用的桌面独立显卡(一块五年前的英伟达GeForce RTX 3060 12GB显卡能提供360GB/s的带宽,比M5 Pro还高出近20%;RTX 5070 12GB则能提供672GB/s带宽,超过M5 Max)。但一台64GB内存的苹果自研芯片Mac所提供的GPU显存,超过了任何一款你能买到的单卡消费级显卡,其内存带宽也足够快,而且相较于RTX 5090或一对RTX 3090,它的能效表现要出色得多。而96GB、128GB、256GB乃至512GB内存的苹果自研芯片Mac,更是为运行更大规模的前沿级模型打开了大门。
显然,这些顶配机型目前价格不菲,但这或许能解释部分原因,为什么就连Mac mini这种机型现在也突然变得难以买到。而且,正是因为这类硬件与这些工作负载高度契合,苹果的MLX框架也已获得了相当不错的优化,并得到了不同语言模型以及LM Studio Bionic等专注于本地AI应用程序的支持。
除了这些参数之外,还有一个被称为"首个Token生成时间"(TTFT)的指标——即从你向模型提交提示词,到模型处理完毕并做出响应之间所经过的时间。这正是M5这一代相较于M4及更早世代实现改进的一个方面:苹果为GPU新增的神经网络加速器显著缩短了TTFT,让任何本地运行的模型都显得响应更加迅速。
再加上M5 Ultra相较于M3 Ultra在内存带宽上的大幅提升,你就能理解为何这款特定的Mac Studio特别适合这类工作了。而它相较于去年M3 Ultra整整跨越两代的事实,更是让它显得比M5 Max Studio或搭载M5 Pro的Mac mini更加出色。
我成为了氛围编程者
除了标准的基准测试套件之外,我还在这台Studio上尝试了一些本地氛围编程,这是我第一次尝试这种方式。听取了几位在这条路上走得更远的朋友的建议后,我下载了LM Studio Bionic和Qwen 3.8 27B模型。
说到编程和开发,我对HTML和CSS的了解仅够修改现成模板的皮毛,但我想学得更多的愿望始终超过了我的实际能力。这可以怪我的ADHD,怪我缺乏空闲时间,或者怪我大脑里的某种东西,让我在唯一尝试过的编程课上,才上了寥寥几节、刚学到"Hello world"就学不下去了。
我就是没办法把它坚持下来。
使用这台M5 Ultra Mac Studio和LM Studio Bionic在本地运行一个具备编程能力的语言模型,是我很长一段时间以来玩过的最有趣的新技术体验。我这么说,是作为一个在创作层面上厌恶生成式AI的人——总体而言,我认为生成式AI的能力被严重夸大了,而且它是以一种攫取式、剥削式的方式被构建出来的,窃取了数百万艺术家、记者、研究人员以及普通网民的劳动成果。
但氛围编程之所以能在过去一两年内兴起,是有原因的。只要你懂得足够多,能够告诉系统你想要什么,你就能做出一些真正有用、真正能运行的东西。
我参与制作一档读书播客节目已经将近十五年了,我负责我们的财务记账工作——这是我副业之外的又一份副业。多年来,这项工作一直需要我手动将银行对账单上的数字录入我自己搭建的一张电子表格中,用来追踪我们的收入、支出以及预估的税务负担。这份工作的量太轻了,不值得为此永远付费购买QuickBooks——那款软件功能太多,很多我们根本用不上。这属于那种大概率可以解决、但每次想起来都让人心烦,可你遇到的频率又不算高,所以始终没抽出时间去解决的问题。
而现在,它被解决了!
首先,我让Qwen模型编写了一个Python脚本,用来将银行对账单PDF转换为电子表格,并按我想要的方式进行格式化和排序。然后,我围绕它搭建了一个网页应用,这样以后上传新的对账单时,我就无需再折腾大语言模型或Python脚本了。
对此我心情颇为矛盾,但不可否认的是,在短短几个下午的时间里,构建一个小软件来解决某个对你个人而言棘手的特定问题,确实有着无法否认的吸引力。而且在这种情况下,你可以在自己家中的硬件上完成这一切,你的数据永远不会离开本地,而且它消耗的电量甚至比一块单独的PC显卡还要少。
我原本或许花上一个下午、几美元的Token费用就能解决这个问题,但把多年的财务数据发送给Anthropic或者其他任何公司,都是我无法接受的事情。用这种方式,我就不必如此。
Qwen 3.8 27B模型是"开源权重"模型,以Apache 2.0许可证发布,因此在使用上没有限制。它还提供不同的"量化"版本(本质上是用一点精度换取更小的体积),这有助于它适配不同内存容量的Mac设备。我认为32GB是能够运行性能尚可的4K量化版本、并为极小型项目或现有项目的小范围修复提供足够上下文的最低内存需求,但64GB是更好的目标配置,既能提供足够大的上下文窗口,又有足够的内存让你同时把这台Mac当作一台普通电脑使用。
在运行macOS 27.0的LM Studio Bionic中,使用4K量化版本的默认设置,我的日常使用的M2 Mac Studio在一个关于搭建新网站项目的示例提示词上,Token生成速率约为每秒18到20个。一台基于Strix Point Ryzen AI Max+平台、因其庞大且速度尚可的统一内存池而在本地AI爱好者中颇受欢迎的Framework Desktop设备,在运行Ubuntu 26.06和AMD的ROCm后端时,对同样的提示词也取得了大致相同的每秒18到20个Token的速率。
这一每秒Token生成速率并不算差,这意味着系统生成文本的速度基本能跟上我阅读的速度。但对于一个较长的编程项目而言(尤其是如果保留"推理"功能开启,让机器人在确定最终方案之前吐出一大堆词句序列),这就意味着相当多的等待时间,而且随着上下文窗口逐渐加深,这一每秒Token速率还会进一步放缓。
在相同的提示词下,M5 Max Mac Studio的每秒Token生成速率约为31个。M5 Ultra则刚好超过50个。(顺带一提,这也是为什么搭载M5 Pro的Mac mini在这类工作中可用性较低的原因,即便配备了64GB内存——它的内存带宽只有M5 Max的一半,而内存带宽通常正是这类工作负载最为敏感的规格参数。)
只要你的目标不算太宏大,并且具备耐心细致的排错调试思维(智能体几乎总会在第一次尝试时出错,而我在氛围编程过程中投入的大量时间和精力,正是用来一点一点地把各项功能打磨完善),这两款Mac Studio芯片都称得上真正可用于此类工作。
工作负载,正在悄然改变
Ultra版本的Mac Studio仍然是面向一小群特定受众的小众产品:那些愿意花费数千美元、想要使用AI模型的人;那些能够接受"够用但非顶尖"速度的人;以及那些不想为随手实验或吸收、编辑大型代码库时可能消耗的大量Token,而向OpenAI、Anthropic或其他任何公司付费的人。
但这样的受众确实存在。几乎是身不由己地,我发现自己也成了其中一员。能够以可用的速度编写自己感兴趣的小项目代码,而且数据从未脱离自己的掌控,这种感觉真的既有趣又自由。只可惜,就在我有了这一发现的同时,苹果却在整条Mac Studio产品线上实施了25%乃至更高幅度的涨价。
放眼当下价格普遍堪忧的Mac和PC市场大环境,Mac Studio依然算得上是相对不错的选择。M5 Max版本对于Studio核心受众——摄影师、视频剪辑师、主播和开发者而言,依然是一台出色的设备,而如果你主要使用云端AI模型,选择36GB或48GB内存也不会觉得吃力(不过这种情况下你或许可以、也应该考虑改选M5 Pro版Mac mini)。
即便是入门级的本地编程智能体也不需要顶配机型;64GB、96GB和128GB配置的价格分别在3500美元到5500美元之间,虽然仍不便宜,但离五位数还差得远——而且如果你打算将其作为未来几年的主力工作站使用,这个价格仍然算得上是可以说得过去的。
但这些机型的高端版本,定价已经远远超出了大多数人愿意为一台台式电脑花费的范围。以本次评测机型为例,这台M5 Ultra Mac Studio售价高达12299美元。我自己拥有一台M2 Max Mac Studio、一台M3 MacBook Air、一台Windows游戏主机、一台放在电视柜下的PC,以及一台MacBook Neo。当然,这些设备都是我在"内存价格尚属理智"的美好时代购入的。但我不需要算数就能明白,这台电脑的价格,已经超过了我这些设备加起来的总和。
优点
Mac Studio保留了它最大的卖点:体积小巧、速度快、噪音低、能效出色
M5这一代相较M4 Max和M3 Ultra是扎实的升级
对于速度可用、能效出色的本地机器学习和AI工作负载(包括能力尚可的编程模型)而言,几乎是理想的机型
缺点
价格涨幅从25%起步,且逐代攀升更高
M5 Ultra拥有M5 Max两倍的算力资源,但通常无法带来两倍的速度提升
丑陋之处
一台售价高达2万美元的消费级台式电脑,居然真的出现了
Q&A
Q1:苹果M5 Ultra Mac Studio价格为什么涨这么多?
A:由于AI引发的全行业内存紧缺,苹果今年全线产品都上调了价格。作为配置最高、内存存储规格最顶级的机型,Mac Studio受到的价格冲击比其他Mac产品更严重,涨幅从25%起步,顶配机型价格可能高达2万美元以上。
Q2:为什么苹果Mac适合在本地运行AI模型和编程智能体?
A:苹果自研芯片将CPU、GPU和统一内存整合在一起,提供了超过普通消费级显卡的显存容量,内存带宽也足够快,同时能效表现远优于英伟达高端显卡,因此非常适合运行大语言模型这类对显存和内存带宽要求较高的工作负载。
Q3:什么是"氛围编程"?普通人也能用Mac Studio做到吗?
A:氛围编程是指借助本地运行的AI编程模型,即使编程基础薄弱的人也能描述需求、让模型生成代码,从而完成实用的小工具或应用开发。文章作者亲身体验后,用Mac Studio和开源模型解决了自己的记账难题,全程数据不离开本地设备。
