一年前还要塞进数据中心的大模型,现在被搬到了办公桌上。
没有云端API,没有外部计算集群,也没有几十台服务器协同工作。Alex Ziskind只用一台华硕ExpertCenter Pro ET900N G3,希望能同时启动128个本地AI智能体。

编程、研究、分析、写作、测试、规划……不同智能体在同一时间持续读取资料、调用模型并生成内容。
当AI应用逐渐由单轮对话进入多智能体协作,一台放在办公室里的本地设备,究竟能不能承担过去只有数据中心才能完成的推理任务?
先把465GB大模型塞进桌面主机
这台搭载NVIDIA GB300超级芯片的华硕ExpertCenter Pro ET900N G3,拥有约748GB一致性内存,其中包括256GB HBM高带宽显存,以及500GB以上的Grace系统内存。前者带宽达到每秒7至8TB,负责模型推理中最密集的计算;后者带宽约为每秒500GB,用于容纳超出HBM容量的模型权重。
Alex首先测试了Nemotron、Qwen 3 235B、DeepSeek以及GLM等大模型。为了让这些数百亿、数千亿参数模型能够放进单机内存,他采用了Blackwell架构原生支持的NVFP4四位量化格式。

以GLM模型为例,NVFP4版本在磁盘中仍然达到465GB。按照16位精度计算,这类模型原始体积可能接近2TB,经过四位量化后,体积能够缩小至原来的四分之一左右,同时获得更高的推理速度。
465GB依然远远超过256GB HBM的容量。运行时,一部分模型权重会被放在高速HBM中,剩余部分进入Grace系统内存。两块内存可以统一寻址,模型无需被拆分到多台设备上,但读取系统内存中的数据时,速度会明显下降。
测试结果也验证了这一点。能够完整放入HBM的Nemotron,单路生成速度达到每秒约184个Token;GLM由于大量权重溢出到系统内存,单路速度下降至每秒约24个Token。
模型可以运行,只是模型放在哪里,直接决定了它跑得有多快。
从一个人聊天,到128个请求同时涌入
完成单模型测试后,Alex没有继续追逐单路生成速度,而是逐步增加并发请求。
单个用户使用模型时,Nemotron每秒可以生成约180个Token。并发增加到2路、4路、8路和16路后,单个请求的等待时间有所增加,整台机器的总吞吐量却持续上升。
32路并发时,总生成速度突破每秒1000个Token;64路并发时,上升至每秒1500至1800个Token;并发达到128路后,部分模型的总吞吐量接近约每秒2700个Token。

背后的关键机制是连续批处理。
GPU会把多个用户在相近时间发出的请求组合起来,一次性送入模型计算。请求数量增加后,GPU可以保持更高利用率,同一轮计算也能服务更多任务。
Alex还专门测试了Prefill,也就是模型读取提示词和上下文的速度。对于普通聊天,用户输入可能只有几十个字;对于代码智能体,一次请求中往往包含项目文件、历史对话、工具说明和代码上下文,输入长度可能达到数万甚至数十万个Token。
在单路测试中,Nemotron的Prefill速度约为每秒2200个Token,Qwen约为2500个Token,DeepSeek约为1800个Token。并发增加后,Qwen的总提示词处理速度最高达到每秒约4.1万个Token。
这些数字意味着,大模型读取一个代码仓库、理解多个文件并准备调用工具的时间,已经可以被压缩到几秒之内。
128个智能体一起工作,功耗冲到1000W
模型吞吐量只是基础测试,Alex随后把本地模型接入Visual Studio Code和OpenAI Codex CLI。
他先启动一个代码智能体,让模型读取整个项目,判断代码用途,并调用工具分析文件。单个智能体运行十分顺畅,但这种任务对普通笔记本和Mac mini也不算困难。
接下来,他设计了一套智能体并发界面,将编程、研究、分析、写作、规划、测试和架构等不同角色同时启动。
16个智能体运行时,整机GPU利用率达到100%,总输出速度约为每秒1400个Token,功耗升至750W左右。

智能体数量增加到64个后,输出速度提升至每秒约3500个Token,整机功耗接近900W。最终,Alex启动了128个智能体,所有智能体都在本地调用同一个大模型,同时生成各自的任务结果。
测试过程中,整机功耗一度接近1000W,温度维持在55摄氏度左右,短时间内生成了接近15万个Token。
根据他的测试,32至64路并发是这款模型较为理想的工作区间。此时GPU能够保持接近满载,每个智能体仍能获得相对稳定的响应速度。继续增加并发,可以获得更高的总吞吐量,但单个任务的完成时间也会变长。
至顶AI实验室洞见
在最后,Alex给出了明确判断:普通电脑同样可以运行本地模型,也可以搭建AI智能体。
的确,Mac mini、笔记本电脑或者普通工作站,都能够承担单个代码助手、写作工具和个人知识库等任务。它们的限制主要出现在模型体积、上下文长度和并发数量上。
但是GB300桌面设备提供的,是更大的模型容量和更高的并发上限。
它可以把数百GB模型完整留在本地,让几十名员工共享同一套模型服务,也可以同时运行数十个甚至上百个智能体。代码、文件和业务数据无需发送到外部API,运行过程中也不会产生按Token计费的调用成本。
代价同样明显。机器本身价格高昂,对供电和散热都有更高要求,满载功耗可以接近甚至超过一台大功率家电。只有当企业长期运行大型模型、拥有大量并发任务,或者每月API费用已经达到数千美元时,本地部署的经济价值才会逐渐显现。
桌面AI计算的衡量标准,已经不再局限于“一秒能生成多少字”。当一台设备能够同时承载代码、研究、测试和分析任务时,它更接近一套可以放在办公室里的私有AI基础设施。
过去,用户购买一台计算机,是为了让一个人完成更多工作。
现在,一台计算机里,可能同时坐着128个“人”。
