
智能体的采用正在快速增长,而在大多数情况下,智能体推理仍然运行在云端。这带来的影响非常明确:云端 API 成本持续上升,敏感数据需要离开设备,且工作流只有在联网状态下才能运行。将推理转移至本地运行,则会改变这种情形:无需按 token 支付云端费用,数据不离开本地设备,可离线并且低延迟运行,并对模型和智能体拥有完全控制权。关键问题在于:是否能够在本地真正运行现实的智能体工作负载?
此前,我们曾经展示过,即使推理运行在云端,系统中最重要的升级也可能是 CPU,因为智能体循环,即规划、路由、数据移动和形成结果,都是编排任务,而编排都需要在本地 CPU上进行,无论 token 在哪里生成。现在,我们来完成在本地端侧设备上运行推理的讨论。当整个智能体都在本地运行时,聊天对话式 AI 时代的直觉会让人首先问:哪个系统拥有更强的 GPU?但智能体工作流并不是一次巨大的矩阵乘法;它是一条由编排和推理组成的流水线,可能包括解析、OCR、切分、嵌入、检索、生成和验证等步骤,而其中大多数阶段并不使用 GPU。面对这类工作流,胜出的将是一个均衡的系统,而不仅仅是拥有最大加速器的系统。
指标已经改变,进而改变一切

指标转向完整工作流结果:完成时间和每工作流成本
聊天时代优化的是两个 GPU 生成指标:首个 token 响应时间和每秒 token 数。这两个指标都描述了单个模型流式输出单个响应的速度。智能体的评估方式不同,它关注的是已完成并经过验证的工作结果,因此关键绩效指标转向端到端完成时间和每个已完成工作流的成本,token 生成只是其中的一个阶段。智能体编排涉及文档准备、嵌入与证据检索、在不同引擎之间移动数据以及验证输出,而这些过程可能占据端到端工作流完成时间中的相当大一部分。仅凭推理阶段的高每秒tokens 数,几乎无法说明整个任务实际完成得有多快,或完成成本是多少。核心结论是,token 生成和 CPU 编排都是流水线中的阶段,但对于智能体工作流而言,端到端完成时间将成为更有意义的指标。
基于现实工作负载的端到端衡量
为了准确测试这一点,我们创建了 HEPA,即 Hermes Executive Presentation Agent。该测试要求一个本地智能体基于固定的本地数据集,生成一份可提交董事会审阅的高管演示文稿、一份配套备忘录、图表以及带引用来源的附录。该数据集模拟了一个大型共享团队网盘。HEPA 衡量的是现实企业知识工作者流程中的端到端本地智能体性能。该数据集具有多样性:相关文件与冗余、过时和相互冲突的材料混杂在一起,同时还包含需要真正 OCR 处理的扫描件和源自图像的素材。智能体必须读取该数据集,对扫描输入进行 OCR,切分并嵌入全部内容,检索设限的证据包,生成交付成果,并通过确定性质量验证。最后,会根据已完成且通过质量验证的工作成果进行评分,而不是依据孤立的模型吞吐量。

八个流水线阶段中有七个运行在 CPU 上;只有模型生成阶段运行在 GPU 上
测试设置如下:302 个本地来源文件 / 801 个准备后的 chunks;编排模型为 Qwen3.6-35B-A3B(混合专家模型,约 3B 活跃参数,4-bit),通过 llama.cpp 提供服务;FastEmbed ONNX nomic-embed-text-v1.5 嵌入和真实 Tesseract OCR 均运行在 CPU 上;两台机器使用完全相同的语料库、模型和设置;两个平台均完成了 5/5 次有效运行和 25/25 项确定性检查。在这一配置中,八个流水线阶段中的七个由 CPU 执行,而 token 生成运行在 GPU 上。(完整参数见下方系统配置。)
结果:AMD 更快完成任务,且成本更低

由 AMD 锐龙 AI Max+ 395 处理器驱动的 AMD 锐龙 AI Halo,是专为智能体工作流打造的。与竞品相比,在相同的五轮工作流测试下,且均运行 Linux,AMD 锐龙 AI Halo 在端到端完成时间、CPU 编排以及每个已完成工作流的成本方面胜出。
与竞品相比,AMD 锐龙 AI Halo 在 CPU 编排方面快 34%。¹ AMD 完成 CPU 侧准备工作用时 152.1 秒,而竞品用时 229.9 秒。决定性组成部分是嵌入与路由,这些任务运行在 CPU 上——AMD 用时 71.5 秒,竞品用时 139.6 秒,差距接近 2 倍。
AMD 锐龙 AI Halo 完成工作流的速度比竞品快 15%。² AMD 完成经过验证的工作流用时 311.6 秒,而 竞品用时 367.1 秒——AMD 快 55.5 秒。这是智能体场景下的核心 KPI:完成经过质量验证的工作成果所需的时间。
与竞品 相比,AMD 锐龙 AI Halo 每个已完成工作流的成本降低 了27%。³ 在按三年硬件摊销并持续利用的基础上计算,不包含能源成本,AMD 每个工作流成本约为 0.0132 美元,而竞品约为 0.0182 美元——AMD 成本低 27%,原因在于其采购成本更低,并且能够在相同时间内完成更多工作。
即使竞品 在GPU推理方面具备优势,它仍然输掉了整个工作流,因为推理只是其中一个阶段,而 CPU 密集型编排同样重要。两个系统都经过了最优配置:AMD 系统通过 Vulkan 运行 llama.cpp。
为什么 AMD 在编排阶段胜出
嵌入与路由是 CPU 侧最大的差距:AMD 用时 71.5 秒,竞品用时 139.6 秒
这一优势归结于 CPU 密集型阶段如何并行化。解析、OCR(线程数受限)、嵌入和路由都是数据并行工作,会随着核心数和线程数的扩展,并随着数据集规模的扩大而增长。锐龙 AI Max+ 395 处理器通过 SMT 提供 16 个 “Zen 5” 核心和 32 个线程,即 32 个有效工作线程,并具备 AVX-512/VNNI 向量加速能力,以及面向文档和检索技术栈的原生 x86 工具链。竞品拥有 20 个 Arm 核心,但不支持 SMT,并采用 SVE2 而非 AVX-512。更多线程和更宽的向量能力意味着可以同时解析、嵌入和路由更多源文件,因此主导智能体完成时间的 CPU 密集型准备阶段能够运行得更快。
系统制胜,而非单芯片竞争

一个智能体,两个引擎,一个内存池:CPU 负责编排,GPU 负责生成,统一内存让模型保持常驻
在底层,这是一个编排智能体驱动多个常驻模型,并将工作分配到系统不同引擎上的过程。CPU 运行循环和准备阶段,包括解析 300 多个来源、切分内容,以及运行嵌入和路由模型来决定哪些证据是重要的。GPU 负责生成 token。而大容量统一内存让模型和数据保持常驻,使它们之间的交接保持高效——这也是使完整设备端模型组合首先变得切实可行的能力。
聊天时代关注的是谁的 GPU 更强。而智能体时代提出了一个更好的问题:谁的系统能够以最快速度、更低成本完成整个工作流?在设备端,答案是一个平衡的系统,其 CPU、GPU 和统一内存都针对完成时间和每个工作流的成本进行优化,而不是只针对每秒 token 数进行优化。AMD 锐龙 AI Halo 的优化目标是成为一个平衡系统,而不仅仅是最大化的 GPU 性能。

CPU、GPU 和统一内存作为一个系统协同工作,决定了智能能力转化为已完成工作的速度
一个系统可以赢得 token 速度竞赛,却仍然输掉整个任务。随着设备端智能体发展为完整的模型组合——包括编排模型、始终在线的小模型、嵌入模型、重排序模型、OCR、语音模型和图像模型——平衡系统的优势将不断累加。聊天式 AI 是一个 GPU 故事。智能体 AI 是一个系统故事。
