AI数据中心正经历深刻变革,异构计算架构正在成为新的主流。近日,半导体工程领域专家们围绕AI数据中心架构演进展开了深入探讨,与会者来自Arm、Axiomise、Cadence、Expedera、西门子EDA和Synopsys等机构。
阿里巴巴的万卡集群探索
阿里巴巴近期披露了一个包含10,000张计算卡的集群方案,被认为是在无法获取最新英伟达芯片情况下的替代路径。西门子EDA高性能计算开发负责人Cameron Brunner指出,硬件厂商和系统集成商正在通过网络拓扑设计与软件调度来最大化互联带宽利用率。超大规模云厂商在这方面已积累了相当经验,例如通过"放置组"机制将虚拟机集中部署,以获得高速内部互联。然而,一旦跨越单机边界,如何实现随节点数量增加而线性提升性能,始终是一大难题。
推理流水线的拆分与重组
Arm全球云与AI基础设施芯片负责人Satadal Bhattacharjee详细阐述了推理解耦这一重要趋势。当前AI推理可拆分为三个阶段:预填充阶段负责解析用户输入的提示词,计算强度极高;解码阶段负责生成实际响应内容;智能体执行阶段则负责完成具体任务,例如预订出行或酒店。
英伟达已率先推进推理流水线的分阶段部署,其最新发布的Groq 3语言处理单元专门用于预填充集群,印证了单一GPU已难以应对所有任务的现实。目前,各阶段集群通过以太网互联,每个集群搭配最适合自身任务的软硬件组合。这种异构集群模式将成为未来常态,DigitalOcean已宣布部署专为推理优化的五层异构架构,同时整合AMD与英伟达的产品。
Expedera首席科学家Sharad Chole进一步指出,内存管理是整个体系的核心挑战。模型的参数属于静态部分,而上下文属于动态部分,两者共同决定了每秒可处理的请求数量。为满足不同阶段的需求,张量并行、数据并行、上下文并行、流水线并行等多种并行化策略被综合运用,每种策略对网络拓扑的要求各不相同。NVLink在张量并行场景中至关重要,而智能体工作流的编排则更接近云管理问题,需要统筹协调模型上下文协议服务器与各类工具调用。
CPU与加速器的新型分工
随着智能体推理场景的增多,CPU正在承担更多工作负载,包括复杂推理循环、上下文维护和分支路由等难以并行化的任务。Bhattacharjee强调,加速器(不限于GPU,也包括定制ASIC)专注于矩阵乘法等高度并行的计算任务,而工具调用与任务编排则交由CPU负责。软件层在其中扮演关键角色,需要精确调度哪些任务在CPU上运行,哪些在NPU上执行。Brunner还预告,量子计算机未来也将被整合进这一统一平台,共同服务于业务目标。
互联标准之争
在加速器互联领域,NVLink长期占据主导地位,但其封闭性促使行业寻求开放替代方案。谷歌为TPU集群开发了光互联方案ICI,亚马逊、Meta的MTIA和微软的Maia也各自构建了专有互联体系。
英伟达随后推出NVLink Fusion,允许英伟达加速器与第三方CPU互联,或英伟达CPU与第三方加速器互联,但英伟达仍须处于连接的一端。与此同时,行业联盟正在推进UALink(超级加速器链路)标准,旨在实现跨厂商加速器互联,AMD等厂商积极参与其中。Bhattacharjee预计,未来一两年内,加速器互联及CPU与加速器之间的连接将向标准化方向加速演进,超大规模云厂商将是主要推动力。
Q&A
Q1:什么是推理流水线拆分?为什么要这样做?
A:推理流水线拆分是指将AI推理过程分为预填充、解码和智能体执行三个独立阶段,每个阶段由专门的硬件集群负责。这样做的原因是不同阶段的计算特性差异很大,预填充阶段极度依赖算力,解码阶段对内存带宽要求更高,而智能体执行阶段更适合CPU处理。通过拆分,可以让每类硬件专注于最擅长的任务,从而提升整体效率、降低Token处理成本。
Q2:NVLink Fusion和UALink有什么区别?
A:NVLink Fusion是英伟达推出的互联方案,允许英伟达加速器连接第三方CPU,或英伟达CPU连接第三方加速器,但英伟达必须处于连接的一端,仍具有一定封闭性。UALink(超级加速器链路)则是由行业联盟主导的开放标准,目标是实现不同厂商加速器之间的互联,AMD等公司积极参与支持。两者代表了互联领域封闭生态与开放标准之间的竞争路线。
Q3:CPU在AI数据中心里主要承担哪些工作?
A:在AI数据中心中,CPU主要负责难以并行化的任务,包括智能体的工具调用与任务编排、复杂推理循环的控制逻辑、上下文维护以及分支指令路由等。加速器(如GPU或定制ASIC)则专注于矩阵乘法等大规模并行计算。软件层负责在两者之间精确调度任务,确保各类硬件都能发挥最佳效能。
