科技行业向来热衷于制造流行词汇,因此围绕AI基础设施策略涌现出一批术语也就不足为奇了。集中式AI、分布式AI和边缘AI乍看之下含义各异,但在实际应用中,它们的定义存在重叠,彼此间的界限也常常变得模糊。

本文旨在厘清这几个术语通常代表的含义、它们之间如何交织,以及这对数据中心和企业部署具有哪些实际意义。

集中式AI:单一站点,多个节点

集中式AI指的是将AI工作负载部署在单一地点。在现代实践中,这通常意味着在单个数据中心(或云区域)内运行一组服务器集群。尽管“集中式”一词可能暗示着单台机器,但如今大规模的AI工作负载,尤其是大语言模型的训练与推理服务,由于对算力和内存的需求极高,几乎总是需要跨越多台服务器或多块GPU来完成。

运行在单个工作站上的本地或设备端模型确实存在,但在企业场景中属于例外情况。简而言之,集中式AI是将资源和运营集中于一处设施(或一个区域),即便这些工作负载会分散在该站点内的众多节点上运行。

分布式AI:从设计之初就面向多站点

分布式AI将AI工作负载分散部署到多台服务器上,且往往跨越多个站点。这正是与集中式AI容易产生混淆之处:两者都可能涉及多节点集群。二者的区别主要在于地理分布和站点数量。

在企业场景中,分布式AI通常意味着跨多个独立的数据中心或云区域进行部署,以服务不同地区的用户群体、提升系统韧性、降低地理位置分散用户的延迟,或满足监管与数据本地化要求。其核心理念是从设计之初就构建多站点布局。

边缘AI:在用户与数据附近部署算力

边缘AI将AI工作负载部署在靠近网络边缘的位置——即贴近终端用户、设备或本地数据源,以降低延迟、削减数据传输成本,或避免与核心数据中心之间的往返通信。企业实现边缘AI的方式有多种:在用户附近建设小型边缘数据中心、部署用于推理的区域性或微型数据中心,或将模型直接推送至终端设备上。

根据具体部署方式的不同,这些架构也可能同时被归类为分布式AI,这进一步凸显了相关术语之间的重叠。可以将“边缘”理解为一种位置属性(靠近用户或数据),而将“分布式”理解为一种拓扑属性(多站点)。

这些方案的真正区别所在

由于这些术语存在重叠,聚焦于它们在实践中的真正差异会更有帮助:

站点的数量与位置

集中式AI通常使用单一数据中心或云区域。分布式AI跨越多个设施,往往分布在不同区域或国家。边缘AI也可能涉及多个站点,尤其是在使用微型或区域性数据中心,或采用设备端部署时。

性能与成本目标

分布式和边缘策略通常致力于通过将算力部署在更靠近用户和数据的位置,来实现更低的延迟、本地化处理或更低的出口流量成本。集中式AI则更注重资源整合、容量池化以及运营简便性,而非地理位置上的优化。

实施与运维

由于所有资源都集中在一处,集中式AI通常更易于搭建、管理和监控。而分布式和边缘架构则会增加复杂性,涉及编排、可观测性、数据同步、故障转移设计以及合规性等多个方面。

应当如何做出选择

与其纠结于名称标签,不如将基础设施与实际目标和约束条件相匹配。如果企业只拥有单一设施或区域,且需要快速搭建能力,集中式方案提供了一条直接的路径。如果企业需要服务多个地理区域的用户、必须满足数据本地化要求,或希望降低延迟和出口流量成本,那么分布式布局更为合理。而在超低延迟、间歇性连接或带宽受限占主导地位的场景中,边缘部署——可能包括设备端推理——将极具吸引力。

许多企业最终会将这些模式结合使用:采用集中式训练加分布式或边缘推理的组合,并根据工作负载的重要性、延迟预算和成本进行调整。

Q&A

Q1:集中式AI、分布式AI和边缘AI有什么核心区别?

A:三者的核心区别主要体现在站点数量与位置上。集中式AI通常使用单一数据中心或云区域;分布式AI跨越多个设施,常分布在不同区域或国家;边缘AI则将算力部署在靠近用户或数据源的位置,可能涉及微型或区域性数据中心。

Q2:企业应该如何选择合适的AI部署架构?

A:企业应根据自身目标和约束条件来选择。如果只有单一设施且需要快速搭建能力,集中式方案更简单直接;如果需服务多地用户、满足数据本地化要求或降低延迟成本,分布式布局更合适;如果对超低延迟、间歇连接或带宽有严格要求,边缘部署(包括设备端推理)会更具优势。

Q3:企业可以同时使用多种AI部署模式吗?

A:可以。许多企业最终会将这些模式结合使用,例如采用集中式训练加上分布式或边缘推理的组合方式,并根据工作负载的重要性、延迟预算和成本等因素进行灵活调整。

DataCenterKnowledge