编者按:以下涉及英伟达性能数据均来自该公司提供的材料,在未经独立验证所用工作负载、网络拓扑、软件栈及竞争基准的情况下,应视为厂商声明。

AI基础设施迎来重要架构转折点

在生成式AI的第一阶段,行业的重心主要在于训练更大规模的模型,网络的角色通常被定义为连接加速器和传输数据。而在实时推理与智能体AI兴起的新时代,这一定位已发生根本性转变。

网络如今已成为计算过程的核心参与者。它负责同步分布式处理器、在不同内存层级之间传递上下文、同步影响运算、管理拥塞、隔离故障,并决定固定功耗能转化为多少有效Token。

英伟达网络业务高级副总裁吉拉德·沙伊纳(Gilad Shainer)的核心观点是:如果网络不是作为计算系统的有机组成部分来设计,企业构建的就不是真正的AI工厂,而只是他反复提及的"服务器农场"。

我们认为这一区别具有重要的战略意义,但也需要辩证看待。英伟达已在市场上构建了最完整的AI网络架构,从系统层面来看明显领先于竞争对手,但其优势并非来自某一款交换机、智能网卡或协议,而是源于GPU、CPU、数据处理单元(DPU)、NVLink、Spectrum-X、ConnectX、BlueField、存储服务、软件框架、机架设计、散热与编排的深度整合。

然而,正是这种极致的协同设计在带来优势的同时,也引发了客户对厂商依赖性的合理担忧。英伟达的回应是,Spectrum-X使用标准以太网协议,支持RoCE,并可运行多种网络操作系统。这一说法有一定依据,但并未完全消解锁定问题。

我们的核心判断是:英伟达可以在接口层保持开放,同时在实现层保持专有,两者并不相互排斥。

网络已成为战略性业务优先事项

网络重要性的提升在theCUBE Research的调研数据中清晰可见。在330名受访者中,94.6%表示网络对实现业务目标的重要性已比两年前"更加重要"或"重要得多"。其中65.2%选择了"重要得多",29.4%选择了"更加重要",仅有4.8%认为没有变化,0.6%认为重要性有所下降。

AI并非一次常规的基础设施升级,而是企业重新审视基础设施乃至网络定位的根本性变革。网络曾经是幕后的基础设施,如今正成为决定应用性能、AI经济效益和业务韧性的关键因素。

在对齐网络与AI赋能方面,受访者指出了以下几大挑战:

传统网络与AI网络的集成(56.4%)、技术技能(52.7%)、网络架构复杂性(52.7%)、预算(45.8%)、延迟问题(30.6%)、安全分段不足(24.5%)、需求约束(23.9%)、工具支持(21.8%)、缺乏可见性(20.6%)、运营开销(18.8%)以及架构孤岛(16.4%)。

这些数据揭示了市场核心矛盾:企业希望获得专用AI基础设施带来的性能优势,但又不愿建立一个难以集成、难以保障安全、难以观测和运营的孤立系统。这也是开放性讨论和AI主权话题备受关注的原因所在。

智能体推理为何改变网络格局

沙伊纳提出了一个值得关注的论断:训练很复杂,但推理更难。

生产级推理——尤其是长上下文推理和智能体推理——往往更为异构、难以预测且更加复杂。训练任务通常是批量同步的,而推理则引入了更多样化的AI流水线:提示处理阶段计算与内存密集;Token解码具有顺序性且对延迟敏感;混合专家模型可能产生大量全对全流量;长上下文扩大了KV缓存需求;智能体工作流可能跨模型、工具、数据库和其他智能体展开;CPU、DPU也各自承担调度、隔离、安全和存储等职责;多用户和应用需要差异化的服务级别管理。

正如沙伊纳所描述的,AI计算节点已从相对简单的GPU机架集合,演变为包含GPU机架、CPU机架、DPU基础设施、上下文存储、接入网络及跨AI工厂互联的异构计算体。

抖动是同步的代价

仅靠传统带宽指标已不足以描述当前AI网络所面临的挑战。在分布式工作负载中,核心问题在于每个参与者能否在严格限定的时间窗口内收到所需数据。在同步操作中,决定整体完成时间的不是最快的处理器,而是最慢的那个。

有效加速器利用率可以简化表达为:有效利用率 = 计算时间 / (计算时间 + 通信时间 + 等待时间)。

网络抖动会增加等待时间,随着集群中加速器数量的增加,至少一个端点或链路出现问题的概率显著上升。因此,即便是轻微的延迟,也可能导致大量昂贵的GPU陷入空转。这也是尾部延迟远比平均延迟更重要的原因所在。

Spectrum-X的实际工作机制

英伟达的基本论点是:传统以太网实现是为其他工作负载类别优化的。Spectrum-X的目标是在保持以太网兼容性的同时,改变交换机与端点之间的工作分工。

交换机负责感知网络状况并分配流量;SuperNIC则控制流量进入网络的速率,并在GPU内存中恢复数据包的所需顺序。两者并非独立组件,而是围绕GPU工作负载特性共同参与一个协同控制环路。

沙伊纳最有力的表述或许是:"这就是英伟达的知识产权,这就是英伟达的实现。"这句话触及了开放性争论的核心。Spectrum-X使用标准以太网协议,但使其差异化的算法、端点协调及系统行为均属英伟达专有工程。

英伟达提供的数据显示,Spectrum-X的交换机与SuperNIC协同架构可带来以下提升:有效带宽提升1.6倍、集合通信带宽提升1.3倍、全归约带宽提升2.2倍、链路故障后全对全带宽提升1.3倍。但实践者在做出决策前,应深入了解完整的基准环境、网络拓扑、工作负载、拥塞模式、软件版本和测试方法,企业买家应要求在自身模型和流量模式上进行可对比的测量验证。

开放、专有,还是两者兼有?

沙伊纳为Spectrum-X的开放性提出了若干具体论据:使用以太网和标准网络协议;英伟达网卡可连接其他以太网交换机;英伟达交换机可连接其他品牌的网卡;英伟达参与了SAI和SONiC的贡献;Spectrum-X硬件支持多种网络操作系统;英伟达与Meta的FBOSS和思科的NX-OS均有合作。

这些都是有实质意义的开放性证明。将Spectrum-X定性为封闭、不可互操作的网络协议,在我们看来并不准确。但将这一论断延伸至整个英伟达系统同样失之偏颇。

对Spectrum-X较为公允的描述应该是:协议层开放、实现层差异化、系统层深度整合。这并非批评,而是力求在不简单重复厂商营销话术的前提下提供平衡的视角。有意义的技术差异化来自于专有实现,而非标准数据包格式本身。标准至关重要,而增量价值则来自于企业应有权保护和收费的深度工程投入。

因此,锁定问题的根源在于将基本互操作性与性能可移植性混为一谈。性能可移植性意味着客户能够替换符合标准的组件,同时保留可接受的吞吐量、延迟、弹性、可观测性、自动化和支持能力——而这正是当前争议的焦点所在。

NVLink不仅仅是一张更快的网络

规模扩展(Scale-up)网络的使命与规模横向扩展(Scale-out)以太网不同。NVLink的目标不仅是连接多个加速器,而是让多个GPU像一个更大的逻辑加速器一样协同工作。这需要远超传统Scale-out架构的带宽、更低的延迟、更高的消息速率,以及网络直接参与计算过程的能力。

其中一项关键技术是网络内计算(in-network computing):NVLink交换机可以在网络内部合并各GPU的中间结果,并将归约后的结果返回给各GPU,从而减少冗余数据传输、降低内存压力和同步开销。

英伟达提供的NVLink规格数据显示:NVLink 6带宽达3.6 TB/s,支持72-GPU NVL域,聚合全对全带宽260 TB/s,聚合全归约带宽520 TB/s。更重要的架构意义在于:Scale-up并非仅仅是带更快端口的Scale-out,它本质上是加速器构建的一部分。

NVLink Fusion拓宽了参与边界,但改变了锁定向量

沙伊纳将NVLink Fusion定位为开放性的另一体现。这一概念允许客户或合作伙伴将自研CPU或XPU连接到英伟达的Scale-up架构,并潜在地使用英伟达机架、散热、网络和存储基础设施的其他组成部分。

我们将Fusion视为对生态系统的真实开放,但这并不意味着NVLink已成为厂商中立的技术。它将依赖的来源从纯粹的英伟达计算栈,转变为以英伟达为中心、允许第三方计算参与的平台。

这或许是一笔合算的交易,但归根结底仍是一种权衡。

上下文存储成为新的基础设施层级

在自回归推理过程中,模型需要保留历史Token的键值信息以避免重复计算注意力。随着上下文长度和用户并发量的增加,KV缓存的内存消耗急剧攀升,过去一年已增长400%。在大规模部署场景下,上下文不能再仅视为本地GPU状态,而必须跨层级进行放置、共享、迁移、复用和删除。

英伟达的STX架构由BlueField(存储处理器)、基于DOCA的存储服务、Spectrum-X(存储网络)和Dynamo(编排层)共同构成,目标是将以太网挂载的闪存变为节点级缓存,提供KV接口和低延迟RDMA,并跨存储层级编排推理上下文。

这是一个重要的架构方向,有望提升GPU利用率并实现上下文复用。但同时,它也进一步扩大了平台依赖的范围。买家应重点关注:KV表示是否具有跨服务系统的可移植性、接口是否开放可独立实现、引入第三方存储平台后的性能变化,以及遥测数据能否导入现有运营平台等关键问题。

经济逻辑:应衡量每个Token的成本,而非交换机的采购价

沙伊纳认为,合适的网络能通过提升固定算力和功耗所能生成的Token数量,从而实现自我回收。

相关经济核算公式大致为:每个接受Token的成本 = 基础设施总成本 / 接受Token数量。其中分子包括年化计算、网络、存储资本,以及电力、冷却、软件与支持、设施、运营人员、停机损失和未充分利用的容能等;分母则是有效生成的Token数量。

网络本身会增加成本,但设计良好的网络理论上可以通过提升加速器利用率、减少停滞、加快故障恢复来扩大分母,从而降低单位Token成本。因此,仅凭采购价选择网络可能是错误的算法,而溢价网络也必须证明其额外成本能换来更大的有效输出提升。

弹性、多平面架构与共封装光学

随着AI工厂规模扩大,故障发生的概率也相应增加。沙伊纳描述了两项相关创新。

其一是从单一多级胖树架构向多平面架构转变,某一平面的故障可被隔离,其余平面继续承载流量,实现优雅降级。

其二是共封装光学(co-packaged optics),即将光学组件集成到交换机芯片附近,而非完全通过传统可插拔模块实现。英伟达的Spectrum-X光子学数据宣称功耗降低5倍、平均中断间隔时间提升10倍、激光器数量减少75%。

但共封装光学同时也改变了服务模式。买家需评估现场可替换性、故障隔离能力、维修流程及光学故障向交换机封装层靠近所带来的连锁影响,并在采用前仔细权衡全生命周期的利弊取舍。

对英伟达批评者的客观评价

行业内存在若干过于简单化的论断,需要加以厘清:

将Spectrum-X定性为"封闭的以太网"——具有误导性,它使用标准以太网协议并支持有意义的软件互操作性;声称"英伟达AI网络栈并不专有"——同样具有误导性,其最高价值的优化和系统集成显然是专有的;"开放标准保证组件可互换"——部分正确,标准提供兼容性,但不保证等效的性能、弹性或支持;"极致协同设计不过是披着创新外衣的锁定"——过于简化,协同设计解决了真实存在的同步、功耗和数据移动问题;"集成系统在经济上总是劣于离散系统"——不成立,集成可减少部署时间、运营风险和单位Token成本;"英伟达的开放性声明消除了切换风险"——不成立,客户仍需评估性能可移植性和退出成本。

英伟达最有力的论点在于系统必须协同设计以应对多样化的工作负载挑战;最薄弱的论点则是倾向于用"开放"来描述架构的每个层级。最公允的解读是:英伟达在能够扩大生态系统参与度的接口处保持开放,同时保护创造性能差异化的实现细节。这是一种理性的策略,同时也是一种可能加深客户依赖的策略——两者可以同时成立。

并非每家企业都需要超大规模AI工厂

英伟达的架构是围绕高要求的分布式工作负载和超大规模AI系统设计的,但许多企业AI应用并不运行在这个规模上。运行检索增强生成、部门级Copilot或中等规模推理的企业,可能并不需要NVL72域、专用上下文存储层或跨数十万加速器的多平面网络。

对于这类企业,传统以太网、云服务或小型集成设备或许能带来更好的经济效益和更低的运营风险。网络变得具有战略意义,不代表每家企业都应当复制超大规模基础设施。过度建设本身也是一种锁定——它将资本和技能绑定在企业可能并不需要的运营模式上。

购买前应进行的关键测试

评估英伟达或任何竞争性AI网络架构的买家,应要求获得五类实证:全栈生产基准测试(以实际模型和工作流验证真实Token成本)、组件替换测试(衡量性能可移植性的实际水平)、拥塞与故障注入测试(验证尾部行为和故障影响范围)、长上下文与KV缓存测试(验证上下文存储架构是否物有所值)、运营与退出测试(评估长期切换成本和人员要求)。

我们的综合判断是,这种方法能将关于"开放性"的抽象争论,转化为可量化的数字。如果替换某一组件导致性能下降2%,依赖程度或许尚在可接受范围;如果有效吞吐量下降30%,客户则已经量化出了离散化的实际代价。在我们看来,这远比争论"开放"的定义更具实际价值。

结论

英伟达比业内大多数公司更早认识到网络将成为AI计算机的组成部分,其对迈络思(Mellanox)的收购将被载入史册,成为最具远见的并购之一。

英伟达的领先地位横跨Scale-up互联、AI优化以太网、端点协调、网络内计算、DPU、上下文存储、机架级工程、散热、光子学和软件编排等多个维度。竞争对手或许能在单点上比肩,但英伟达的优势在于让所有组件作为一个系统协同运作。这正是其领先的根本,也是我们认为其将在企业AI和物理AI等新兴市场继续保持市场份额的原因。

英伟达在以太网、协议和网络操作系统层面的开放性论据是可信的;但将这一论据延伸至整个AI工厂时,说服力则明显不足。系统的最佳性能来自专有实现选择和对英伟达控制技术的深度协调。

客户不应要求一个没有任何专有知识产权的架构——那样的系统很可能会牺牲他们本想获取的大量创新价值。他们应当要求的是:透明的边界、可独立复现的基准测试、基于标准的接口、可导出的遥测数据、数据可移植性以及可信的迁移路径。

更广泛的行业竞争者不会仅凭"开放"二字就能撼动英伟达。它们必须构建出一个在性能、恢复能力、扩展性和运营便捷性上同样表现为完整系统的开放架构。在此之前,我们认为英伟达将继续引领AI网络领域的发展节奏——同时也需持续证明客户能够从其深度集成中获益,而不必为此放弃过多的自主控制权。

行动建议

数据中心运营者应建立AI工厂就绪计划,将网络、计算、存储、电力、散热和设施作为一个整体操作系统来管理,而非相互独立的基础设施域。沙伊纳的核心观点值得重视:AI环境只有在GPU、CPU、DPU和存储保持同步的情况下,才能发挥最大价值;否则,昂贵的加速基础设施可能退化为低效的服务器农场。

目标不应是购买最低价的网络,也不应下意识地排斥集成系统,而是确定在可用功耗范围内,哪种架构能在保持可接受互操作性和退出选项的前提下,持续产出最高的AI输出效能。运营者应要求厂商基于本组织的模型、上下文长度、并发级别和故障场景进行验证,而非单纯依赖厂商自选的基准测试。

Q&A

Q1:Spectrum-X究竟是开放架构还是专有架构?

A:Spectrum-X在协议层使用标准以太网,支持RoCE,并可运行SONiC、FBOSS、NX-OS等多种网络操作系统,具有一定的开放性。但其核心差异化能力——交换机与SuperNIC之间的协同控制算法、流量注入控制及GPU内存集成——均属英伟达专有技术。因此,较为准确的描述是:协议层开放、实现层差异化、系统层深度整合。将其完全定性为开放或封闭都不准确,买家应区分"基本互操作性"与"性能可移植性"这两个不同概念。

Q2:什么是KV缓存,为什么它在AI推理中变得越来越重要?

A:KV缓存(键值缓存)是大语言模型在自回归推理过程中保留历史Token键值信息的机制,目的是避免每生成一个新Token时都重新计算完整的注意力历史。随着上下文长度增加和用户并发量扩大,KV缓存的内存消耗急剧增长,过去一年已上涨400%。在大规模部署中,KV缓存已无法仅靠本地GPU内存承载,需要跨内存层级进行放置、共享和迁移。英伟达通过BlueField、DOCA、Spectrum-X和Dynamo构建了专用的上下文存储层来应对这一挑战,但也因此进一步加深了平台依赖。

Q3:企业在采购AI网络方案之前应该做哪些测试?

A:企业应重点进行五类测试:一是全栈生产基准测试,用自身真实模型和工作流验证Token成本和能效;二是组件替换测试,将交换机或网卡替换为符合标准的第三方产品,量化性能差距;三是拥塞与故障注入测试,观察链路故障和网络热点下的尾部延迟和故障影响范围;四是长上下文与KV缓存测试,验证上下文存储架构是否真正物有所值;五是运营与退出测试,评估遥测数据导出能力、迁移路径和长期切换成本。通过这些测试,可将关于"开放性"的抽象争论转化为可量化的实际数据。

SiliconANGLE