AI基础设施建设的第一阶段以争夺GPU为主旋律,而下一阶段的核心,将是这些GPU到位之后发生的事情。

随着AI基础设施建设持续提速,如何将数以千计乃至数十万计的GPU、交换机、存储系统和软件组件整合为一台高效运转的整体机器,正成为行业面临的核心挑战。这一主流趋势,将传统网络推向了AI基础设施叙事的中心。

在接受独家采访时,英伟达与思科的网络业务高管共同阐述了"思科安全AI工厂(Cisco Secure AI Factory)"扩展版背后的架构逻辑与经济模型。双方携手生态伙伴,正将该系统推向液冷机架级规模,同时将英伟达的加速计算能力、Spectrum-X架构与思科的网络、软件、管理及企业运营经验深度融合。

此次思科与英伟达的联合公告意义重大,但更深层的信号在于:AI基础设施正从GPU采购周期迈入AI生产周期,而英伟达正日益主导整个AI基础设施工厂的架构走向。

从GPU稀缺到Token生产

第一波AI基础设施浪潮,主要以GPU数量来衡量。而新兴的生产时代需要一套全新的度量体系:首个Token的生成时间、每秒Token产出量、每瓦特Token产出量、每投入美元的Token产出量、系统可用性,以及最终的持续Token生产能力。

AI工厂并非简单地将加速器堆满数据中心,而是由众多组件协同运作的大型分布式计算机。这正是网络角色发生转变的根本原因。过去,网络的职能是连接计算机;而在AI工厂中,网络越来越多地参与"构建"计算机本身。参与分布式训练、后训练和推理的数千块GPU,必须与彼此、与存储、与模型、与智能体、与工具以及企业数据之间保持日益确定性的通信,这使得网络本身成为AI生产架构不可分割的组成部分。

Spectrum-X融入思科运营体系

英伟达的Gilad Shainer点出了此次合作最具战略价值的一点:思科并非简单地接入英伟达的基础设施,而是将英伟达针对AI优化的网络技术,引入企业界已熟悉的运营环境。

"Spectrum-X进入思科系统,意味着现在有了一套AI优化的网络架构,并且配套了企业界已在运行的运营模式。"

这一组合之所以关键,在于英伟达专为AI工作负载打造了Spectrum-X以太网架构,而思科则拥有庞大的企业网络覆盖、操作系统、管理基础设施,以及数十年连接企业应用与数据的丰富经验。

两者结合,有望在传统企业网络与新兴AI工厂之间架起一座桥梁。

随着AI从训练转向推理,这一点尤为重要。企业AI需要访问存储在数据库、存储系统、ERP环境、应用程序和现有网络中的专有数据,智能不能被孤立在GPU集群内部,必须与企业打通。因此,思科的战略机遇远不止于向AI集群销售网络设备,更在于成为连接英伟达加速计算架构与周边企业基础设施及数据的重要桥梁。对英伟达而言,这一合作关系则有望将AI工厂架构的触角延伸至主流企业计算的深处。

AI工厂是一个五层系统

英伟达的Marc Hamilton提供了另一个重要视角:AI工厂无法通过将计算、网络和存储作为独立采购决策来实现优化。

Hamilton将AI工厂描述为一个"五层蛋糕",涵盖物理数据中心、芯片、AI基础设施、模型和应用程序。

"如果你不能端到端地构建整个系统,并拥有一个可以测试每一个应用、每一个模型、每一种网络架构的平台,优化几乎无从谈起。"

这正是英伟达参考架构具有战略价值的原因所在。传统企业模式中,服务器团队采购服务器、网络团队采购网络、存储团队采购存储,这套逻辑并不适用于AI工厂。

系统必须端到端地协同运作。例如,跨数千块GPU运行的工作负载可能需要穿越多个网络域进行通信。英伟达的集合通信库(Collective Communication Library)软件可以协调通过NVLink相连的系统内GPU、跨Spectrum-X扩展网络的GPU,以及最终访问智能体、工具或企业数据的前端网络。

单个应用程序并不关心这些边界在哪里,它只关心系统是否正常运行。这意味着基础设施越来越需要作为一台巨型分布式计算机来设计、测试、验证和运营。

英伟达的云合作伙伴参考架构,以及思科的验证设计与服务,旨在让这一架构具备可复制性,而非迫使每位客户都去工程化一台定制AI超级计算机。

思科将AI工厂推向机架级

第三项重大进展体现在物理规模上。思科的Will Eatherton表示,公司正通过与超微(Supermicro)的合作,将解决方案从网络扩展至完整的机架级计算。

"我们正在向计算领域拓展,为此与超微建立了合作关系。我们带来的是完整的机架级方案——液冷、从Blackwell起步、向Vera Rubin演进,覆盖HGX和MGX形态。"

Eatherton表示,完整解决方案将于9月开放订购。"安全AI工厂正走向机架级。"

这句话的分量远超字面。机架级架构标志着一种思维转变:从以服务器为基本构建单元,转向将整个机架乃至机架集群视为计算系统。

思科可以为这些系统提供网络、软件、支持、验证基础设施和管理能力,而英伟达则提供底层加速计算架构。其目标是将历史上看似定制化超算工程的事情,转变为更接近可复制工业基础设施的形态。

纵向扩展、横向扩展、跨域扩展

有一个框架有助于理解这一架构的走向。

纵向扩展(Scale up)在机架内部打造日益强大的计算域;横向扩展(Scale out)将这些机架和GPU连接成大规模AI超级计算机;而下一个前沿则是跨域扩展(Scale across)——将AI工厂与存储、企业网络、其他数据中心、新型云服务商、智能体、应用程序,以及最终的专有数据相连接,从而释放企业AI的真正价值。

这正是思科与英伟达合作关系最令人瞩目之处。思科Silicon One、英伟达Spectrum-X、NX-OS与SONiC、Nexus One以及思科云控制(Cisco Cloud Control),共同构成了一套从AI后端延伸至企业前端的架构拼图。

目标不仅仅是更快地传输数据包,而是让一个极其复杂的分布式AI系统,在运营层面表现得像一个统一的基础设施平台。

首个Token还不够

AI基础设施竞赛中还有一个容易被忽视的维度,那就是部署之后。跑出第一个Token固然重要,但AI工厂是有生命的系统。

模型会更新,软件会迭代,固件会升级,工作负载会变化,集群会扩展,故障会发生,性能需要持续优化。这在监控、可用性、升级和生命周期管理层面催生了全新的运营战场。

思科将数十年企业网络运营经验带入这一领域,英伟达则提供围绕加速计算系统的软件与参考架构。这揭示了一个重要的经济学区分:首个Token的生成时间决定了部署竞赛的胜负,而持续的Token生产能力则决定了投资回报。一座价值十亿美元的AI工厂若长期低于潜在利用率运行,意味着巨量的产能被白白搁置。

网络、可观测性与运营,因此与AI经济学直接挂钩。

英伟达的更大图谋

对英伟达而言,此次公告所揭示的意义远不止于又一次生态合作。英伟达赢得生成式AI第一阶段的关键,在于将加速计算确立为现代AI的基础。而其下一个机遇更为宏大。

随着AI基础设施演进为工厂形态,英伟达有望日益主导整个生产系统的架构——从加速计算与NVLink,到Spectrum-X、软件、参考架构、模型及其周边生态。

思科为这一架构带来了极具价值的东西:通往已安装企业基础设施的桥梁。这意味着下一个竞争命题,或许不再只是谁拥有最快的GPU,而是谁能定义将数百万块GPU转化为可靠、持续运转的AI生产系统的架构。

思科与英伟达正在共同论证:网络是这个答案的核心所在。数十年来,网络连接计算机;在AI工厂时代,网络正在成为计算机本身的一部分。这或许将使网络成为AI基础设施建设下一阶段中最具决定性价值的层次之一。

结语:传统网络与AI网络正在走向融合。

Q&A

Q1:思科安全AI工厂(Cisco Secure AI Factory)是什么?它能解决什么问题?

A:思科安全AI工厂是思科与英伟达联合推出的AI基础设施解决方案,将英伟达的Spectrum-X网络架构与思科的企业网络、软件和管理能力整合在一起。它的核心价值在于帮助企业将数千块GPU、存储和网络组件整合为一套可统一运营的系统,解决AI工厂从GPU采购转向规模化生产过程中的架构和运营挑战。

Q2:Spectrum-X和普通以太网有什么区别?为什么AI工厂需要它?

A:Spectrum-X是英伟达专为AI工作负载设计的以太网架构,相比普通以太网,它针对分布式训练、推理等场景进行了优化,能提供更具确定性的网络性能。在AI工厂中,数千块GPU需要高频、低延迟地相互通信,普通网络难以满足这种需求,而Spectrum-X可以保障GPU集群的协同效率,直接影响Token生产速度和整体投资回报。

Q3:思科与英伟达合作的机架级AI工厂方案什么时候可以购买?支持哪些硬件平台?

A:根据思科高管Will Eatherton的表述,完整的机架级解决方案将于2024年9月开放订购。该方案采用液冷设计,从英伟达Blackwell平台起步,后续将演进至Vera Rubin,支持HGX和MGX两种形态,并通过与超微(Supermicro)的合作提供完整的机架级计算能力。

SiliconANGLE