AI基础设施建设的第一阶段以争夺GPU为主旋律,而下一阶段的核心,将是这些GPU到位之后发生的事情。
随着AI基础设施建设持续提速,将数以千计乃至数十万计的GPU、交换机、存储系统和软件组件整合为一台高效运转的整体机器,正成为行业面临的核心挑战。这一主流趋势,将传统网络推向了AI基础设施叙事的中心。
在接受独家采访时,英伟达与思科的网络业务高管共同阐述了"思科安全AI工厂(Cisco Secure AI Factory)"扩展版背后的架构逻辑与经济模型。双方携手生态伙伴,正将该系统推向液冷机架级规模,同时将英伟达的加速计算能力、Spectrum-X架构与思科的网络、软件、管理及企业运营经验深度融合。
此次思科与英伟达的联合公告意义重大,但更深层的信号在于:AI基础设施正从GPU采购周期迈入AI生产周期,而英伟达正日益主导整个AI基础设施工厂的架构走向。
从GPU稀缺到Token生产
第一波AI基础设施浪潮,主要以GPU数量来衡量。而新兴的生产时代需要一套全新的度量体系:首个Token的生成时间、每秒Token产出量、每瓦特Token产出量、每投入美元的Token产出量、系统可用性,以及最终的持续Token生产能力。
AI工厂绝非简单堆砌加速器的数据中心,而是由各组件协同运作的大规模分布式计算机。这正是网络角色发生转变的根本原因。传统意义上,网络负责连接计算机;而在AI工厂中,网络越来越多地参与"创造"计算机本身。参与分布式训练、后训练和推理的数以千计的GPU,必须与彼此、与存储、与模型、与智能体、与工具以及企业数据之间保持日益确定性的通信,这使得网络本身成为AI生产架构不可分割的组成部分。
Spectrum-X融入思科运营体系
英伟达的Gilad Shainer点明了此次合作最具战略价值的核心:思科并非简单地接入英伟达的基础设施,而是将英伟达针对AI优化的网络技术,引入企业界早已熟悉的运营环境。
"Spectrum-X内置于思科系统,意味着现在有了一套AI优化的网络架构,并且配备了企业界已经在运行的运营模型。"
这一组合之所以关键,在于英伟达专为AI工作负载打造了Spectrum-X以太网架构,而思科则拥有庞大的企业网络覆盖、操作系统、管理基础设施,以及数十年连接企业应用与数据的丰富经验。
两者的结合,有望在传统企业网络与新兴AI工厂之间架起一座桥梁。
随着AI从训练向推理加速演进,这一点尤为重要。企业AI需要访问存储在数据库、存储系统、ERP环境、应用程序和现有网络中的专有数据,智能不能被孤立在GPU集群内部,必须与企业打通连接。因此,思科的战略机遇远不止于向AI集群销售网络设备,更在于成为连接英伟达加速计算架构与周边企业基础设施及数据的重要桥梁。对英伟达而言,这一合作关系则有望将AI工厂架构的触角延伸至主流企业计算的深处。
AI工厂是一个五层体系
英伟达的Marc Hamilton为这一故事补充了另一块重要拼图:AI工厂无法通过将计算、网络和存储视为独立采购决策来实现优化。
Hamilton将AI工厂描述为一个"五层蛋糕",涵盖物理数据中心、芯片、AI基础设施、模型和应用程序。
"如果不能端到端地构建整个体系,并拥有一个可以测试每一个应用、每一个模型、每一种网络架构的平台,优化几乎无从实现。"
这正是英伟达参考架构具有战略价值的原因所在。传统企业模式中,服务器团队采购服务器、网络团队采购网络、存储团队采购存储,这套逻辑并不适用于AI工厂。系统必须端到端地协同运作。
例如,跨数千块GPU运行的工作负载可能需要穿越多个网络域进行通信。英伟达的集合通信库(Collective Communication Library)软件可以协调通过NVLink相连的系统内GPU、跨Spectrum-X扩展网络的GPU,以及最终访问智能体、工具或企业数据的前端网络。
单个应用程序并不关心这些边界在哪里,它只关心系统是否正常运行。这意味着基础设施越来越需要作为一台巨型分布式计算机来设计、测试、验证和运营。英伟达的云合作伙伴参考架构,以及思科的验证设计与服务,旨在让这一架构具备可复制性,而非迫使每位客户都去工程化一台定制AI超级计算机。
思科将AI工厂推向机架级规模
第三项重大进展体现在物理规模上。思科的Will Eatherton表示,公司正通过与超微(Supermicro)的合作,将解决方案从网络层面扩展至完整的机架级计算。
"我们正在向计算领域更广泛地延伸。我们与超微建立了合作关系,带来的是完整的机架级方案——液冷设计,从Blackwell起步,向Vera Rubin演进,覆盖HGX和MGX两种形态。"
Eatherton表示,完整解决方案将于9月开放订购。"安全AI工厂正走向机架级规模。"
这句话的分量远超字面。机架级架构标志着一种思维转变:从将服务器视为基本构建单元,转向将整个机架乃至机架集群视为计算系统。思科可以为这些系统提供网络、软件、支持、验证基础设施和管理能力,而英伟达则提供底层加速计算架构。其结果,是将历史上看似定制化超算工程的事情,转变为更接近可复制工业基础设施的形态。
纵向扩展、横向扩展、跨域扩展
有一种框架有助于理解这一架构的走向。
纵向扩展(Scale up)在机架内部打造日益强大的计算域;横向扩展(Scale out)将这些机架和GPU连接成大规模AI超级计算机;而下一个前沿则是跨域扩展(Scale across)——将AI工厂与存储、企业网络、其他数据中心、新型云服务商、智能体、应用程序,以及最终的专有数据相连接,才能真正释放企业AI的价值。
这正是思科与英伟达合作关系最令人瞩目之处。思科Silicon One、英伟达Spectrum-X、NX-OS与SONiC、Nexus One以及思科云控制(Cisco Cloud Control),共同构成了一套从AI后端延伸至企业前端的架构拼图。
目标不仅仅是更快地传输数据包,而是让一个极其复杂的分布式AI系统,在运营层面表现得如同一个统一的基础设施平台。
首个Token还不够
AI基础设施竞赛中还有一个容易被忽视的维度,那就是部署之后。跑出第一个Token固然重要,但AI工厂是有生命的系统——模型在变,软件在变,固件在变,工作负载在变,集群在扩展,故障在发生,性能需要持续优化。这催生了一个围绕监控、可用性、升级和全生命周期管理的全新运营战场。
思科将数十年企业网络运营经验带入这一领域,英伟达则提供围绕加速计算系统的软件与参考架构。这也揭示了一个重要的经济学区别:首个Token的生成时间决定了部署竞赛的胜负,而持续的Token生产能力才决定了投资回报。一座价值十亿美元的AI工厂若长期低于潜在利用率运行,意味着巨量的产能被白白搁置。
网络、可观测性与运营,因此与AI经济学直接挂钩。
英伟达更宏大的布局
对英伟达而言,此次公告所揭示的意义,远不止于又一次生态合作。英伟达赢得生成式AI第一阶段的关键,在于将加速计算确立为现代AI的基础。而其下一个机遇更为宏大。
随着AI基础设施演进为工厂形态,英伟达有望日益主导整个生产体系的架构——从加速计算与NVLink,到Spectrum-X、软件、参考架构、模型及其周边生态。
思科为这一架构带来了尤为珍贵的东西:通往已安装企业基础设施的桥梁。这意味着,下一个竞争命题或许不再只是谁拥有最快的GPU,而是谁能定义将数百万块GPU转化为可靠、持续运转的AI生产系统的架构。
思科与英伟达正在共同论证:网络是这个答案的核心所在。数十年来,网络连接着计算机;在AI工厂时代,网络正在成为计算机本身的一部分。这或许将使网络成为AI基础设施建设下一阶段中,最举足轻重、最具价值的层次之一。
结语:传统网络与AI网络的融合,正在发生。
Q&A
Q1:思科安全AI工厂(Cisco Secure AI Factory)是什么?它解决了什么问题?
A:思科安全AI工厂是思科与英伟达联合推出的AI基础设施解决方案,将英伟达的Spectrum-X网络架构与思科的企业网络、软件和管理能力整合在一起。它解决的核心问题是:如何将数以千计的GPU、存储和网络组件整合为一台协同运转的整体机器,同时让企业能够用已有的运营模式来管理这套系统。
Q2:Spectrum-X和普通以太网有什么区别?为什么AI工厂需要它?
A:Spectrum-X是英伟达专为AI工作负载设计的以太网架构,针对大规模GPU间的分布式通信进行了优化,能够提供更确定性的网络性能。普通以太网并非为GPU集群内部高频、低延迟的通信模式而设计。AI工厂中,数千块GPU需要实时协同完成训练和推理任务,网络性能的波动会直接影响整体计算效率,因此需要专门优化的网络架构。
Q3:AI工厂的"机架级"部署和传统服务器部署有什么不同?
A:传统部署以单台服务器为基本单元,各团队分别采购服务器、网络和存储。机架级部署则将整个机架作为一个完整的计算系统来设计和交付,包含液冷散热、GPU计算节点、网络和存储的统一集成与验证。思科与超微合作推出的机架级方案,目标是让企业像采购标准化工业设备一样部署AI基础设施,而非每次都重新工程化一套定制超算系统。
