美国加州圣克拉拉,2026年9月16日——一个数据中心依靠四大系统运行:服务器、网络、电力和冷却。如今,这四个系统正因承载AI模型训练和运行的芯片机架而同时发生变化。

Meta基础设施副总裁马尼什·卡达基亚(Manish Kadakia)周三在AI基础设施峰会上表示:"这四个系统都在发生剧烈变化。"以往某一系统的升级并不需要另外三个系统随之改变,但现在情况不同了。

服务器:每个机架承载更多算力

卡达基亚说,过去功耗约为10千瓦的机架,正被功耗达100千瓦甚至更高的AI机架所取代。机架是容纳服务器和网络设备的高大机柜,芯片巨头英伟达如今以整机架为单位出货处理器,将数十颗芯片互联组装成一个整体单元交付。

一个功耗100千瓦的机架,同时也会产生100千瓦的热量。而多数建筑物的供电分配和冷却系统,最初设计标准仅为每机架十分之一的功耗。

网络:让芯片彼此互联

AI训练需要增加第二张高速网络,其规模是多数设施此前从未需要过的。前端网络是每个数据中心已经具备的,用于连接计算集群、存储、应用与用户。后端网络则是新增部分,它将处理器彼此连接起来,使其能够协同处理同一个模型。

在模型训练过程中,这些处理器需要持续交换数据。卡达基亚表示,这需要在机器之间铺设"数量庞大"的光纤。

后端网络对延迟的容忍度极低。速度至关重要,因为一颗处理器如果等待另一颗处理器的运算结果,就可能陷入闲置状态。在数千颗造价高昂的芯片规模下,网络延迟会浪费大量计算时间,并拉长整个训练周期。

电力:应对需求的骤然波动

这种协同运作也带来了电力方面的难题。数千颗处理器可能同时提升或降低运行强度,导致电力需求急剧上升或下降。电力系统不仅要应对更高的用电需求,还必须承受这种剧烈波动。

电气设备制造商Legrand销售高级副总裁大卫·斯金斯(David Skeans)表示,AI用电需求的急剧波动,可能与备用系统本应检测的电气故障信号相似。原本为在停电时保障服务器持续运行而设计的设备,如今还必须应对服务器自身引发的突发变化。

冷却:将液体引入芯片

卡达基亚回忆道,过去数据中心机房内甚至不允许工作人员携带水瓶入内。而如今,液体在附着于处理器上的金属板中循环流动,其散热速度远快于空气流动。

这意味着液体如今与昂贵的电子设备近在咫尺。一旦发生泄漏,就可能损坏设备,中断计算任务。

防护涂层公司actnano创始人兼首席执行官泰穆尔·艾哈迈德(Taymur Ahmad)表示,运营商已经在机架周围放置沙袋,并配备传感器和线缆,用于检测液体泄漏。

但问题往往在液体泄漏之前就已经开始。液体化学成分的变化可能引发腐蚀,磨损的部件可能脱落金属颗粒,冷却系统内部还可能滋生微生物。冷却监测公司Omen AI商业化副总裁康纳·汉迪(Connor Handy)表示,这些问题都可能堵塞管路,或降低系统的散热能力。该公司专门监测冷却液,以便及早发现预警信号。

这一转变也改变了维护数据中心运转所需的人员构成。艾哈迈德表示,电工和网络技术人员可能越来越多地需要与管道工并肩工作。

运维:在保持系统运转的同时完成升级

卡达基亚表示,新型AI硬件可能每隔几个月就更新一代,带来不同的电力、冷却和维修需求。但承载这些硬件的建筑物无法以同样的速度改变。

运营商必须在为新机架腾出空间的同时,继续维持旧设备的运行。风冷系统和液冷系统将不得不并存,这就需要既能维护风冷、又能维护液冷系统的技术人员。

与此同时,维修工作正变得更加困难,而延误的代价也在不断上升。卡达基亚说,技术人员有时在不完全清楚具体故障原因的情况下就更换零部件。设备下线会导致昂贵的处理器闲置,还可能延长模型训练所需的时间。

因此,每一次硬件升级都意味着一个更重大的决策:周边基础设施需要改变多少?成本将是多少?又该如何在不中断现有计算任务的前提下推进这项工作?

Q&A

Q1:为什么AI机架的功耗会大幅超过传统机架?

A:因为AI芯片需要大量算力协同工作,英伟达等厂商现在以整机架为单位出货处理器,将数十颗芯片互联安装,导致单机架功耗从约10千瓦跃升至100千瓦甚至更高,远超传统建筑的设计标准。

Q2:数据中心为什么需要额外增加后端网络?

A:因为AI训练需要处理器之间持续交换数据以协同处理同一模型,前端网络只负责连接计算集群与用户,而后端网络专门用于处理器互联,且对延迟极为敏感,直接影响训练效率。

Q3:液冷技术给数据中心带来了哪些新风险?

A:液冷虽然散热效率更高,但液体泄漏可能损坏昂贵设备并中断计算;此外液体化学成分变化可能引发腐蚀,部件磨损或微生物滋生也可能堵塞管路,因此需要专门的传感器和监测系统来预警。

Broadband Breakfast