AI基础设施正以前所未有的速度扩张。Google目前每月处理的AI Token数量超过3千万亿个,相较于2025年5月至2026年5月,算力需求增长了七倍。要满足这样的增长速度,需要在能源效率和电力输送方面进行创新。
Google高级技术创新副总裁Tom Garvens在9月21日至23日于休斯顿举行的Data Center World Power 2026大会主题演讲中阐述了这一挑战。他描述了Google在扩展AI方面采取的全栈式方法,将数据中心定位为稳定本地电网的积极合作伙伴。
将备用电源转变为电网服务
为弥合AI快速部署与公用事业容量扩建通常需要多年时间之间的速度差距,Google开发了多种能源策略:将备用资产转化为支持电网的资源,简化高峰需求期间的运营,让负载调整更加智能化,并防止破坏性的电力波动——同时支持公用事业的韧性。
除这些策略外,Google还在审视并重新设计整个AI数据中心生态系统——从芯片到公用事业环节。这包括优化液冷、低压直流(LVDC)架构、智能算法和设施设计。这项工作的核心支柱之一,是通过开放计算项目(OCP)等社区发布标准化的电力和设施技术规范,使整个行业能够构建可互操作、高效且可持续的基础设施。
“Google在AI领域实现了紧密的垂直整合,同时与能源供应商建立了密切合作关系,”Garvens表示。“我们自主开发和设计数据中心、芯片、服务器和机架设计。通过掌控整个硬件和软件堆栈,我们可以将这些要素协同优化,实现可持续性和能源效率。”
以吉瓦级规模驱动AI
Google正与公用事业公司共同投资以增加电网容量。这种协助至关重要,因为一个吉瓦级数据中心园区可能包含数十万个互联芯片,运行单一工作负载。Google的方法是双管齐下:与公用事业合作伙伴协作以简化电力输送,同时调整自身的硬件和软件,使其更加对电网友好。
“公用事业公司正在设定不同的要求,我们必须证明自己能够满足这些要求,”Garvens指出。“Google、Meta、微软和英伟达已经联合起来,共同制定了一套接口规范,规定公用事业公司与超大规模企业之间如何进行对接。”
电池储能系统(BESS)已成为Google园区设计中的关键组成部分,用于现场储能以及缓冲快速波动的工作负载。缓冲功能能够平滑电力和电压的转换。备用发电机仍在使用,但柴油发电机难以适应1吉瓦及以上规模的园区。BESS越来越多地被用于提供备用电力,并通过与公用事业公司签订的需求响应协议来实现削峰。
“当高峰需求超出我们现有电力供应时,我们可以从本地储能中获取,”Garvens解释道。
Google没有在容量饱和的市场中争夺有限的资源,而是一直在寻找拥有充足土地和可用电力的偏远地点。他表示,公司也在考虑在一些小城镇开发园区,在这些地方数据中心将成为主要的雇主。
另一项设计变化是:Google已经从集中式不间断电源(UPS)系统转向机架级电池备份,运行电压约为54伏直流。省去额外的交流-直流-交流转换步骤,可带来约1.5%的效率提升。
“我们所有的电力转换都在机架顶部完成,我们将交流电降至54伏,然后通过直流电为机架供电;我们的电池备份也运行在这个电压下,”Garvens说。
机架内部:今日54伏直流,明日800伏直流
Google在芯片、机架和设施层面都进行了改进,并辅以软件支持,能够混合调度工作负载,从而平滑整体负载并使其更具可预测性。
机架密度仍然是一大挑战。路线图预计,未来一到两年内单个机架功率将接近1兆瓦。这要求至少对机架内发热较高的部件采用液冷。
在较低电压下输送所需电流,需要用到明显更多铜材的母线和电缆。这就要求提高配电电压。Google正在逐步向800伏直流配电迈进,预计这一过渡还需要几年时间才能成熟。
与此同时,Google在机架旁配置了“侧柜”——用于容纳线缆和配电设备的相邻配电柜,从而将机架空间留给高密度服务器。这样做的代价是占用更多地面空间。当800伏直流普及后,这些侧柜可以转换为额外的AI服务器机架。
“我们正与业界合作,推动固态变压器技术走向成熟,”Garvens表示。“我们也在持续改进电源使用效率(PUE)。我们永远无法达到1.0,但我们一直在挑战自我,尽可能接近这个数值。”
工作负载迁移与节水型冷却
由于运营着数十座数据中心,并且还有更多正在建设中,Google可以灵活地决定在何处运行工作负载。Garvens举了一个例子:
“如果俄亥俄州出现热浪,而我们正在那里运行一个大型工作负载,只要有足够的提前预警,我们就可以根据协议关闭某些工作负载,或者将其迁移到别处,如果这些负载是关键性的,”他说。“我们拥有一个可以灵活调配的资源组合。”
水资源战略是另一个重点领域。公司正在投资闭环冷却系统——即工作流体保持在系统内部、补水需求降至最低的密封液冷回路。这标志着从以往大量耗水设计的转变。这里并没有单一的解决方案;根据海拔、湿度、地下水位、干旱风险和社区需求等条件的不同,Google会与合作伙伴共同确定合适的电力容量和最佳冷却设计。
“我们与合作伙伴共同评估可用资源,确定我们能够获取的合理电力量,以及最适合的用水方式或闭环设计,”Garvens指出。
紧跟芯片路线图的步伐
每一代新芯片往往会消耗更多电力,而且每年都会推出多款新芯片。
“我们拥有的最宝贵资源就是瓦特:你永远不希望浪费任何一瓦特,”Garvens说。“因此,尽可能让我们的数据中心和设计在这些路线图能够预见的范围内保持精简高效,这也是为什么我们与芯片及GPU设计团队的合作如此关键。”
Q&A
Q1:Google每月处理的AI Token数量有多少?
A:Google目前每月处理的AI Token数量超过3千万亿个,相较于2025年5月至2026年5月,算力需求增长了七倍。
Q2:Google如何应对数据中心的电力供应挑战?
A:Google通过与公用事业公司合作、部署电池储能系统、采用机架级电池备份、推进800伏直流配电等方式,将备用电源转化为电网支持资源,同时优化芯片、机架和设施设计以提升能源效率。
Q3:Google在数据中心冷却方面采取了什么措施?
A:Google正在投资闭环冷却系统,减少补水需求,并根据海拔、湿度、地下水位、干旱风险等条件与合作伙伴共同确定合适的电力容量和冷却设计,以实现节水型运营。
