人工智能与数据中心

2026年7月22日,PJM电网因单次输电故障,超过3 GW的数据中心负荷瞬间脱网。北美电力可靠性公司(NERC)早在2024年就调查过同类故障,调查结果显示:没有任何公用事业侧设备主动断开这些负荷,全部操作均由客户侧的保护装置自动完成。如今,相关整定值即将成为强制性备案义务,承受这一冲击的整个机组群,有必要在标准制定过程中发出自己的声音。

本文作者从事数据中心电力系统设计工作。他认为,数据中心行业应主动参与这一议题,而非被动等待标准起草团队给出结论。

当事件发生时,配电室往往毫无预兆——没有爆炸声,没有烟雾。静态开关在不到一个周波的时间内动作,不间断电源(UPS)从电池供电,柴油发电机启动信号发出,整个数据中心继续运行,没有丢失任何一笔事务。就单栋建筑而言,这是一次完美响应,设备完全按照预设执行。

2026年7月22日,数千次这样的"完美响应"同时发生。弗吉尼亚州阿什本地区一条输电线路发生故障并自动退出运行,整个区域的数据中心相继切换至备用电源。据PJM向路透社披露的数据,超过3 GW的负荷从PJM电网消失,约占当时总需求的3%。PJM报告称,电网出现了可测量的频率变化,但整体可靠性未受影响。电网扛住了,但本不应走到这一步。

从发电侧来看,这正是保护方案不协调的典型后果:一次多吉瓦级的瞬时甩负荷,需要发电机组而非数据中心自身来消化。调速器响应、频率上升,已处于最低出力的机组无法进一步降载,电压在突然轻载的网络上攀升,调度人员不得不切除并联电容器组来维持电压。而这一切,在数据中心自身的事件日志中根本不会被记录为故障——这正是数据中心行业长期以来未将此视为问题的根本原因。

相同的故障模式,2024年就已出现

这并非一个新闻周期的故事,而是一个工程问题——因为同样的故障模式两年前就以较小规模发生过,NERC进行了调查并公开了结论。

2024年7月10日晚,东部互联电网一条230千伏线路的避雷器发生故障,导致永久性接地故障,线路最终跳闸锁定。自动重合闸在线路两端各设置了三次重合,因此在82秒内电网共经历了六次连续故障。六次故障均被正确检测和清除,持续时间最短42毫秒,最长66毫秒,受影响区域电压跌至0.25至0.40标幺值。

在那次2024年事件中,约1.5 GW的负荷消失,NERC认定全部为数据中心类负荷。没有任何公用事业侧设备主动切除这些负荷,全部由客户侧的保护装置按照客户自身的整定值自动断开。事后频率上升至60.047赫兹,耗时四分钟才恢复稳定;电压升至1.07标幺值,调度人员不得不切除并联电容器组才将其压回正常范围。

NERC 2024年调查报告中有一段内容值得反复细读:大部分持续性负荷损失——约1.26 GW——并非在初始故障时切除,而是在第三次电压跌落时才脱网,且数小时未能恢复。NERC认为,这源于线路重合闸序列与数据中心内部一种"计数保护方案"之间的相互作用——该方案统计电压扰动次数,通常在一分钟内出现三次后触发跳闸,然后将设施锁定在备用电源状态,直到人工手动恢复并网。

也就是说,2024年,一个对公用事业标准重合闸实践一无所知的计数继电器,将超过一吉瓦的负荷从电网上锁定了数小时。这不是设备过于灵敏的问题,而是两套保护方案从未相互协调的问题——这是保护工程中最古老的失效模式,也是这门学科专门致力于预防的问题。恢复并网同样缺乏协调:静态UPS系统在电压恢复后可迅速返回电网,而柴油旋转机组通常需要人工手动切换。

数据中心:被误解的保护系统

这正是数据中心行业尚未真正内化的认知。在纸面上,数据中心是一个负荷;在物理层面,在故障发生后的毫秒之间,它是一个由数千台保护装置构成的集群——静态转换开关、UPS逻辑、断路器保护单元、发电机控制器,每个园区数以千计,每一台都在持续测量电压,每一台都持有一个整定值,决定何时与电源断开。这不是负荷,这是一个恰好也在计算的保护系统。

而它的构建方式,是任何保护工程师都无法接受的。保护工程的第一课是"配合":按时间和保护范围对设备进行分级,使距故障最近的设备优先动作,上游设备等待;划定保护区域,允许上游设备延迟数个周波,确保整个系统不会同时清除故障。成千上万个近乎相同的并联元件,彼此之间没有时间分级,没有协调的恢复机制——这样的设计不会通过任何审查。这正是当前区域性电网面临的现实。

这并非疏忽,也没有任何单独的整定值是错误的。数据中心保护哲学是在这个行业规模太小、电网根本无法感知的年代写就的。UPS在电压跌落时切换,是因为它存在的意义就是不问任何问题就保障负荷。整定值保守,是因为切换到电池毫无代价,而掉一个机架则代价巨大。后来行业规模化扩张,将参考设计从一个园区复制到另一个,雷同的设计产生了雷同的跳闸行为。

现有记录显示,这已是一种规律性现象,而非偶发事件。NERC的2026年可靠性状况报告统计,仅2025年就有两次数据中心客户侧主动减负荷事件超过1 GW,更多事件超过0.1 GW。报告还指出,德克萨斯州电力可靠性委员会(ERCOT)统计的此类事件数量自2023年以来持续上升,未见改善迹象。NERC的结论是:随着设施规模扩大和集中布局,事件规模将越来越大,并开始威胁频率和电压稳定性。指望这一问题自行解决的人应当注意:基于逆变器的资源曾走过同样的轨迹——从自愿性指南到可靠性导则,最终走向强制性标准。

监管时间表正在加速推进

这一方向比大多数业内人士意识到的更快到来。2026年5月4日,NERC就计算负荷发布了三级"基本行动"预警,要求在2026年8月3日前作出响应。ERCOT的节点运行导则修订请求(NOGRR 282)关于低电压穿越的要求已于2026年7月9日获得德克萨斯州公用事业委员会批准,并于2026年8月1日生效。2026年7月16日,美国联邦能源监管委员会(FERC)要求NERC在2026年12月31日前提交针对计算负荷的新版或修订版可靠性标准,注册准则及第二阶段工作计划的提交截止日期为2027年3月1日。

注册门槛是值得广泛关注的核心数字。NERC当前草案中,计算负荷实体的认定标准为:在60千伏及以上的单一并网点,总连接负荷达到20 MW或以上,且托管1 MW或以上的计算负荷。这并非仅针对超大规模数据中心,许多托管和企业级站点的运营者认为这些规定与自己无关,但实际上它们已被纳入覆盖范围。预警还要求规划人员收集设施的UPS整定值、公共连接点保护装置模型、重新并网时的电压条件和时序,以及双向功率斜坡速率。这些整定值文件,已经在某人的数据请求列表上了。

因此,问题不在于穿越能力是否会成为强制要求,而在于数据中心行业是否自己来定义这些整定值,还是接受别人给出的版本。而"接受版本"已经存在:ERCOT的大型负荷稳定性研究白皮书建议规划人员,在整定值存疑时,将相关设施建模为在电压低于0.75标幺值持续20毫秒或以上时跳闸,且在仿真过程中不恢复。NERC的预警也以一个整定值为0.85标幺值、延时30秒的继电器举例说明同样的逻辑。在缺乏更好数据的情况下,这些数字就是负荷的默认模型,而且是有意设计为偏保守的惩罚性参数。两份文件同时指出,能够证明自身实际能力的设施将按真实情况建模。这个机会现在就存在,无需等待标准正式颁布。

代价是真实的,也是值得的

成本是真实存在的,没有必要回避。实现低电压穿越,意味着允许扰动深入设施内部超过现有设计哲学所允许的范围,向规划人员共享保护整定值,安装故障录波仪并移交记录,在计算设备安装并运行的状态下进行电压双向偏差10%的调试测试,以及与输电运营商和平衡机构建立联合运行规程。其中有些是参数调整,有些是原本不支持此类调整的供应商固件问题,还有些是需要数年准备周期的设计变更。对于部分现有装机来说,诚实的答案是目前确实不具备这种能力——在数据请求中如实说明,远比在规划研究中被发现要好。

协调不能止步于跳闸。NERC同样将有序重新并网标识为下一个待解问题,因为大规模负荷在没有受控斜坡的情况下突然返回,本身就是一次电压和平衡事件。从发电侧来看,受控斜坡的差异,就是一个可以据此调度的、按计划返回的负荷,与一个在机组还在消化其离网影响时突然出现的"惊喜"之间的差异。数据中心欠电网的,不只是一个跳闸整定值,还有一个恢复并网的时序。

以上所有代价,需要与不行动的后果相权衡。每一次吉瓦级事件,都免费为反对数据中心的政治叙事提供弹药,也为每一个本已在争论数据中心电费分摊的州,额外提供了一个叠加在成本争议之上的可靠性论据。这同样动摇了这个行业当前正在努力构建的商业逻辑。FERC已要求六家电网运营商论证或改革大型负荷的并网方式,包括为愿意参与调节的负荷提供专属服务通道,而目前最快的接电路径正是通过这一通道实现的。你无法向一个刚刚目睹你在毫无预警的情况下甩掉3 GW的电网运营商,可信地推销灵活性资源。

穿越能力与灵活性,不是两个相互独立的合规问题。它们是同一套资产、同一份整定值文件、同一套调试流程,只是指向两个方向。不加管控,这套能力是可靠性事件;协调管理并签订合同,它就是快车道通行证。

因此,数据中心行业应当以其本来面目——一个保护系统——来行动。以真实存在的公用事业实践为基准进行整定值分级,从重合闸序列入手,而非孤立地为每栋建筑单独优化。淘汰那些将园区从电网锁定数小时的计数保护方案。针对真实扰动特征进行测试,记录真实存在的穿越能力,向规划人员提交比0.75标幺值更有说服力的数据。

对于输电运营商和平衡机构,同样存在对等的诉求:公开向这些园区供电线路的重合闸实践,因为没有人能对一个从未被告知的序列进行配合整定;在并网研究阶段就主动征询穿越能力和重新并网斜坡速率,而非默认使用0.75标幺值敷衍了事;将经过核实的数据中心穿越曲线,视同发电机出力曲线一样对待——作为经过验证、纳入建模、具有合同约束力的数字,而非一个礼节性的参考。

预警响应截止日期为8月3日,举证责任响应截止日期为8月17日,NERC的标准提交截止日期为12月31日。这个行业已经两次证明,它能在不到一分钟内甩掉数吉瓦的负荷。下一次,应该是因为电网运营商发出了请求,也应该是因为有人为此获得了报酬。

本文作者Shalin Savalia是亚马逊云科技的高级电气工程师,专注于数据中心电力系统领域。他是IEEE高级会员,也是IEEE电力与能源学会及工业应用学会的活跃贡献者。文中观点为作者个人立场,不代表其所在雇主的意见。

Q&A

Q1:2024年NERC调查的数据中心脱网事件具体是怎么发生的?

A:2024年7月10日,东部互联电网一条230千伏线路因避雷器故障导致永久性接地,自动重合闸在82秒内触发了6次连续故障,受影响区域电压跌至0.25至0.40标幺值。约1.5 GW的数据中心负荷随即脱网,但没有任何公用事业侧设备主动断开,全部由数据中心客户侧的保护装置自动完成。其中约1.26 GW并非在初始故障时脱网,而是在第三次电压跌落后触发了"计数保护方案"才脱网,且数小时未能恢复并网。

Q2:NERC对数据中心注册门槛是怎么规定的?哪些设施会被纳入监管?

A:根据NERC当前草案,计算负荷实体的认定标准为:在60千伏及以上的单一并网点,总连接负荷达到20 MW或以上,且托管1 MW或以上的计算负荷。这一门槛并非仅针对超大规模数据中心,许多托管及企业级站点同样在覆盖范围之内。此外,监管机构还要求相关设施提交UPS整定值、保护装置模型、重新并网时序以及功率斜坡速率等详细数据。

Q3:数据中心要满足低电压穿越要求,实际需要做哪些事情?

A:实现低电压穿越需要多个层面的工作:允许电压扰动进入设施内部超过现有设计哲学的范围;向规划人员共享保护整定值;安装故障录波仪并移交记录;在计算设备运行状态下完成电压双向10%偏差的调试测试;并与输电运营商建立联合运行规程。部分要求涉及供应商固件改动,还有部分是需要数年准备周期的设计变更。此外,有序重新并网同样不可或缺,受控的功率斜坡是避免负荷突然大规模返网引发新一轮电压波动的关键。

Power Magazine