要点摘要:
随着电压升高,电气故障、电弧闪光和热失控事件增多,人员安全至关重要。
热插拔电路、固态断路器等保护组件有助于在管理更高电流的同时保障人员安全。
数据中心正在借鉴汽车行业的芯片可靠性技术,但800VDC标准和协议尚未明确定义。
现代数据中心对电力的需求丝毫没有放缓的迹象,因为它要支撑整个社会日益扩展的各类AI任务。单个机架的功率正在逼近1兆瓦,这凸显了从电源到芯片实现更高效电力传输的必要性。一种潜在的解决方案是将传统的48V直流机架内配电系统替换为800V直流系统。
转向更高电压带来了诸多好处。“800V的功率级数更少,损耗更低,整体架构更高效,宽禁带类型的技术对这些数据中心来说是一大优势,”是德科技电源电子设计软件产品经理Steven Lee表示。“他们会使用能获得的最佳半导体材料,因为这类材料的损耗更低,耐热性也更高。与传统硅材料相比,氮化镓(GaN)在更高温度下不会失效。”
然而,在更高电压下,安全性和可靠性方面的挑战会增加,尤其是在工作人员为避免停机而对服务器托盘进行热插拔操作时。“在一个机架处于满负荷运行的数据中心里,当你需要更换主板的一部分时,你最不希望做的就是中断运行,”英飞凌电源与传感器系统事业部总裁Adam White表示。“你要确保拔出主板的人不会陷入危险之中。随着电压和电流大幅上升,这一点在未来会变得更加关键。”
48V与800V截然不同。“更高的电压危险得多。我认为48V不会致人死亡,但800V可能会,”Lee说。“他们设计数据中心的方式是,如果某个区域断电,希望能够进行热插拔,并给其他部分供电以满足需求。这与电网的运作方式相同。如果电网的一部分出现故障,他们希望从电网的另一部分调配电力,以确保客户用电不受影响。而在800V的情况下,如果热插拔操作不当,可能会产生电弧,发出很大的爆裂声,接着出现火花,然后可能会有东西爆炸或烧毁,所以在高电压环境下工作确实存在安全隐患。”
隔离和保护机制(如热插拔电路)变得至关重要。“当你需要取出一个托盘,然后再放回去时,热插拔电路能让你在维护过程中安全地移除和插入托盘,从而起到保护作用,”德州仪器计算电源技术专家Pradeep Shenoy表示。“当电压升高时,你需要牢记这一点。这在电动汽车这类应用中是不存在的,是数据中心特有的问题。挑战在于如何以安全的方式从48V过渡到800V。”
从安全角度进行架构设计和布局,意味着工程师必须在高压系统和低压系统之间保持最小安全距离,这是数据中心整体设计需要考虑的因素。
随着电压升高,系统也变得更加复杂。“这包括用于检测运行状况的电流感应,”英飞凌绿色工业电力事业部总裁Peter Wawer表示。“你需要对跳闸机制进行编程。机电式方案存在很多变体。而在半导体方案中,你可以通过软件实现定制化。这一特性未来将简化整个供应链,成本更高的解决方案可能会更早具备竞争力,因为满足不同需求所需的库存变体数量可以直接通过编程来实现。”
西门子的一份白皮书指出,800VDC提供了更简单的构造、更高的转换效率、更低的无功功率,以及备用电源和其他能源的灵活集成。但直流配电在功率转换与传输、电磁兼容性和计量方面存在挑战。这种系统本质上具有电容特性,网络中各处连接到直流电压的电容器会存储必要的运行能量。当故障发生时,电容器会释放存储的能量,大幅增加故障电流并扰乱直流电压,从而带来安全风险并导致系统停机。
因此,数据中心的直流配电保护必须考虑布线和接地、保护装置、协调配合、电弧闪光缓解以及接地故障保护等因素。
保护组件
在保护组件方面,固态断路器(SSCB)相比机械断路器具有多项优势,包括亚毫秒级的故障保护、零电弧、更长的使用寿命,以及与智能物联网预测和警报系统的无缝集成。
机械开关此前运行良好,因为交流电每秒会多次改变方向并经过0点。每次经过0点时,任何电弧都会自然熄灭。但直流电以稳定的单一方向流动,不一定会经过0伏特。如果在带电的直流电路上打开机械开关,电流会持续在气隙间跳跃,形成持续的高温电弧,可能会熔化开关或引发火灾。而固态断路器可以在微秒级时间内以电子方式切断电流,无需物理分离间隙,因此持续性电弧根本没有机会形成。
“传统机械开关的反应时间是毫秒级,所以速度并不快,”是德科技的Lee表示。“另一方面,直流电的反应速度相当快,尤其是800V的情况。它不一定会经过0伏特,但固态开关或断路器能够检测到电弧,并比机械开关更快地关闭或断开电路。这可以防止危险的发生,这也是研发这些固态断路器的主要动机。”
此外,固态断路器依靠物理原理进行检测。“如果检测到短路,它会先闭合,然后再断开,”Lee说。“这并不是说它更智能,而是速度更快。这完全是物理原理,背后没有控制器或机器学习芯片。它只是知道应该检测到某个特定电压,一旦检测到零伏特,就意味着出了问题,它就会立即断开整个电路,完全依靠材料特性实现。”
其他人也认同,对于800VDC架构而言,固态断路器比机电继电器或机械断路器更具优势。“机械断路器一直非常可靠,而且相当便宜,但速度较慢,”英飞凌的Wawer表示。“如果出现故障,很可能会直接损坏它们本应保护的设备。基于半导体的断路器能将保护速度提升几个数量级。”
断路器是电气系统中不可或缺的组成部分,覆盖从单个63安培MCB电机式断路器到数千安培的广泛电压范围。“每栋建筑物的地下室都有一个专门放置断路器的房间,用于保护建筑物和供电线路,”Wawer表示。“机械专家和电气技术专家能够操作数千安培的开关。市场范围从单个分立器件(击穿电压在70到150之间,或许达到1000或更高)一直延伸到更高的电压和电流等级。”
另一种选择是固态混合断路器(SSHCB),根据西门子的说法,它像机械断路器一样使用金属触点系统实现导通状态,同时也像固态断路器一样使用电力电子器件实现电路中断。电子熔断器(e-fuse)是一种智能固态过流保护器件,与固态断路器类似,但没有内置的气隙。因此,电子熔断器不能被视为支路电路保护装置。
固态断路器还能防止车辆中的电池断开。“如今,出于成本考虑,汽车中的电池保护通常采用烟火熔断器,”英飞凌的Wawer指出。“问题在于,如果熔断器烧断了,你必须把车送到修理厂进行更换。而固态断路器能提供非破坏性保护,不会损毁熔断器本身。”
热管理考量
突发的电火花很危险,但数据中心中更普遍的挑战是整个系统的散热问题。“同时运行的GPU数量及其产生热量的速度,要求采取更全面、更主动的规划和运营方式,”Cadence高级首席产品工程师Hoa Tram表示。“基于温度阈值触发警报等传统方法虽然仍有必要,但必须辅以数字孪生等技术,以便提前数分钟甚至数小时模拟整个AI数据中心的热状况。这不仅能实现GPU集群间工作负载更高效的编排,还能为运营商和冷却系统争取宝贵的额外时间,以防止或限制热损伤。而在高密度GPU环境中,这种损伤的发展速度会远快于传统架构的数据中心。”
预测能力至关重要。“当你处理这些高功率、大电流类型的转换器时,设备会发热,而关键问题在于如何模拟和预测将产生的热量,以及如何设计一个能够轻松散去所有这些热量的冷却系统,”是德科技的Lee表示。“很多电路板上都装有巨大的散热片,用于散去MOSFET产生的热量。但大型数据中心采用了更为复杂精密的散热方式,即在所有机架中通入液体冷却剂。要做到这一点,你必须了解边界条件。我需要散去的最坏情况下的热量是多少?如果不能准确预测这一点,设备就会过热,进而发生故障、无法正常工作,导致停机。”
数据中心与汽车行业的可靠性需求及标准
对效率和可靠性的关注,促使汽车行业与数据中心之间进行技术和创新交流,一些标准也从安全关键型向任务关键型迁移。
“汽车行业是我们从事了几十年的基础市场之一,而数据中心对我们来说算是新领域,”Imagination Technologies产品管理副总裁Kristof Beets表示。“但我们发现,我们为满足ASIL B甚至ASIL D要求而设置的许多可靠性机制,对数据中心的可靠性同样非常有用。这是因为,如果你在使用某个设备,却没有意识到它已经出现故障,就会浪费大量的处理能力和时间。故障检测得越快越好,而且这些故障往往是硬性故障。数据中心处于高温环境中,存在大量辐射等各种情况。芯片会直接发生故障,这也是我们一直在硬件中构建低成本连续自检测功能的原因。”
对于汽车行业而言,判断是否出现故障并进行上报的时间窗口是100毫秒。“这在如今的数据中心里是闻所未闻的,”Beets表示。“它们运行着庞大的网络层和大量网络部分,很多时候当他们尝试执行任务时,才会发现‘哦,我们众多GPU中的一个出问题了,现在需要回滚并找出问题出在哪里,以及是从哪里得到了错误数据。’我们能够非常非常快速地完成这一过程,这也是我们的数据中心客户对我们的检测能力产生浓厚兴趣的原因所在。这样一来,回滚的时间窗口就会小得多。此外,由于我们不仅能检测到是否存在故障(这在汽车领域基本上就是我们所需要做的全部工作),还能知道故障发生的具体位置,因此你可以将那个出现故障的单元下线,同时保留大部分GPU资源。这样你就不必跑过去把机架拆下来,再装一个新的。我们可以直接禁用那个出现故障的处理单元。不过,当然,这样一来那块芯片的可信度就会降低,所以在合适的时机,你仍然需要对其进行物理更换。但我们可以让系统继续以更快的速度运行,同时降低成本开销。”
此外,数据中心的可靠性需求仍在不断增长。“我认为数据中心的可靠性要求要高于汽车,”Cadence的Tram指出。“在汽车领域,各系统被设计成尽可能相互隔离、独立运行,而且涉及的功率规模与AI工厂相比简直微不足道——AI工厂需要同步协调大量高耗能GPU的工作。启动电机在设计上就不需要关心车头灯在做什么。汽车的负载是由事件驱动、由人为操作(或路况)触发的,而不是在整个集群中通过算法实现同步的。”
在大型AI训练集群中,数十万个GPU紧密同步,可能会在矩阵运算过程中同时达到峰值算力,并在同步和检查点操作时同时回落。“瞬态变化不是单个负载的突增,而是整个相互关联的GPU集群同步产生的突增,”Tram解释道。“这就把一个局部的电能质量问题,转变成了一个可能破坏电网稳定的潜在事件——这是汽车电气工程师从未需要考虑过的问题。汽车电池永远不必担心自身的瞬态吸收特性会引发区域性停电,进而扰乱甚至危及成千上万乃至数百万人的生命安全。AI工厂电力系统一旦发生灾难性故障,其潜在的‘爆炸半径’也是促使这些数据中心采用最新监测和仿真技术(包括数字孪生)的重要原因之一。”
在所有数据中心(无论是新建还是改建项目)中,一个主要的复杂因素在于,800VDC安全标准尚未完全成熟。“例如,NFPA 70E原则上涵盖了直流系统,但其电弧闪光计算方法主要是围绕交流系统开发的,众所周知对直流系统的适用性不够准确,”Tram表示。“IEC 61439和UL 508A涵盖了直流开关设备和控制面板,但并未专门针对800V规模的数据中心场景。OSHA法规在电气安全方面参考了NFPA 70E,但并未明确涉及800VDC数据中心架构。”
汽车行业与数据中心之间的差异,最终归结于制造商的资质认证要求。“例如,汽车原始设备制造商(OEM)需符合AEC-Q100等标准,部分零部件需要在高达175°C的环境下运行,”英飞凌的Pawloski表示。“数据中心传统上采用工业标准,这与汽车标准并不相同。但数据中心正开始调整这些资质认证要求,其严格程度甚至超过了汽车行业的要求,因为他们追求超高可靠性,不希望电源出现故障进而导致大型服务器宕机。”
功率转换器(如变压器和母线等配电机制)应能充分支持AI数据中心中波动的负载。“这些组件面临的主要挑战是高效运行并降低电气损耗,”新思科技应用工程总监Pavani Gottipati表示。“AI电力负载中的谐波可能会导致局部交流损耗和热点问题,进而导致这些组件出现故障,造成机架停机,对数据中心运营产生不利影响,甚至更糟的是,导致数据中心客户遭遇服务中断。先进的多物理场优化工具有助于为AI数据中心设计电气和热性能都稳健可靠的功率转换与配电机制。”
芯片封装也是必须考虑的因素。“随着高功率密度芯片为AI数据中心提供更强的计算性能,数据中心要实现可靠运行,还需要芯片周边的电气架构能够支撑不断提升的功率密度,”Gottipati指出。“在芯片和封装层面,这意味着需要在封装中使用磁性材料以提升功率密度。然而,芯片设计人员需要确保这些磁性材料集成到电路板上时不会引发电磁干扰(EMI)。”
这一可靠性挑战不仅存在于电力传输和封装领域,还延伸到了密度日益增加的液冷AI机架内那些必须保持可维护性的组件。
液冷AI机架中的内存与可维护性
现代数据中心中的高性能AI服务器需要具备可用性、可管理性、可维护性和可靠性——这也包括内存组件。“随着AI基础设施规模的扩大,数据中心运营商所需的内存解决方案不仅要具备高性能和高能效,还必须满足持续运行所需的可靠性和可维护性要求,”Rambus内存接口芯片产品营销副总裁John Eble表示。“例如,SOCAMM2采用基于LPDDR的模块化内存架构,能够实现可升级性、现场可更换性和生命周期灵活性,其外形规格适用于液冷设计,而SOCAMM2芯片组则提供了大规模可靠运行所需的遥测、配置和本地化电源管理功能。”
此外,液冷系统本身也必须经过可靠性测试。
“这些系统中包含大量的泵和电机驱动装置,需要有液体在其中流动,”德州仪器的Shenoy表示。“热交换器等部件带来了一些新的挑战,比如泄漏检测问题。此前这些系统中并没有液体流动,就在不久之前,还只是用风冷方式对其进行散热。现在有了液冷技术,就需要将所有这些设备的温度维持在一定水平;否则,它们就会超出额定指标,进而受损。”
热循环特性可以通过板级可靠性(BLR)测试进行验证。“我们会进行温度循环测试,特意让设备承受从高温到低温的应力变化,”Shenoy表示。
虽然数据中心的温度控制比车辆更为严格,但热循环对这两种环境都可能产生负面影响。“热循环是电子设备的一大‘杀手’,即在低温和高温之间来回循环变化,”英飞凌应用工程总监Jim Pawloski表示。“这会削弱芯片内部的互连结构,或者削弱芯片与连接部件之间的连接强度。在资质认证和测试过程中,可能需要验证某个部件能否承受一定数量的开关循环次数,而这一要求在数据中心中可能比目前汽车领域的要求更为严格。”
不过,汽车的整体运行温度更高。“鉴于数据中心是固定安装的设施,它们不会像电动汽车或混合动力汽车运行时那样经历大幅或快速的电气负载波动,”新思科技首席工程师Bryan Kelly表示。“它们还在受到严格控制、维护条件优良的环境中运行。”
结论
转向800VDC能为AI数据中心带来更高的效率,但也带来了更高的安全风险,包括电击、电弧闪光事件、电池热失控以及设备隔离方面的挑战。因此,从电网或替代电源到单个功率超过1兆瓦的高密度AI机架,配电系统的每一个环节都需要采取安全防护措施。
芯片可靠性也是800VDC安全体系的重要组成部分,因为中间功率转换步骤的减少,使得高压电力距离处理器仅有几英寸之遥。总体而言,随着AI不断开拓新的应用场景,这些风险很可能是值得承担的,因为它们能带来可观的电力节省和效率提升。
Q&A
Q1:什么是800VDC,为什么数据中心要采用它?
A:800VDC是一种直流供电方案,相比传统48V系统,功率级数更少、损耗更低、整体架构更高效,适合搭配氮化镓等宽禁带半导体材料使用,能更好地支撑单机架功率逼近1兆瓦的现代AI数据中心需求。
Q2:固态断路器(SSCB)相比传统机械断路器有什么优势?
A:固态断路器具备亚毫秒级的故障保护能力、零电弧、更长使用寿命,并能与智能物联网预测和警报系统无缝集成,能在微秒级时间内以电子方式切断电流,避免持续性电弧的产生,比机械断路器安全得多。
Q3:数据中心从汽车行业借鉴了哪些可靠性技术?
A:数据中心借鉴了汽车行业为满足ASIL B、ASIL D等功能安全等级要求而设计的可靠性机制,例如低成本连续自检测硬件和快速故障检测技术,这有助于更快发现GPU等硬件故障,缩小回滚窗口、降低成本开销。
