每一瓦未被使用的电力,都意味着被浪费的产能。AI工厂通常按照所有GPU同时达到峰值功耗这种极端情况来预留电力容量,这种保护性缓冲会导致宝贵的基础设施在常规运行状态下利用率不足。英伟达DSX MaxLPS通过策略化的电力共享机制,在参与调度的资源之间动态分配电力,使客户能够在相同的核定电力预算内部署多达40%的额外GPU。

本文详细解析了英伟达与Nscale联合开展的一项评估工作,测试对象是运行在英伟达GB300 NVL72系统上的Kimi K2.5工作负载,测试地点位于Nscale在冰岛凯夫拉维克Verne园区的数据中心,该中心完全采用可再生能源供电。文章涵盖了电力与性能之间可量化的权衡关系,说明了用于维持电气限值的控制机制,并提出了运营商在大规模部署前可重复使用的验证方法。

静态电力规划为何导致可用电力闲置

AI工厂运行在一个由多层电气限值构成的体系之中。市电供应、变电站、配电设备、机架、节点和GPU,每一环节都存在各自的约束条件。运营商必须在满足应用吞吐量与延迟目标的同时,让每个受控边界都保持在核定限值以内。

静态电力规划通常会为每个节点预留足够的电力,以应对所有节点同时达到额定峰值的情况。这种保守做法简单直接,但AI工作负载很少会保持恒定的电力消耗。训练类工作负载会在计算、通信、同步和检查点保存等阶段之间切换。推理类工作负载则在预填充、解码、内存密集型操作、网络活动和空闲间隔之间交替进行。即便是同一模型的不同实例,也会因请求形态和并发量的变化而产生不同的功耗。

这种波动性导致预留峰值电力与实际消耗之间出现差距。在静态的按节点预留模式下,某一节点预留内的闲置容量无法转用给另一节点。这样一来,整个设施的总用电量可能仍低于限值,但额外的GPU容量却处于闲置状态。

DSX MaxLPS会监测实际电力消耗情况,并在保持运营商总体预算和策略边界不变的前提下,动态地在参与调度的资源之间重新分配可用电力。

DSX MaxLPS控制回路的内部机制

DSX MaxLPS整合了芯片、系统、散热和软件层面的技术,旨在土地、电力和建筑(LPS)约束条件下最大化AI工厂的产出。动态电力软件为策略化电力分配提供了控制层。

该控制流程包含五个技术要素:

拓扑与资源组。运营商需要绘制参与调度的基础设施拓扑图,并将节点组织成具有总体电力预算的受管理组。

遥测数据。系统会以足够密集的间隔采集GPU、节点、机架和资源组的电力遥测数据,以便及时发现可用余量和潜在的电力事件。

策略。运营商自定义的规则确立了节点限值、资源组限值、分配优先级、备用要求,以及应对维护或紧急事件的响应方式。

分配与控制。当部分资源的实际用电量低于其分配额度时,软件会调整参与调度GPU的电力限制,使其他资源能够使用这部分可用容量。

验证与执行。系统会将实测电力消耗与核定的资源组预算进行比对,当用电量接近限值时调整分配方案。

这是一种协调式的资源分配,而非增加场地本身的电力供应能力。这套控制回路的作用是在相同的受管理电力预算下实现更高效的产出。

评估方法说明

在此次评估中,Nscale在其数据中心部署了MaxLPS软件并采集遥测数据,英伟达则负责运行工作负载。评估重点考察了控制机制的行为表现以及工作负载层面的权衡关系。

本次评估使用了英伟达Blackwell Ultra GPU、FP4精度的Kimi K2.5模型、英伟达Dynamo、英伟达TensorRT LLM,输入序列长度为8K,输出序列长度为1K。测试的工作负载组合结合了高吞吐量与低延迟两类推理实例,在受管理组内形成了各具特点的电力与服务特征。

静态基线配置使用了35个四GPU节点,共计140个GPU,运行两个各占用52个GPU的高吞吐量实例以及一个占用36个GPU的低延迟实例。DSX MaxLPS配置则使用了48个四GPU节点,共计192个GPU,在保留原有36个GPU低延迟实例的基础上,新增了第三个52 GPU的高吞吐量实例。

任务运行在四个机架之间,两种配置下每个分布式工作负载均限定在单一机架内运行,以此控制跨机架性能差异带来的干扰。如果测试环境已验证各机架间性能等效,则无需将分布式工作负载限定在单一机架内。

团队测量了归一化的总体及单实例吞吐量、首个Token生成时间、端到端延迟、交互响应性,以及GPU、CPU和机架的电力遥测数据。通过综合比较这些指标,可以避免吞吐量提升的表象掩盖了延迟、稳定性或电力合规性方面可能出现的退化问题。

测量结果解读

下表对比了静态基线配置与DSX MaxLPS配置在容量、吞吐量和电力使用方面的表现。

两种配置均采用相同的264.4千瓦核定电力预算。单位核定功率吞吐量由归一化总体吞吐量除以这一固定的电力预算得出。基线配置的表现为每瓦4.10个Token/秒,而DSX MaxLPS的表现为每瓦6.12个Token/秒,提升幅度达49.2%。由于核定电力这一分母保持不变,这一百分比与总体吞吐量的提升幅度完全一致。

在显示精度范围内,单实例的性能表现基本保持不变。这表明,规模更大的受管理集群实现了总体吞吐量的提升,同时并未对现有高吞吐量或低延迟实例的性能造成实质性影响。

在延迟指标方面,P75表示第75百分位结果,即75%的请求在该延迟或更短时间内完成。P99表示第99百分位结果,反映的是尾部延迟表现:99%的请求在该延迟或更短时间内完成,而最慢的1%请求耗时更长。中位数和P75延迟与基线相比变化幅度在5%以内。P99首个Token生成时间从基线的15.7秒增加了17%,这说明在评估容量和吞吐量提升效果时,必须同时关注尾部延迟表现。

评估中暴露出的权衡问题

动态电力分配机制让工程层面的权衡关系在整个集群层面变得可观测、可控制,但并不能从根本上消除这些权衡本身。

工作负载组合决定可用余量空间

DSX MaxLPS利用的是先前未被使用的电力余量,因此新增容量仍会提高平均电力利用率。可用余量的大小同样取决于工作负载的组合方式:具有互补性电力特征的工作负载相比同时达到峰值的工作负载,能够创造更多的调度空间。因此,运营商应当针对具有代表性的生产环境工作负载,测试其与总体电力限值之间的关系。典型的AI工厂运行着电力特征各异的多样化工作负载,因此本次研究特意选用了能够反映这种波动性的工作负载组合。

尾部延迟揭示服务层面的权衡

稳定的中位数延迟可能掩盖尾部延迟的变化。在本次评估中,中位数和P75延迟与基线相比变化幅度均在5%以内,但P99首个Token生成时间却增加了17%。生产环境的验收标准应当作为研究方案的一部分予以明确界定。

可靠遥测是稳定控制的基础

动态分配机制依赖于可靠的遥测数据。缺失、延迟或映射错误的测量数据都可能损害集群层面决策的准确性。本次评估中,采用了场地级遥测数据来验证机架级电力测量结果的准确性。在部署之前,运营商应当确认新增的吞吐量不会损害服务质量,也不会违反电力限值的合规要求。

综合来看,这些权衡关系明确了运营商在部署前需要验证的关键内容。

运营商如何验证DSX MaxLPS

建议采用分阶段验证流程,明确边界条件和验收标准。

明确受管理边界。绘制市电、配电、机架、节点和GPU的拓扑结构图。设定资源组预算、备用要求和升级响应机制。确认哪项测量指标代表可强制执行的限值。

建立具有代表性的基线。在静态电力规划模式下,按照预期的部署和放置规则,运行具有代表性的AI工厂工作负载组合。测量性能和电力数据的时间要足够长,以捕捉工作负载的波动性并确认结果的可重复性。

审慎引入策略。从接近验证基线的限值开始。在增加节点之前,确认遥测数据、拓扑结构、控制响应和预算合规性均符合要求。

逐步增加容量并测试每一阶段。逐步增加受管理集群的规模,在每一步比较总体和单实例的性能表现。在推进下一步之前,需验证系统在峰值需求、运行状态切换、遥测故障和电力供应减少等情况下的服务表现。

设定生产环境运行限值。只有当某一配置同时满足吞吐量和延迟目标、保持在受管理预算范围内、维持所需的备用余量,并在故障和状态切换期间表现可预测时,才能予以正式批准投入生产使用。

本次评估展示了DSX MaxLPS如何在电力受限的AI工厂环境中重新盘活闲置容量。这种策略化管理方法同样可以应用于多样化环境中,以提升有效算力产出。运营商可以根据硬件条件、工作负载组合、软件配置、散热方案、网络拓扑结构和服务目标,为每一次部署调优出最佳运行状态。

按照验证后的运行目标规划场地建设

动态分配是一种运营层面的能力,但场地本身必须具备承载这种能力所释放容量的条件。电力配电系统、散热系统、网络架构、机房空间和机架位置的规划,都应当按照验证后的生命周期目标进行设计,即便首日投产时实际部署的机架数量较少。

面向未来的英伟达Vera Rubin NVL72 AI工厂,DSX MaxLPS还将动态电力管理与能效优化技术相结合,并配合专为45摄氏度液冷入口温度设计的基础设施。任何关于Vera Rubin容量的预测都应与本次基于GB300 NVL72实测数据的评估结果区分开来看待。

DSX MaxLPS为运营商提供了一套将工作负载波动性转化为可管理容量的框架体系。相关工程工作的核心在于明确边界条件、测量具有代表性的运行行为、根据服务目标调优策略,并在常规和异常状况下都验证其合规性表现。

建议查阅英伟达DSX MaxLPS和英伟达动态电力软件的相关文档,并运用本文提出的验证流程,为自己的AI工厂建立生产环境运行限值标准。

Q&A

Q1:英伟达DSX MaxLPS到底是什么?

A:DSX MaxLPS是英伟达推出的一套策略化电力共享解决方案,通过动态电力软件在AI工厂内部的各类资源之间灵活分配电力,使客户能够在相同的核定电力预算内部署多达40%的额外GPU,从而提升算力产出效率。

Q2:使用DSX MaxLPS后吞吐量能提升多少?会不会影响性能?

A:根据英伟达与Nscale联合评估结果,在相同的264.4千瓦电力预算下,DSX MaxLPS配置的单位功率吞吐量较静态基线提升了49.2%,同时现有实例的性能基本保持不变,但P99首个Token生成时间增加了17%,需要综合评估延迟表现。

Q3:部署DSX MaxLPS前需要做哪些准备工作?

A:运营商需要按照分阶段流程进行验证,包括明确受管理边界、建立代表性基线、审慎引入策略、逐步增加容量测试,以及最终设定生产环境运行限值,确保系统在各类工况下都能保持合规与稳定。

NVIDIA