功耗是AI工厂发展的一个决定性制约因素。随着AI工作负载需要一整套计算平台来支撑,该平台的每个组件都必须在工厂有限的功耗预算内实现最大化输出。这使得每瓦性能(而非未经归一化的原始吞吐量)成为衡量AI平台价值的最终标准。

NVIDIA Vera Rubin平台旨在实现大规模的高能效AI。其核心是NVIDIA Vera Rubin NVL72,它在从吞吐量优化的大批量处理到高交互性层级的小批量处理等各种AI计算需求中,都能提供强劲的每瓦性能表现,同时支持开源和闭源模型。

工厂级和机架级的功耗管理创新推动了Vera Rubin在这一重要指标上的表现。在工厂层面,NVIDIA DSX MaxLPS软件可根据工作负载需求的变化在机架间调配功耗,使运营商能够回收闲置功耗,在相同的场地功耗范围内多部署最多40%的GPU,并实现35%更高的Token吞吐量。

在每个Vera Rubin NVL72内部,机架级电容器与状态感知的智能功耗平滑软件共同吸收训练和推理工作负载的突发功耗峰值,使工厂能够按照持续需求而非最坏情况峰值来规划。这意味着每兆瓦可部署的计算资源更多。

最高交互性层级面临独特挑战。为此,该平台增加了NVIDIA Groq 3 LPX作为低延迟加速器。本文将解释单个LPX机架内的创新技术,说明其如何成为Vera Rubin平台中高能效的组成部分,包括其确定性执行模型。

NVIDIA Groq 3 LPX机架中有哪些功耗效率技术?

Groq 3 LPX确定性执行模型使LPU编译器能够创建一个精确的调度方案,规定每个数据将在何时移动到哪个具体的计算单元,以及该操作将在何时精确执行,精确到时钟周期级别。这一调度延伸至机架中全部256个LPU芯片,实现了长上下文下的超快交互性,以及利用这种确定性的功耗管理技术。

在LPU编译器生成工作负载执行调度之后,它可以预测该调度中每个周期的电流消耗。这进而实现了两项互补技术:

预测性功耗(PEP):在需求变化到来之前为供电系统做好准备

时钟周期合成(CPS):塑造需求上升和下降的剧烈程度

PEP和CPS共同帮助减少必须持续提供给任何一组芯片的“电压保护带”或“电气安全裕量”,尽管这部分裕量并不直接为AI工作负载供电。减少这一电压保护带意味着稀缺的功耗可以更多地用于工作负载本身。

在需要时精确向AI工作负载供电面临哪些挑战?

为运行AI工作负载,芯片执行一系列指令,从简单的数据重塑到复杂、高耗电的矩阵乘法运算不等。几乎所有芯片都包含硬件功能,可在工作负载运行期间根据资源可用情况在这些不同操作之间动态切换。这种灵活性意味着计算密集型操作可能在任何时刻被调度执行。为芯片供电的系统必须设计成能够应对这种情况。

驱动AI工作负载的矩阵乘法和向量乘法运算,在短时间内涉及大量晶体管开关切换,这在纳秒级别增加了芯片的电流需求。芯片从最近的可用来源——紧邻芯片放置的电容器(称为去耦电容器或decap)——获取额外电流。这些电容器放电会降低芯片电压。

芯片电路板上确实配备了电压调节器——一种专用电路,其职责是将芯片供电电压保持在设定目标值,但由于电感的存在,它无法瞬时响应,电感会抵抗其所供电流的快速上升。尽管如此,电压调节器所提供的电流最终会赶上芯片的需求,从而使电压恢复。

这些由AI工作负载电流需求急剧变化最终导致的暂时性电压下降,被称为电压骤降。其幅度取决于电流变化量以及di/dt(电流变化率)。在其他条件相同的情况下,更大的di/dt会导致更大的电压骤降;相反,同样的电流绝对变化量若发生在更长时间内,则会产生更低的di/dt,从而减少骤降。这些骤降通常不会造成问题。然而,所有芯片都有一个最低电压(Vmin),低于此电压芯片将无法正常运行,导致结果错误。

为降低这种最坏情况发生的可能性,芯片运行时会设置电压保护带,提供足够的供电电压裕量,以确保芯片在瞬态和最坏情况下仍能获得所需的最低电压。大多数时候,为提供这一保护带所需的功耗实际上是多余的。此外,功耗与电压的平方成正比,因此持续多提供10%的电压将多消耗21%的功耗。

NVIDIA Groq 3 LPX的周期精确调度如何使电流需求可预测?

Groq 3 LPX确定性执行模型允许在AI工作负载开始运行之前,就创建一份关于该工作负载将如何运行(包括操作和数据移动)的调度方案。单个LPU加速器具有相对较少数量的独立硬件元件,每种元件都能实现对最常见操作的可预测的快速执行:

MXM用于矩阵乘法

VXM用于向量运算

SXM用于转置和重塑

单个加速器还配备了能将这些计算单元同步到时钟周期级别的硬件。在内存方面,每个芯片都拥有无层级结构的片上SRAM存储体。在LPX系统层面,各LPU之间直接相连,而非通过中间媒介,这使数据传输时间更加可预测。

确定性将这些不同的硬件元件联系在一起:单独的计算、内存读取和芯片间通信在每次运行中都需要相同数量的时钟周期。编译器可以利用这一点来规划数据在这些计算元件之间移动的调度,确保数据在恰当的时间到达恰当的位置。这种计算和数据移动的调度还使编译器能够提前解决常见的资源冲突,例如两个硬件元件写入同一内存存储体的情况。

这种周期精确调度还使得可以创建工作负载随时间变化的电流需求曲线。编译器可以在时钟周期级别估算系统的电流消耗量。

该执行模型如何实现前瞻性的电压和时钟控制?

周期精确调度以及由此产生的电流需求曲线使Groq 3 LPX能够减少电压骤降,并以更小的电压保护带运行。由于编译器知道电流需求何时会上升和下降(精确到时钟周期),它可以提前准备供电系统,并通过互补的PEP和CPS技术塑造最剧烈的需求变化。

PEP是芯片指令供电网络(PDN,即向LPU供电的物理电子设备)改变其所供电压的机制。由于编译器知道电流将在哪个周期出现峰值,它可以足够提前地安排该指令,使得所供电压在需求到来之前就已经开始变化。这样去耦电容器需要弥补的缺口就更小,芯片的电压在电流上升时下降幅度也更小。

CPS使编译器能够调度工作负载中各个时钟周期的缩短或延长。这种逐周期的调度之所以成为可能,仅仅是因为Groq 3 LPX采用了准同步时钟系统,该系统使各芯片之间的时钟保持同步,同时使芯片内的计算元件保持同步。相较于PEP,它对电流最剧烈变化的控制更为精细。特别是,具有最高电流峰值的时钟周期可以被延长,从而降低di/dt(电流上升速率)。

PEP和CPS共同为编译器提供了工具,使其能够调度电气信号乃至时钟周期长度,从而减少电压骤降。对Groq 3 LPX系统的内部测试表明,这种方法可使电压骤降减少超过60%。据估计,这将使供电系统持续为AI工作负载提供的基准电压降低一个较高的个位数百分比。由于功耗与电压的平方成正比,这将带来功耗更大幅度的百分比下降——且这一切都不会影响工作负载本身。

在高交互性场景下实现更高的每瓦性能

与规格相似但不具备确定性的系统相比,Groq 3 LPX确定性执行可将运行相同工作负载所需的功耗降低一个可能达到低两位数的百分比。在功耗受限的AI工厂中,降低这部分开销将为生成Token留出更多的固定功耗预算。

Groq 3 LPX将于2026年下半年将这些基于确定性的功耗控制技术引入NVIDIA Vera Rubin平台。它们与工厂层面的NVIDIA DSX MaxLPS以及Vera Rubin NVL72机架内的智能功耗平滑技术相互补充。每项技术在平台的不同层面发挥作用,但都服务于同一个目标:从每兆瓦中获取更多有用的AI推理能力。

在平台层面,将Groq 3 LPX与Vera Rubin NVL72搭配使用,对于参数量超过2万亿的模型在长上下文和高交互性场景下,与上一代NVIDIA GB200 NVL72相比,每兆瓦吞吐量最高可提升35倍。对于AI工厂而言,这意味着在这一高要求的运行点上,能够在相同的功耗预算内处理远远更多的Token。

致谢

本项工作的完成得益于Ashraf Essea、Kibibi Moseley、Graham Steele、Suhas Somnath、Sarah McKenney、Farshad Ghodsian和Eduardo Alvarez的专业知识和工程贡献。

Q&A

Q1:NVIDIA Groq 3 LPX是什么?

A:Groq 3 LPX是NVIDIA Vera Rubin平台中的低延迟加速器,采用确定性执行模型,能够精确调度数据移动和计算操作,从而实现高效的功耗管理。

Q2:Groq 3 LPX如何提升能效?

A:它通过预测性功耗(PEP)和时钟周期合成(CPS)两项技术,提前调整供电系统并平滑电流变化,从而减少电压骤降,降低电压保护带,节省更多功耗用于实际计算。

Q3:Groq 3 LPX搭配Vera Rubin NVL72能带来什么效果?

A:对于超过2万亿参数的模型,在长上下文和高交互性场景下,每兆瓦吞吐量最高可比上一代GB200 NVL72提升35倍。

NVIDIA