对于大规模AI工厂的运营者来说,最大化持续产出是提升生产力的关键。在超大规模AI训练中,集群内每块GPU都需要每秒完成数千次集合操作的梯度同步。同样,在推理场景下,任何计划外的停机都会直接减少可处理的请求总量,严重限制收入的产生。

随着AI模型呈指数级增长,支撑其训练与服务的网络基础设施也必须同步扩展。然而,在大规模部署场景中,瞬时错误、链路性能下降以及节点中断几乎是必然会发生的问题。

要维持集群的最佳利用率,网络必须保证这些紧密耦合的工作负载不间断运行。哪怕丢失一个数据包,都不能被允许导致推理延迟激增或中断训练集合操作。在大规模场景下,即使是极低概率的丢包,也可能累积成显著的有效吞吐量下降。这正是为什么真正无损的网络架构是生产级AI基础设施的必要前提。

NVIDIA Vera Rubin是一套全栈式AI工厂平台,可在所有AI及加速计算工作负载间实现算力的灵活调配。针对AI工作负载,该平台能够以四分之一的GPU数量完成训练,并以最低的Token成本实现每瓦特最高的推理吞吐量。作为该平台核心的机架级计算引擎,Vera Rubin NVL72通过NVIDIA NVLink 6横向扩展网络架构,将72块Rubin GPU连接进单一横向扩展域,使它们能够作为单一计算单元协同运作。

NVIDIA NVLink 6通过一套完整的容错框架,为这些工作负载提供了不容妥协的可靠性。通过原生检测、隔离并从瞬时信号错误中恢复,NVLink确保了持续运行与集群生产力的最大化。

为什么多层容错是唯一可行路径

在现代AI工厂的规模下,被动式协议和单点修复方案已从根本上无法满足需求。作为AI互联领域的行业领导者,NVIDIA将NVLink的容错能力设计为一套经过精心整合的多层技术栈,涵盖硬件、系统设计以及软件层面。

首先,在物理层和链路层,NVLink强制实施原生无损网络架构。它通过结合前向纠错(FEC)、物理层重传(PLR)以及通用物理层(UPHY)恢复机制来实现快速纠错和链路稳定性。此外,它还利用基于信用的流量控制(CBFC)从数学上消除丢包,并部署主动故障隔离机制,在故障扩散之前将其瞬间隔离。

其次,由于任何未达到完全系统级冗余的方案都会成为隐患,该架构被设计为不存在任何单点故障。冗余交换机托盘、分布式NMX控制器以及双重带外管理路径,共同保证即便个别组件失效,整个域仍能保持正常运行。

最后,在应用层和软件层,诸如Dynamo Shadow Engine Recovery等功能利用预热的副本进程实现近乎即时的故障切换,而应用级的检查点与恢复机制则严格保护长时间运行任务的状态。这种紧密整合的多层方案,是让硬件异常被无缝隔离、正在运行的工作负载不受中断、并实现超大规模AI所需的极致正常运行时间的唯一被验证有效的方法。

下面,我们将详细说明这套多层架构在实践中的具体运作方式。

在物理层从源头减少错误

在最基础的物理层,NVLink直接在芯片层面应对电气噪声和信号衰减问题。在极高的信号速率下,噪声引起的位错误是不可避免的。现成的网络架构通常依赖标准的重型FEC算法,这会带来显著的处理开销和多跳延迟。相比之下,NVLink是专门为紧密耦合的横向扩展AI工作负载而设计的。

关键在于,NVLink无需依赖这些重型FEC算法,因为它将PLR作为快速的第二道防线。这种架构上的协同效应使NVLink能够采用一种轻量级、高效的FEC架构。与仅能像基本奇偶校验那样检测故障不同,这种方式允许发送端在数据流中附加高级纠错码。

接收端随后利用这些编码在线数学重建被破坏的位,以近乎零延迟的代价纠正单比特或多比特错误。这种高效性正是NVLink相较于通用以太网方案能够实现端到端延迟降低3倍、数据包处理速率提升10倍的直接原因。

当错误突发超出这种轻量级FEC的纠正能力时,第二道防线会立即启动。PLR是一种成熟且经过充分验证的物理层数据包重传机制。通过直接在物理层处理重传,PLR能够有效地将丢包率降为零,且完全不涉及更高层的软件栈。

最后,如果严重的信号衰减触发了物理链路中断事件,UPHY恢复机制会快速重新校准物理参数,同时数据包会被安全保存在硬件重放缓冲区中,以确保数据零丢失。

在链路层确保无损传输

在技术栈的上一层,NVLink依靠链路层来管理网络拥塞,而无需更高层软件的介入。支撑该层的核心是CBFC,这是NVLink相较传统协议建立原生无损网络架构的关键差异化因素。传统基于以太网的横向扩展方案,试图通过优先级流量控制(PFC)和显式拥塞通知(ECN)等附加机制来近似实现无损效果。

然而,这些被动式方法本身会引入新的故障模式,例如队首阻塞、PFC风暴以及死锁问题。这些隐患使得拥塞管理本身反而成为可靠性方面的风险点。此外,传统基于确认机制的方案要求接收方事后反馈成功或失败,这在缓冲区溢出并需要重试时会带来额外延迟。

借助CBFC,发送方只有在确认下一跳节点拥有足够缓冲空间来接收数据包时,才会将其注入网络。这种主动式方法从设计上消除了丢包问题,并在硬件层面保证无损传输,同时避免了以太网PFC所带来的网络暂停问题。

由于传输过程中不会有数据被静默丢弃,网络行为始终保持高度可预测,延迟也维持在较低且稳定的水平。同时,如果底层物理链路出现性能下降,链路管理器会通过执行接入链路和主干链路的重新平衡,自主修复NVLink网络架构。

最重要的是,它确保硬件故障能够在发生的本地位置被就地隔离,而不会引发连锁重传、超时或集合操作停滞——这些问题正是现成的以太网AI集群普遍存在的困扰。

通过应用层软件恢复隔离故障

应用层提供了智能化、由软件驱动的事务恢复能力(SW Recovery),执行时间约为1.5秒。当链路错误发生时,NMX控制器会直接与GPU驱动交互,将受影响的链路置于"隔离并排空"状态。这使得硬件能够在不发生数据损坏的情况下自动重新训练已降级的链路,同时防止全域范围的反压效应。

为了消除控制平面的单点故障,NVLink SDN控制模块(NMX-C)采用了NMX高可用性(NMX-HA)机制。NMX-C托管在其中一个交换机托盘上,如果主控主机发生故障,它会在数秒内自动将其功能控制器迁移至备用托盘。此外,NVLink交换机托盘的数据平面与运行NVOS的交换机管理CPU完全解耦。即便发生计划外的CPU重置或操作系统故障,数据平面仍能持续不间断转发,使NVOS得以恢复而不会造成数据包丢失或工作负载中断。

借助Shadow Engine Recovery实现NCCL软件层容错

尽管NVLink的物理层与链路层能够成功遏制和纠正绝大多数信号错误,但个别无法纠正的链路性能下降仍可能波及到软件栈层面。在多GPU推理部署场景中,大语言模型依赖NVIDIA集合通信库(NCCL)在NVLink架构上快速同步数据。如果某条NVLink连接出现严重中断,可能引发瞬时通信故障,导致NCCL操作失败,并迫使正在运行的大语言模型引擎中止。

以往,这种情况需要对推理引擎进行完全的冷启动重启。该过程涉及将模型权重重新加载至HBM显存、重新编译内核以及重新捕获CUDA计算图,整个过程可能导致推理服务中断数分钟之久,严重影响Token吞吐量。为消除这一瓶颈,软件容错技术栈引入了Shadow Engine Recovery——这是NVIDIA Dynamo中的一项功能,旨在绕过冷启动过程,在数秒内恢复推理能力。

由于NCCL通信器与创建时刻正在运行的特定活动进程集紧密绑定,因此在进程崩溃后无法动态地将其移交给替代进程。

Shadow Engine架构通过在活动推理引擎旁维持一个完全初始化的空闲副本进程来解决这一问题。在启动阶段,该备用引擎会预先建立自己独立的NCCL和NIXL通信器。如果硬件故障中断了主进程的通信上下文,Shadow Engine已经拥有一个健康且预热完毕、并绑定至NVLink架构的网络拓扑。这使其能够立即恢复诸如张量并行(TP)等分布式操作,而无需等待重建NCCL通信器或重新加载模型权重。在基于NVIDIA B200 GPU的基准测试部署中,Shadow Engine Recovery将推理停机时间从283秒缩短至仅7.3秒。

此外,针对那些在硬件中断期间需要适应节点数量变化的工作负载,该软件技术栈还集成了NCCL弹性支持功能,可动态扩展通信器规模,确保任务持续平稳运行。

借助CUDA检查点机制实现NCCL软件层容错

有时中断确实会发生,需要将推理引擎的部分或全部进程在新节点上重新启动。为了加快这类场景的处理速度,CUDA支持借助CRIU实现进程级检查点功能。这使得完整的大语言模型工作进程能够被快速地进行检查点保存并在GPU上恢复,从而绕过启动开销。Dynamo Snapshot整合了这项工作,将启动时间提升了一个数量级。

直到最近,这种检查点方法只能包含节点本地状态,且必须在任何网络连接或CUDA计算图创建之前进行。为克服这一限制,NCCL引入了对cuda-checkpoint的原型支持(预计年底前正式发布),使多节点检查点能够捕获启动和加载大语言模型推理引擎期间几乎所有的工作状态。这种方法显著降低了推理服务和智能体等延迟敏感型工作负载的启动与重启开销。

在这一具备强大容错能力的软件基础之上,应用程序还可以借助NVIDIA NeMo框架实现异步检查点保存,或通过NVComp实现检查点压缩,从而利用高带宽NVLink架构进一步节省状态保存时间。对于超大规模前沿模型而言,这种组合方案能够大幅减少同步阻塞时间,将检查点开销从数分钟降低至数秒,并确保在故障发生时能够快速恢复状态。

通过机架可维护性保障持续正常运行

在宏观层面,系统层负责管理长期状态保存以及机架级的物理健康状况与可维护性,处理耗时超过一分钟的大规模恢复操作。这种宏观层面的容错能力依赖于网络与计算技术栈之间的深度集成。NCCL对NVLink拓扑具备天然的感知能力,使其能够通过重构集合操作的环形或树形结构来动态适应链路性能下降,从而绕过故障硬件。

与此同时,CUDA为有序内存操作提供了更为丰富的错误报告与容错模型。通过将硬件故障清晰地上报给运行时系统,而非任由系统静默挂起,CUDA确保应用程序始终保持感知能力并能及时响应。

对于物理数据中心运维而言,交换机管理状态(Switch Admin State)功能将NVSwitch托盘的维护工作转变为一项有针对性、不影响业务的操作。系统管理员可以更换单个交换机托盘,而无需清空整个NVLink域或中断正在运行的AI任务。该管理状态会将已更换的链路保持在非运行模式下,防止链路在明确验证并启用之前被过早纳入使用。

此外,NVLink原生支持部分填充的机架配置。NMX控制器会自动发现可用硬件,并针对现有的物理计算或交换机托盘配置路由,从而在分阶段部署或维护周期中实现无缝运行。

借助NVLink Fusion将多层容错能力延伸至定制化XPU

上文详述的完整容错技术栈并不仅限于使用NVIDIA GPU的部署场景。随着超大规模云服务商和AI原生企业越来越多地为专用工作负载打造定制化XPU芯片,它们同样需要在大规模场景下获得同等级别、不容妥协的可靠性。以往,将业界领先的容错型横向扩展网络技术集成到定制芯片中,一直是一项巨大的工程挑战。

NVLink Fusion正是通过将XPU芯片连接至NVIDIA AI基础设施来应对这些挑战。这种集成方式使第三方芯片能够无缝继承本文所讨论的完全相同的NVLink横向扩展网络架构及多层容错技术栈。凭借这一成熟且经过充分验证的平台,NVLink Fusion帮助超大规模云服务商和AI原生企业提升性能、加快产品上市速度,并集成当今AI工厂所需的可靠性。

在大规模场景下确保不容妥协的可靠性

当各组织机构评估用于超大规模AI及加速计算工作负载的横向扩展架构时,仅比较简单的带宽指标是远远不够的。真正的规模化能力需要一套面向容错的全栈式解决方案。

NVLink 6专为通过全面的多层容错方案最大化平均故障间隔时间(MTBI)而设计。从亚毫秒级的物理层纠错、原生的信用式流量控制,到解耦的管理平面以及机架级的可维护性,NVLink提供了让全球最复杂的AI工厂能够持续不间断运行所需的全部容错能力。

了解更多关于NVIDIA Vera Rubin平台、NVLink以及NVLink Fusion的信息。

或者深入了解横向扩展网络架构如何决定AI工厂的经济效益。

Q&A

Q1:NVLink 6的多层容错框架具体包括哪些层面?

A:NVLink 6的容错框架涵盖物理层、链路层、应用层以及系统层。物理层通过前向纠错和物理层重传处理信号错误;链路层利用基于信用的流量控制实现无损传输;应用层通过软件恢复机制隔离故障;系统层则负责机架级的健康管理与可维护性。

Q2:Shadow Engine Recovery能带来多大的性能提升?

A:在基于NVIDIA B200 GPU的基准测试部署中,Shadow Engine Recovery将推理停机时间从283秒大幅缩短至仅7.3秒,避免了传统冷启动重启带来的数分钟服务中断。

Q3:NVLink Fusion有什么作用?

A:NVLink Fusion使第三方定制化XPU芯片能够连接至NVIDIA AI基础设施,并无缝继承NVLink的横向扩展网络架构和多层容错技术栈,帮助超大规模云服务商和AI原生企业提升性能、加快产品上市并获得所需的可靠性。

NVIDIA