前沿模型预训练已全面转向混合专家(MoE)架构,这从根本上改变了大规模AI训练的瓶颈所在。随着每个Token的计算成本下降,通信效率越来越决定模型在数千块GPU上的扩展效率。NVIDIA GB300 NVL72在预训练DeepSeek-V3 671B时创下每GPU 1,648 TFLOPs的世界纪录,展示了从芯片到网络再到软件的全栈AI平台进步如何持续推动训练性能提升。预训练效率的每一次提升,都意味着研究人员能够在相同的NVIDIA基础设施上训练更大的模型、开展更多实验,并更快达到前沿能力。
行业向MoE架构的快速转型,源于其极高的计算效率。与稠密模型不同——后者每个Token都会激活所有参数,计算量随总参数量线性增长——MoE模型每个Token只激活一部分参数。以DeepSeek-V3为例,其总参数量为671B,但每个Token仅激活约37B参数,以远小于总规模的单Token计算成本实现了前沿级别的模型能力。
这种架构的代价在于通信开销。各专家分布在不同GPU上,因此每个MoE层在前向和反向传播中都需要通过全对全(all-to-all)通信模式将Token分发给对应专家并汇聚结果。这一集合通信操作处于关键路径上,使吞吐量同时受计算和通信的双重制约。由于每一层、每一训练步骤都会触发这一操作,微小的延迟不断累积,最终导致全对全通信无法被计算掩盖,继续增加GPU也无法提升吞吐量。
这正是预训练需要紧耦合纵向扩展域的原因——在该域内,每块GPU都能通过无阻塞互联与其他所有GPU通信,提供高带宽、均匀带宽、低延迟以及随域规模增长保持的全分割带宽。训练这一规模的模型所需的GPU数量超出单个域的容量,因此需要将多个域互联。横向扩展流量较轻且频率较低,但仍须在计算窗口内完成,且必须保持可预测性,不能让任何单条慢速链路拖慢整体步骤。这是一个双层挑战,衡量成功的标准是实际交付的FLOPs,而非峰值FLOPs。
应对双层通信挑战,需要的是围绕这一挑战专门设计的系统,而不仅仅是一块更快的芯片。计算、纵向扩展互联、横向扩展网络、基础设施处理和软件各自承担一部分负载,任何一环的短板都会成为整体瓶颈。GB300 NVL72正是通过极致协同设计来应对这些挑战——这是一个机架级系统,其中芯片、互联、网络和软件作为一个整体平台进行工程设计,而非由独立部件拼装而成。
其核心是NVIDIA NVLink纵向扩展互联,使72块NVIDIA Blackwell Ultra GPU协同工作如同一体。第五代NVLink为每块GPU提供1.8 TB/s带宽,并在整个机架内提供130 TB/s的无阻塞全对全带宽,每块GPU均可通过单跳直达其他任意GPU。
带宽只是一方面,传输路径同样关键。NVLink采用内存语义设计:GPU可直接通过原生加载和存储操作读写对端的HBM,经由无损、流量控制的互联完成传输。数据传输是硬件内存操作而非软件发送,因此数据路径中不引入任何额外延迟,归约操作可在数据流经交换机时在交换机内部完成。
这正是逐层流量的需求所在:张量并行全归约和MoE全对全通信均在机架内完成,享有完整带宽和低延迟。在机架之外,平台通过每GPU 800 Gbps的NVIDIA ConnectX-8超级网卡,配合NVIDIA Quantum-X800 InfiniBand或NVIDIA Spectrum-X以太网进行横向扩展,确保梯度流量被计算所掩盖。
协同设计延伸至训练互联之外的基础设施服务和软件层面。在生产AI工厂中,NVIDIA BlueField数据处理单元(DPU)为虚拟网络、存储访问、安全、遥测和生命周期管理提供独立的基础设施处理域,降低大规模训练任务对主机CPU的占用。
训练软件覆盖生态系统的两个层面。NVIDIA Megatron Core专为这些GPU构建和调优。NVIDIA还积极向开源框架贡献代码,确保TorchTitan和JAX在GB300 NVL72系统上以全速运行。
在DeepSeek-V3 671B模型上,使用256块GPU,Megatron Core在GB300 NVL72上达到每GPU 1,648 TFLOPs,相比早期GB200 NVL72的606 TFLOPs,单代提升约3倍的实际交付吞吐量。
NVIDIA持续优化软件以提升整体平台性能。在DeepSeek-V3 671B规模的预训练任务上,这些收益不断叠加。在同一GB300 NVL72机架级系统上,仅凭软件改进,六个月内性能提升了1.5倍。这表明,即使在芯片出货之后,原始性能和训练吞吐量仍在持续提升。
NVIDIA工程师直接向AI社区所依赖的开源框架贡献代码,持续添加优化以提升其在NVIDIA GPU上的运行速度。这些贡献与PyTorch和JAX社区协作开发,持续落地并随时间推移不断改善性能。
TorchTitan是PyTorch的原生训练栈,NVIDIA的持续贡献不断提升其在GB300 NVL72上的性能。在DeepSeek-V3 671B上,这些优化叠加后在相同基础设施上实现了约6倍的实际性能提升。
JAX遵循同样的演进路径。六个月来,NVIDIA JAX优化在256 GPU规模的DeepSeek-V3 671B上将性能提升了近10倍——全部来自软件优化。最新软件版本达到了1,025 TFLOPS/GPU的卓越性能吞吐量,且软件优化仍在持续演进。
将DeepSeek-V3 671B预训练从256块GPU扩展至1,024块GPU时,Megatron Core保持了98.5%的单GPU性能,TorchTitan和JAX各自保持97%,因此新增的基础设施几乎全部转化为系统级Token每秒吞吐量的提升。这一效率体现了横向扩展互联在机架以800 Gb/s每GPU网络扩展时的高效工作:梯度流量始终被计算掩盖,确保增加更多GPU能严格提升总系统吞吐量,而不会因通信开销拖累网络。
使用256块GPU预训练DeepSeek-V3 671B,GB300 NVL72创下每GPU 1,648 TFLOPs的世界纪录,使同等训练任务仅需上一代所需硬件的一小部分即可达到相同性能。
开源框架印证了同样的结论:随着软件持续演进,同一平台上的性能不断提升。这些成果并非上限——它们来自一个硬件、互联和软件协同设计、持续优化的平台。今日创纪录的性能,只是明日更高性能的起点。
Q&A
Q1:NVIDIA GB300 NVL72在DeepSeek-V3 671B预训练上取得了怎样的成绩?
A:GB300 NVL72使用256块GPU预训练DeepSeek-V3 671B,达到每GPU 1,648 TFLOPs,创下世界纪录,相比上一代GB200 NVL72的606 TFLOPs提升约3倍。同一平台上,仅凭软件优化,六个月内性能又进一步提升了1.5倍。
Q2:MoE架构为什么对GPU通信要求这么高?
A:MoE模型的每个Token只激活部分专家参数,而这些专家分布在不同GPU上。因此每个MoE层在前向和反向传播中都需要执行全对全通信,将Token分发给对应专家再汇聚结果。这一操作处于训练关键路径上,通信延迟会逐层累积,最终成为制约整体吞吐量的瓶颈。
Q3:从256块GPU扩展到1,024块GPU时,DeepSeek-V3 671B的训练效率如何?
A:扩展效率非常高。Megatron Core保持了98.5%的单GPU性能,TorchTitan和JAX各自保持97%。这意味着新增的GPU几乎全部转化为有效吞吐量提升,得益于800 Gb/s每GPU的横向扩展网络确保梯度流量始终被计算掩盖。
