2026-09-15
借助NVIDIA Transformer Engine在JAX中加速无丢弃MoE训练
NVIDIA通过Transformer Engine对JAX中的Dropless MoE训练进行分组GEMM、专家并行等优化,使DeepSeek-V3训练性能从103提升至1068 TFLOPS/GPU,1024 GPU...
NVIDIA通过Transformer Engine对JAX中的Dropless MoE训练进行分组GEMM、专家并行等优化,使DeepSeek-V3训练性能从103提升至1068 TFLOPS/GPU,1024 GPU...