2026-08-18
使用量化感知蒸馏技术构建Nemotron 3.5 Lightning NVFP4模型
NVIDIA通过量化感知蒸馏(QAD)技术,将Nemotron 3.5 Lightning模型从66GB压缩至22GB的NVFP4格式,在保持精度的同时实现最高4倍吞吐量提升。QAD以全精度BF16模型为教师,通过KL散...
NVIDIA通过量化感知蒸馏(QAD)技术,将Nemotron 3.5 Lightning模型从66GB压缩至22GB的NVFP4格式,在保持精度的同时实现最高4倍吞吐量提升。QAD以全精度BF16模型为教师,通过KL散...
英伟达发布Nemotron 3.5 Lightning,这是一款300亿参数的混合专家模型,推理速度最高提升4倍,支持针对特定业务场景进行后训练优化。合作伙伴CrowdStrike、CodeRabbit等测试显示,经微调...
NVIDIA发布Nemotron 3.5 Lightning,这是一款300亿参数的混合专家模型,专为长时运行的智能体AI工作负载设计,输出速度提升4倍,任务完成速度提升30%。同步推出的开源库NeMo Switchya...
NVIDIA发布开源混合专家模型Nemotron 3.5 Lightning,拥有300亿总参数、30亿活跃参数,专为自主智能体的高频执行层设计。该模型支持推测解码、多令牌预测及NVFP4量化,在同类模型中实现最高4倍输...
Nvidia推出两项新服务:Nemotron 3.5 Lightning是一款300亿参数的混合专家模型,输出速度比同级模型快4倍,智能体任务完成速度提升30%,支持企业在自有硬件上低成本快速定制。NeMo Switch...