长时运行的 AI 智能体大部分时间都在处理高频执行任务:工具调用、结果验证和子智能体委派。若每个执行步骤都使用前沿推理模型,将带来高昂的成本和延迟。

NVIDIA Nemotron 3.5 Lightning 是一款开放的 300 亿参数混合专家(MoE)模型,活跃参数仅 30 亿,专为常驻智能体的执行层而设计。它支持 OpenClaw 和 Hermes Agent 等框架,并由 NVIDIA NemoClaw 开源安全与管理栈提供支撑。

NVIDIA Nemotron 开放模型系列如同一个软件库,每次发布都在持续提升精度与速度。随着这些模型的演进,模型路由与编排的快速成熟也在同步推进。

这一点至关重要,因为开发者越来越多地使用多模型系统构建应用。Nemotron 3 Ultra 等前沿推理模型负责编排与复杂规划,而更小、更高效的模型则承担高频执行层的工作。

本文介绍 NVIDIA Nemotron 3.5 Lightning,阐述其小型 MoE 架构如何针对自主智能体中的高频、低延迟执行进行优化,并详细介绍驱动它的推理与训练创新。此外,本文还将介绍 NVIDIA NeMo Switchyard——一个能将每项任务智能路由至最佳模型的库。

Nemotron 3.5 Lightning 的架构设计

Nemotron 3.5 Lightning 是一款可定制的开放 300 亿参数 MoE 模型,活跃参数 30 亿,为自主智能体提供最优的高频执行能力。MoE 架构之所以快速高效,是因为路由器将每个 Token 仅发送给少数几个专家,因此每个 Token 只运行模型参数的一小部分,以小模型的计算成本实现大型稠密模型的容量。

Nemotron 3.5 Lightning 是 Nemotron 3 模型系列中最小的成员,继承了该系列经过验证的多项技术:

推测解码:与 Nemotron 3 Super 和 Nemotron 3 Ultra 一样,Nemotron 3.5 Lightning 在训练阶段引入了多 Token 预测(MTP)。该模型还配备了 DFlash 和 DSpark,可在多种服务场景下实现更全面的推理优化。

框架优化训练:模型针对主流智能体框架进行训练,使智能体在高频任务中能够更准确地调用工具,同时降低延迟。

最终成果是一款专为高调用量、低延迟执行场景打造的模型,其体积支持从 NVIDIA DGX Spark 到数据中心的全场景部署。

定制化能力

模型只有适配具体任务,才能在专业 AI 智能体系统中发挥价值。Lightning 系列模型具备高度可定制性:小模型微调更快、成本更低,对硬件要求也远低于大型模型。

你可以开箱即用地对 Nemotron 3.5 Lightning 进行定制,以适配你的工作负载。与每次 Nemotron 开放模型发布一样,权重、训练数据和训练方案均以尽可能宽松的 OpenMDW-1.1 协议发布,支持以下操作:

使用 NeMo Automodel 和 NeMo Megatron Bridge 进行 LoRA 或全量 SFT 微调

使用 NeMo RL 和 NeMo Gym 运行强化学习、基于环境的评估与推演

本次发布还包含 Nemotron-RL Agentic Terminal Pivot,这是一个用于训练部分编程智能体能力的开放智能体强化学习数据集。

执行层的实际价值

前沿模型或许能赢得头条,但 Nemotron 3.5 Lightning 这类模型才是在实战中磨砺出来的。它们处理 git pull 等请求、验证工具输出、格式化结果,并执行主导长时智能体 Token 预算的常规调用。

模型路由与编排让这种分工协作更易实现,现已通过 NVIDIA NeMo Switchyard 提供。Switchyard 可将 Nemotron 3.5 Lightning 作为路由目标,与开放和闭源模型并列,确保每个请求都落在最有能力且最高效的模型上。规划任务路由至前沿模型,执行任务路由至 Lightning,从而高效利用每一个 Token。

性能表现

Nemotron 3.5 Lightning 在同类模型中以最高输出速度实现领先精度,在 Artificial Analysis Intelligence Index 的精度与速度帕累托前沿上位居前列。该指数综合九项评估,衡量模型在智能体任务、编程、科学推理和通用智能方面的表现。

Nemotron 3.5 Lightning 将强大的智能与同类模型最高 4 倍的输出速度相结合,在高频智能体工作负载的精度-速度帕累托前沿上占据优势地位。

智能体效率最终取决于模型完成有效工作的速度,而非单纯的 Token 生成速度。在 PinchBench 上,Nemotron 3.5 Lightning 以 86% 的精度完成 10,000 项任务,比精度相近的 Qwen3.6 35B 快 30%。

更高的推理吞吐量和 Token 效率使 Nemotron 3.5 Lightning 处于效率前沿,帮助常驻智能体更快完成高频工作。

推理优化技术

Nemotron 3.5 Lightning 通过推测解码和量化技术,在不牺牲精度的前提下实现速度与可定制性的兼顾。

推测解码

Nemotron 3.5 Lightning 专为快速生成 Token 而构建,并具备通过推测解码生成多个 Token 的能力。在此过程中,模型(或草稿模型)会草拟若干 Token,再经过高效审核。Nemotron 3.5 Lightning 与 Nemotron 3 Super 和 Ultra 一样,经历了专门的预训练阶段,将多 Token 预测(MTP)内化于模型之中。训练完成后,还经过专项 MTP 增强阶段,进一步提升了 MTP 精度。

除 MTP 外,Nemotron 3.5 Lightning 还配备了两个草稿模型:DSpark 适用于 DGX Spark 推理工作负载和低并发数据中心场景;MTP 最适合中高并发场景,最优草稿长度随并发增加而缩短。NVIDIA 还发布了 DFlash 草稿模型,可与其他模型对比测试,可能在特定工作负载下表现最佳。

量化

Nemotron 3.5 Lightning 随 BF16 一同提供 NVFP4 检查点,采用与 Nemotron 3 Ultra 相同的专用 NVFP4 内核,支持 NVIDIA Blackwell、NVIDIA Hopper 和 NVIDIA Ampere GPU。同一文件在数据中心和桌面级 DGX Spark 上均可良好运行。

本地部署

Nemotron 3.5 Lightning 让强大的智能体 AI 在本地系统上触手可及,包括 NVIDIA Jetson、GeForce RTX 5090 和 DGX Spark。

NVIDIA 已与 EXO Labs 等多个团队合作,深入了解该模型在 DGX Spark 上的表现。

此外,你还可以通过 LM Studio、llama.cpp、Ollama 和 Unsloth 等行业标准工具运行 Nemotron 3.5 Lightning。

合作伙伴生态

Nemotron 3.5 Lightning 得到了涵盖框架、定制、部署和推理的不断壮大的合作伙伴生态支持,包括:

训练后优化:AgileRL、Applied Compute、Deep Cogito、distil labs、Fastino Labs、Local AI Labs、Prime Intellect、Reasonable、Thinking Machines Lab、Thoughtworks、Trajectory、Uniphore

推理软件:Ollama、Exo、Canonical、LM Studio、Unsloth

框架与智能体平台:Aible、Cline、Factory AI、Hermes Agent、Kilo Code、LangChain、LM Studio Bionic、OpenClaw、OpenCode、OpenHands、Pi

云服务平台:Google Cloud Gemini Enterprise Agent Platform(Model Garden)、MSFT Foundry(MaaP & Managed Compute)、OCI Enterprise AI

全球系统集成商:Accenture Japan、TCS、Tech Mahindra、Wipro

AI 原生企业:Arcos Labs、CodeRabbit、Dream、Harvey

托管推理服务商:Baseten、BlackBox AI、CoreWeave、Crusoe、DeepInfra、Fireworks AI、FriendliAI、GMI Cloud、Modal、Nebius、Together AI

如何开始使用

Nemotron 3.5 Lightning 完全开放——权重、数据和训练方案一应俱全,可适配你的工作流并部署于任意环境。你可以在 build.nvidia.com 或通过 OpenRouter 试用,从 Hugging Face 和 ModelScope 下载权重。

Q&A

Q1:Nemotron 3.5 Lightning 是什么类型的模型?它有什么特点?

A:Nemotron 3.5 Lightning 是 NVIDIA 发布的一款开放 300 亿参数混合专家(MoE)模型,活跃参数仅 30 亿。它专为 AI 智能体的高频执行层设计,具备低延迟、高吞吐量的特点,在精度相近的情况下比同类模型快最高 4 倍,可部署于从本地设备到数据中心的各类环境。

Q2:Nemotron 3.5 Lightning 如何实现高速推理?

A:主要通过两项技术:一是推测解码(含多 Token 预测),模型在训练阶段就内化了 MTP 能力,并配备 DSpark 和 DFlash 两个草稿模型以适配不同并发场景;二是 NVFP4 量化,采用专用内核,在保持精度的同时大幅提升推理速度,同一检查点可在 Blackwell、Hopper、Ampere 等多代 GPU 上运行。

Q3:NeMo Switchyard 是什么?它和 Nemotron 3.5 Lightning 有什么关系?

A:NeMo Switchyard 是 NVIDIA 推出的模型路由库,能将每个请求智能分配给最合适的模型。它可以将 Nemotron 3.5 Lightning 作为路由目标,与其他开放或闭源模型协同工作:复杂规划任务路由至前沿推理模型,高频执行任务路由至 Lightning,从而在保证质量的同时最大化 Token 使用效率。

NVIDIA