随着AI从聊天机器人向自主智能体演进,开放模型正在满足市场对AI运行位置、部署方式及演进路径的全面掌控需求。

NVIDIA日前宣布扩展其Nemotron 3模型系列,推出Nemotron 3.5 Lightning——这是该级别中专为长时运行智能体AI工作负载设计、效率最高的模型。此次发布紧随Nemotron 3 Nano之后,体现了NVIDIA持续优化开放模型以提升精度与速度的承诺。

Nemotron 3.5 Lightning是一款拥有300亿参数的混合专家模型,专为大型多智能体系统中的专项任务而构建,有助于打造更智能、更高效的智能体应用。

与此同时,NVIDIA还发布了NeMo Switchyard——一款面向主流智能体工具的开源智能路由库。企业可借助它根据自身需求构建路由器。部署后,NeMo Switchyard能够将每个请求智能分配给最合适的模型处理,且无需开发者重写现有应用。

Nemotron 3.5 Lightning与NeMo Switchyard的组合,为用户在PC、工作站、数据中心和云端的AI部署提供了更强的控制力、更优的运行位置选择和更高的运行效率。

现代智能体系统的架构演进

现代智能体系统——即始终在线的智能体——越来越多地以"模型系统"或模型集成的形式运行,不同模型专注于不同任务。

NVIDIA Nemotron开放模型正是为这种架构而设计。前沿推理模型(如Nemotron 3 Ultra或GPT-5.6)负责规划和编排工作流,而Nemotron 3.5 Lightning等小型专用模型则执行代码审查、工具调用、安全告警监控和账单问题解答等具体任务。

Nemotron 3.5 Lightning:专为高并发智能体任务打造

Nemotron 3.5 Lightning是一款完全可定制的开放模型,专为驱动始终在线智能体的高并发任务而设计,由Nemotron联盟成员共同贡献评估方法、推理软件和数据集参与开发。

该模型输出速度最高提升4倍,与同级别其他模型相比,智能体任务完成速度提升30%。由于模型开放且支持定制,企业可利用NVIDIA NeMo基于自身领域数据、工具和工作流对Nemotron 3.5 Lightning进行后训练,从而提升专项任务的准确性。

多个行业AI领军企业正在针对自身工作负载对Nemotron 3.5 Lightning进行定制:CrowdStrike用于网络安全领域,Harvey与Trajectory合作用于法律服务,CodeRabbit与Baseten合作用于代码审查。此外,Lila Sciences正致力于提升其在物理和生命科学领域智能体任务中的推理能力,Fastino Labs完成定制后在软件开发、金融和医疗健康工作负载上取得了领先准确率。

在部署灵活性方面,Nemotron 3.5 Lightning可在NVIDIA RTX PC、NVIDIA DGX Spark、NVIDIA DGX Station及NVIDIA Jetson等本地AI系统上运行,也可扩展至边缘AI设备、NVIDIA RTX PRO工作站、数据中心和云环境,帮助用户充分利用现有基础设施投资。

与此前每次Nemotron发布一样,NVIDIA在许可范围内公开了尽可能多的训练数据和训练技术,支持模型的可追溯性、审计与二次训练。此次同步发布的还有Nemotron-RL-Agentic-Terminal-Pivot——一个用于编程智能体能力后训练的强化学习数据集。

NeMo Switchyard:智能模型路由,大幅降低成本

不同模型各有所长:有的擅长编程,有的擅长推理,有的适合轻量任务,有的则针对本地运行做了隐私与效率优化。若企业依赖单一默认模型,要么过度支出,要么牺牲质量;若手动管理路由,则会增加集成工作量,拖慢部署进度。

NeMo Switchyard是一款面向AI智能体的开源模型路由库,可根据具体需求自动将提示词路由至智能体工作流各环节中最合适、最高效的模型。开发者可调整或修改路由算法,以匹配质量、延迟和成本等不同优先级需求,从而在模型系统中构建具备更优Token经济性的强大AI智能体。

内部基准测试显示,NeMo Switchyard在保持前沿级准确率的同时,将任务完成成本降至单独使用Opus 4.8的近三分之一。

NVIDIA正携手AI生态系统合作伙伴,将智能模型路由引入开发者日常使用的工具和平台:

Boomi:在五项路由能力评测中实现了100%的领域路由准确率,将59%的流量导向速度提升5倍的微调模型,并将后期对话轮次延迟降低21%。

Cadence:通过在形式验证场景中使用ChipStack AI超级智能体,效率提升9.9%。

Classmethod:在内部使用NeMo Switchyard运行opencode和Fireworks工作负载,初步测试显示成本降低27%,质量保持不变。

Cognition:将NVIDIA NeMo Switchyard分级路由器集成至Devin Desktop供NVIDIA内部使用,在FrontierCode Main上实现接近前沿水平的性能,同时相较于将所有请求路由至单一前沿模型,平均成本降低28%。

Kong:通过Kong AI Gateway原生提供NeMo Switchyard路由能力。

LangChain:配合NeMo Switchyard,在145个多轮深度智能体任务中,仅将7%的请求路由至前沿模型,成本降低74%,准确率仅下降6%。

LiteLLM:正将NeMo Switchyard作为插件集成至其代理层,开发者无需更改现有技术栈即可享受上述优势。

Nous Research:将NeMo Switchyard集成至Hermes,为开发者提供易于配置的路由系统,提升智能体效率。

Ramp:使用NeMo Switchyard在Ramp SWE-Bench中达到与前沿模型相当的性能,同时成本降低58%,运行时间缩短33%。

Siemens:正在对Fuse EDA AI智能体进行基准测试以提升效率。

获取方式

Nemotron 3.5 Lightning现已在Hugging Face、ModelScope、OpenRouter及build.nvidia.com上以NVIDIA NIM微服务形式提供,同时也可通过NVIDIA云合作伙伴、后训练平台、推理平台及云服务提供商的广泛生态获取。NeMo Switchyard现已在GitHub上线,并即将登陆合作伙伴平台。

Q&A

Q1:Nemotron 3.5 Lightning是什么类型的模型,有哪些技术特点?

A:Nemotron 3.5 Lightning是NVIDIA推出的一款300亿参数混合专家开放模型,专为大型多智能体系统中的专项任务设计。它的输出速度最高提升4倍,智能体任务完成速度比同级别其他模型快30%。模型支持完全定制,企业可基于自身领域数据和工作流进行后训练,也可在本地设备、工作站、数据中心和云端灵活部署。

Q2:NeMo Switchyard的路由效果怎么样,能节省多少成本?

A:根据NVIDIA内部基准测试,NeMo Switchyard在保持前沿级准确率的同时,可将任务完成成本降至单独使用Opus 4.8的近三分之一。合作伙伴的实测数据也印证了这一点:Ramp成本降低58%、LangChain成本降低74%、Classmethod成本降低27%,Cognition平均成本降低28%,整体效果显著。

Q3:NeMo Switchyard支持哪些平台和工具接入?

A:NeMo Switchyard目前已在GitHub上开源,并与Boomi、Cadence、Cognition、Kong、LangChain、LiteLLM、Nous Research、Ramp、Siemens等多家企业和平台完成集成或正在推进对接,即将登陆更多合作伙伴平台,开发者无需大幅修改现有技术栈即可接入使用。

NVIDIA