构建AI智能体并不意味着只选择一个模型。每个模型都有各自的优势、局限性和成本结构,这些因素会随工作负载的不同而变化,甚至在同一工作负载的不同阶段也会有所差异。例如,一个智能体任务可能在某个步骤需要分类能力,下一步需要推理能力,而常规后续任务则适合使用更小的模型。将所有请求都发送给最大的模型会增加成本和延迟,而将所有请求都发送给较小的模型则会降低复杂任务的处理质量。

模型路由通过协调专用模型与前沿模型来应对这一挑战,使每项任务都能使用最适合的模型。NVIDIA NeMo Switchyard将这一复杂的工程问题转化为智能体工作负载的实用解决方案,让开发者无需针对每个服务商或模型选择重构应用,即可实现跨模型的工作分发。

在运行时,路由器会评估每个请求及其可用上下文,然后将任务发送给最符合需求、约束条件和策略要求的模型。根据工作负载的不同,这种多模型协作系统与始终使用最强模型相比,有望提升准确率并降低成本。

NeMo Switchyard提供了一个支持多种路由策略的库。本文将探讨NeMo Switchyard如何帮助开发者实践多模型协作方法,构建更高效、更可控、更适合真实AI工作流的智能体。

以Terminal-Bench Hard基准测试衡量的计算机操作任务为例(图1)。尽管DeepSeek V4在该示例中整体准确率最高,但它并非在所有任务组上都是最优选择。例如,Kimi K2.6更适合机器学习和强化学习任务组,而Qwen3.5 397B A17B在数学和科学任务上表现更佳,其余六个任务组则应使用DeepSeek V4。这种方法同样可以应用于单个任务层面,或在解决单一任务的不同阶段灵活切换。

成本和完成时间进一步增加了决策的复杂性(图2)。每个模型都有其运行或访问成本,以及各自的输出冗余度特征,这不仅体现在Token数量上,还涉及工具调用次数。

构建路由器需要综合考量来自多个维度的信号,不同的路由算法决定了这些信号的来源。

有效的路由决策通常依赖三个维度的信号:

模型能力:哪些模型能够正确完成任务。

模型成本结构:每个模型的延迟和成本。

基础设施:支持可靠、无缝切换的系统级信号。

理解能力与成本信号的方式包括:

分析请求本身。路由器可以根据主题或预估难度对请求进行分类匹配。例如,分类器可以识别查询的主题,将其与模型池中的对应模型匹配,并完成路由。嵌入模型或特征提取器可用于从查询中提取特征。

分析模型状态。路由器可以检查模型的对数概率、级联输出、智能体执行轨迹、模型残差流、注意力矩阵等信息。

分析系统状态。定价、延迟、负载以及包括错误在内的智能体专属信号均可作为参考,用于评估模型路由器或作为实时路由信号。

值得注意的是,路由器不仅需要考虑使用哪些信号,还需要考虑何时、在哪里对这些信号进行评估。例如,对于多轮智能体任务,路由器可以将每个完整请求路由到特定模型,也可以在每个步骤单独路由。整个系统可以共享一个模型池,子智能体也可以针对特定任务使用专属模型池。

这些问题的答案取决于多种因素,包括使用场景、部署复杂度、容错要求、延迟或吞吐量限制。系统还需要基础设施支持,以实现对智能体和用户透明的无缝切换。

NeMo Switchyard通过支持多种路由器的智能编排层来解决上述挑战。开发者还可以将自定义路由算法或数据引入NeMo Switchyard。

路由算法生成信号,指导跨不同优势模型的路由决策。系统还需要基础设施来接收路由器的决策结果,将请求发送至目标模型,并将响应返回给应用程序。

这一切的基础是NeMo switchyard-libsy——NeMo Switchyard背后与服务商无关的SDK。它负责表示请求、定义系统可用模型,并管理对所选模型的调用。每个模型目标都有一个语义名称,其背后的客户端负责将该名称映射到服务商端点和模型ID。这种分离设计使路由逻辑独立于特定服务商。

当策略需要时,NeMo Switchyard可以在智能体会话中保持路由状态。它还能保留早期轮次的信息(如工具调用结果或亲和性决策),并在后续路由决策中使用这些上下文。当不需要历史信息时,路由也可以保持无状态。

这种分离设计至关重要,因为模型部署会不断变化。团队可能会更新模型、迁移到其他端点或更换服务商,而无需修改路由集成。NeMo Switchyard可以通过目标客户端发起模型调用,也可以将调用返回给宿主应用程序。这使智能体运行时、推理平台或网关能够控制请求的处理方式,同时保持相同的路由契约。

NeMo Switchyard服务器是通过通用API提供路由能力的参考实现,可模拟大语言模型网关。它接受OpenAI、Anthropic和Responses API格式的请求,将其转换为NeMo Switchyard内部请求格式,并返回预期的响应格式。同时,它还会记录所选模型、决策依据、Token用量、延迟和调用结果,便于团队检查路由运行情况。

基础设施就绪后,下一步是了解利用它进行决策的路由方法。NeMo Switchyard同时提供免调优路由器和可调优路由器。

NeMo Switchyard包含多种免调优路由器,无需基于工作负载专属数据进行训练即可做出决策,包括大语言模型分类器、阶段路由器和升级路由器。

大语言模型分类器

大语言模型分类器使用大语言模型作为评判者来选择候选模型,并在后续轮次中保持与该模型的会话亲和性。这避免了在智能体解决任务的过程中对未发生实质变化的工作进行重复分类。

这种方法适用于无头系统和领域专属系统。团队可以将编程、数学或医疗任务路由到指定模型目标,而NeMo Switchyard负责提供路由和状态管理功能。

阶段路由器

编程智能体会经历不同的工作阶段:早期阶段需要探索代码库并从错误中恢复,后期则进入更为机械化的实现阶段。这些阶段对模型能力的需求各不相同,阶段路由器正是利用这一特点来做出路由决策。

对于每个轮次,阶段路由器会检查近期的工具活动,判断智能体所需的模型能力级别。严重错误、反复无效的工作或长时间的探索会将该轮次推向能力更强的模型;而稳定的代码编写和编辑(尤其是测试通过后)则倾向于使用高效模型。如果信号不明确,路由器可以咨询大语言模型评判者,再回退到配置的默认选项。

升级路由器

升级路由从低成本模型开始处理每个对话。大语言模型评判者逐轮监控任务进展,当检测到持续性困难时,将会话切换到能力更强的模型。

这种方法专为多轮智能体工作负载设计——较小的模型可以处理常规工作,但在遭遇反复错误、循环或偏离后可能需要支援,是对大语言模型分类器路由方法从静态到自适应的延伸。

可调优路由器在此路由基础上,用从真实工作负载数据中学习到的信号替代固定启发式规则。可调优路由器不再根据请求文本判断哪个模型最合适,而是学习预测每个候选模型正确回答请求的可能性。

预填充路由器

在训练阶段,预填充路由器提取大语言模型的残差流来估计查询的复杂度。共享主干多层感知机利用残差流中的信号,将其映射到路由池中每个大语言模型的准确率标签。

在推理阶段,预填充状态作为路由器的输入,共享主干预测每个大语言模型成功完成任务或回答查询的可能性。

路由器随后可以应用一种策略,将预测准确率与成本、延迟或其他部署约束综合权衡。每个候选模型获得一个评分,请求被路由到在该工作负载下综合表现最优的模型。图5表明,路由并非只是选择最强的模型,而是选择最有可能以合理成本达到所需质量水平的模型。

NVIDIA正与智能体、模型和企业应用生态系统中的合作伙伴携手,将NeMo Switchyard模型路由能力融入现有开发者工作流,无需额外配置。这些合作包括:

智能体工作流:与Cognition合作的编程智能体工作流、与Nous Research合作的易配置Hermes Agent模型路由、与Ramp合作的金融软件工程工作流,以及与LangChain合作的模型路由评估。

应用与基础设施集成:与LiteLLM合作的大语言模型应用栈插件;与Kong合作的AI网关、治理和API流量管理;与Classmethod合作的Claude模型路由;与Boomi Agent Garden合作的企业自动化与连接。

行业专属AI智能体:与Cadence合作的ChipStack AI超级智能体形式验证工作流,以及与Siemens合作的EDA智能体工作流。

LangChain使用其内部深度智能体评估套件对NeMo Switchyard进行了基准测试,该套件包含145个多轮智能体任务,涵盖客户支持对话、值班事件调查和跨消息、问题跟踪及邮件的多步骤工作流自动化等生产场景,评估工具使用、多步骤检索、文件系统操作和长上下文摘要能力。在五次运行中,使用升级路由器在NVIDIA Nemotron 3.5 Lightning和Claude Opus 4.8之间路由请求,与纯前沿模型基线相比实现了74%的成本降低,仅7%的调用被发送至前沿模型,准确率差距约为6个百分点。

Cognition在Devin Desktop中实现了NeMo Switchyard阶段路由方法,并部署给NVIDIA内部用户进行真实场景测试。在Cognition针对生产级编程任务的FrontierCode Main基准测试中,该实现在Opus 5和Kimi K2.7之间进行路由,以3.11美元的平均成本实现了50.6%的准确率,接近前沿水平——与Opus 5准确率相差2.8个百分点,平均成本降低约28%。基准测试与内部部署共同提供了一个模型中立、自适应智能体的实践案例,展示了不同模型的互补优势如何随任务演进动态发挥作用。

开发者可以从合作伙伴集成入手,将NeMo Switchyard引入熟悉的智能体工具、框架和网关,也可以使用NeMo Switchyard GitHub上的说明,将自定义路由能力构建到自己的智能体和大语言模型网关中。

模型路由使专用模型与前沿模型能够协同工作,实现整体大于部分之和的效果。然而,构建实用且生产就绪的路由系统仍是一项极具挑战性的工程任务。

NeMo Switchyard完全开源,并与现有技术栈无缝集成。欢迎在GitHub上开始使用NeMo Switchyard,创建、测试并贡献针对特定使用场景的路由算法。

随着AI系统越来越多地组合使用多个模型,路由已成为在效率、质量和成本之间取得平衡、为每项任务选择合适模型的关键所在。

Q&A

Q1:NeMo Switchyard是什么?它解决了什么问题?

A:NeMo Switchyard是NVIDIA推出的模型路由库,专为AI智能体工作负载设计。它解决的核心问题是:不同任务适合不同模型,但手动管理多模型调用非常复杂。NeMo Switchyard通过智能编排层,在运行时自动将请求路由到最合适的模型,在保证质量的同时降低成本和延迟,且无需开发者针对每个服务商重构应用。

Q2:NeMo Switchyard支持哪几种路由方式?

A:NeMo Switchyard提供两大类路由器。免调优路由器包括:大语言模型分类器(用大语言模型选择候选模型并保持会话亲和性)、阶段路由器(根据智能体当前工作阶段动态切换模型)、升级路由器(从低成本模型起步,遇到困难时自动升级到更强模型)。可调优路由器包括预填充路由器,它通过学习真实工作负载数据,预测每个候选模型的成功概率,并综合准确率与成本做出路由决策。

Q3:使用NeMo Switchyard能带来多大的成本节省?

A:根据LangChain的基准测试,使用升级路由器在NVIDIA Nemotron 3.5 Lightning和Claude Opus 4.8之间路由,与纯前沿模型方案相比可实现74%的成本降低,仅7%的请求需要调用前沿模型,准确率差距约为6个百分点。Cognition的实测也显示,在编程任务中路由方案比单独使用顶级模型平均成本降低约28%,准确率仅相差2.8个百分点。

NVIDIA