NVIDIA PAIR虚拟推理路由器:扩展本地网络可用算力
本篇新闻博客最初发布于NVIDIA官方网站,经NVIDIA授权在此转载。
将本地AI任务分发出去以缓解多智能体瓶颈,支持Ollama和LM Studio,无需修改智能体或运行框架
AI智能体正在学习通过协作完成更多任务。一个主智能体可以将复杂任务拆分为更小的工作,并将这些工作分配给专门的子智能体。此外,用户也开始同时运行多个智能体会话。用于完成复杂任务的多智能体工作流也变得越来越普遍。
这种广度优先的方式可以提升任务完成速度并改善响应质量,但当大量请求同时发送到GPU时,也可能造成系统瓶颈。
NVIDIA个人AI路由器(PAIR)利用用户本地硬件来缓解这种多智能体和子智能体瓶颈问题。PAIR将每个独立的推理请求路由到家庭网络上的可用系统。它兼容常见的本地推理服务,包括Ollama和LM Studio,因此用户无需重新设计智能体本身即可扩展可用于该智能体的算力,也无需对智能体运行框架进行任何改动。
NVIDIA PAIR测试版目前支持Windows、macOS和Linux系统,提供图形界面和终端界面。它兼容配备NVIDIA GeForce RTX 20系列及更新GPU、NVIDIA RTX PRO工作站GPU(图灵架构及更新)的系统,同时也支持NVIDIA DGX Spark和苹果M4及更新芯片。
什么是NVIDIA PAIR
NVIDIA PAIR是一款虚拟推理路由器,用于最大化发挥家庭中的AI算力。它并非一个全新的推理引擎,Ollama或LM Studio仍会在选定的设备上运行模型。PAIR负责发现参与组网的系统,追踪每个系统是否可以接收请求,调度独立任务,并将每个响应返回给发起请求的应用程序。
智能体可以通过其熟悉的本地接口发送请求。PAIR通过其代理接收请求,识别其所需的引擎和模型要求,并选择一个符合条件的节点。该节点从头到尾执行该请求,并将响应通过PAIR发送回来。智能体始终只感知到一个连接,而PAIR则在后台处理任务的分配。其主要特性包括:
无需新API:PAIR代理兼容的Ollama和LM Studio接口,无需每个智能体运行框架都集成新的集群API。
弹性客户端:兼容系统在可用时可以贡献算力,在需要时(如关机或休眠)可以退出。
本地控制:PAIR的设计理念是让提示词、数据和推理流量都保留在用户现有的本地网络中。
PAIR如何解决多智能体本地推理问题
设想一位AI重度用户,在其主力NVIDIA RTX AI PC上运行本地智能体。该智能体接收到一项研究、编程或个人事务整理任务,并将其拆分给多个子智能体。每个工作单元负责探索问题的一部分,其他工作单元则负责核实证据或汇总结果。
从用户的角度来看,这只是一项任务。但在推理层面,它可能变成数十个独立的模型调用。如果所有调用都指向同一个本地引擎,它们就会争夺相同的执行资源。队列会不断增长,主力PC始终处于繁忙状态,即使网络中的其他设备(如RTX PRO工作站、笔记本电脑或DGX Spark)可能拥有兼容且空闲的算力。
PAIR可以让推理层随着智能体的扩展而扩展。部分子智能体请求可以在主力PC上运行,另一部分则可以在其他配对节点上运行。当工作负载具有足够的独立性时,使用更多就绪系统可以减少排队并提升端到端的完成时间。
这样可以让主力PC专注于图形密集型游戏、内容创作或其他交互式工作,同时将推理任务分配给其他节点。
这是工作负载层面的并发处理。PAIR不会让单个推理请求跨多个GPU运行,每个请求都会分配给一个符合条件的节点,并在其生命周期内保持在该节点上。
利用家庭AI集群的弹性特点
家庭AI集群并非缩小版的数据中心。专用集群通常由持续通电、配置一致且始终可用的系统构成,而家庭硬件则是动态变化的。一台游戏PC可能正在运行游戏而处于繁忙状态;一台笔记本电脑可能处于休眠、关闭状态或已离线;一台工作站可能拥有所需模型,而另一台设备则没有;推理引擎也可能被停止,或者用户可能需要将GPU用于前台运行的应用程序。
PAIR的设计正是围绕这些不断变化的条件展开的。它可以通过mDNS发现本地系统,在私有网络中配对受支持的设备,并实时维护哪些节点可以接受新任务的视图。客户端节点可以在就绪时加入可用资源池,并在需要时退出,而无需将家庭环境变成一个专用的、始终在线的推理设施。
对于每一个新请求,PAIR会综合考虑多个因素,包括:
配对节点是否在线并处于就绪状态
是否启用了受支持的推理引擎
是否存在请求所需的确切模型
当前节点和引擎的工作负载,包括正在进行的任务
现有GPU使用率(是否有图形密集型应用或工具正在运行)
PAIR并不要求所有系统完全相同或永久可用,它会根据日常使用情况来调度推理请求并管理集群。
演示:Hermes五子智能体场景
此次演示展示了PAIR与Hermes Desktop(负责创建子智能体工作负载)以及Ollama(负责在每个选定节点上执行模型)的协同工作。任务要求Hermes分析一个模拟的家庭收件箱,并制定一份可靠的“周日重置”计划——明确今晚必须完成的事项、本周需完成的事项、以后再处理的事项,以及无需处理的事项,并为每个重要结论提供证据支持。
在这次五子智能体的运行中,Hermes创建了五个专项子智能体,分别审查证据的不同部分,调和冲突,并返回一个整合后的计划。Hermes负责任务的分解、委派与综合,PAIR负责推理路由,Ollama则在PAIR选定的节点上执行每个请求。
视频1:观看NVIDIA PAIR如何将由Hermes编排的推理任务分配到五个子智能体上
在单台NVIDIA RTX Spark笔记本电脑上使用Qwen 3.6 35B A3B模型时,同样的五子智能体工作负载平均耗时18分钟完成。相比之下,由一台RTX Spark笔记本电脑、一台DGX Spark和一台RTX 5090组成的三设备PAIR集群,平均仅需8分48秒即可完成。需要说明的是,这只是一次非官方的、针对特定配置的演示,并不能作为通用基准测试,也不代表线性扩展的承诺。
这是一次非官方的、针对特定配置的演示。结果取决于工作负载的并行性、模型、引擎设置、硬件、网络以及节点可用性,并非通用基准测试。
PAIR中的任务视图(Jobs view)是判断推理实际运行位置的真实依据。Hermes的智能体数量与PAIR的任务数量是不同的度量指标,因为一个智能体可以生成多个模型请求。只有当PAIR遥测数据显示任务在多个符合条件的节点上运行时,才能称之为多节点执行。
NVIDIA PAIR的工作原理
本节将详细逐步说明NVIDIA PAIR的工作原理。
利用本地网络发现附近系统
在每个兼容的Windows、macOS或Linux系统上安装PAIR后,它会使用本地网络发现技术(mDNS)自动查找附近的系统。必要时也可以通过IP地址手动添加节点。用户需批准安全配对请求,从而建立PAIR可以纳入考虑范围的可信本地节点集合。
在建立安全连接和完成配对之前,所有节点间的通信都会被阻止。连接建立后,通信将通过MTLS和生成的证书进行加密,以确保节点之间的通信始终在网络内部保持私密。
准备推理引擎和模型
每个参与组网的节点都运行一个受支持的本地推理引擎:Ollama或LM Studio。PAIR可以协助安装引擎,并在配对系统上启动模型下载,从而减少准备多台设备所需的工作量。只有当所需引擎已启用且该节点上存在确切所需的模型时,该节点才符合接收请求的条件。
不过,集群中各节点的模型不必完全一致。不同系统可以托管不同的模型,PAIR可以根据模型所在位置进行路由。在更多节点上加载相同的模型标签,只是为该请求提供了更大的符合条件节点池。
代理兼容的本地接口
兼容的应用程序会通过PAIR代理的本地端点发送兼容Ollama或LM Studio格式的请求。智能体运行框架可以继续使用其已经熟悉的接口,而无需单独发现并集成每一台设备。支持配置基础URL的应用程序,可以继续指向其各自的Ollama或LM Studio端点。
PAIR通过接管Ollama和LM Studio服务默认使用的端口来代理请求。如果智能体运行框架使用的是其他端口,则可以在PAIR引擎设置中配置代理端口。
PAIR会检查请求所需的引擎和模型要求,然后将这些要求传递给路由器。这种分离是该设计的核心:智能体决定请求什么工作,而PAIR决定该工作应在何处执行。
调度符合条件的节点
调度器会根据当前的就绪状态、支持的引擎状态、所需模型是否存在以及任务负载等信息,对配对系统进行筛选,选出一个符合条件的节点,该系统上的PAIR路由器会将请求传递给本地推理引擎。同时,来自其他子智能体的独立调用可以被分配到其他就绪节点。
返回响应并使路由过程可见
被选中的引擎执行请求后,PAIR会通过相同的本地接口将响应流式传输回发起请求的应用程序。任务视图和指标视图会显示每个被路由的请求由哪个节点处理,使任务分配过程变得可观测。
哪些工作负载最能从PAIR中受益
PAIR最适用于那些能够同时产生多个独立请求的工作负载,包括多智能体应用和并发本地AI工具。
对于这类工作负载,PAIR可以:
将独立任务路由到本地网络上的就绪系统
减少多个请求排队等待单一本地引擎的情况
在兼容配置下,为具备足够并行性的工作负载缩短完成时间
帮助释放主力PC,用于游戏、创作或其他交互式任务
保持应用工作流程的本地化和熟悉度
PAIR不会:
合并GPU或将显存池化为一个更大的加速器
对单个模型进行分片或将单个推理请求拆分到多台设备上执行
高度串行化的任务、由单次长时间模型调用主导的工作负载,或者仅有一个节点拥有所需模型的配置,可能获益较少。应基于实际使用的系统,通过端到端完成时间、排队情况、输出质量以及观测到的路由情况,来评估真正重要的工作负载。
开始使用NVIDIA PAIR
PAIR为家中已有的动态NVIDIA系统带来了类似集群的体验,同时保持本地推理工作流程的熟悉感。请按照以下步骤开始使用:
下载适用于受支持的Windows、macOS或Linux系统的NVIDIA PAIR测试版。
在需要纳入的NVIDIA RTX PC、NVIDIA RTX PRO工作站或NVIDIA DGX Spark系统上安装PAIR。
在本地网络中发现并安全配对系统。
启用Ollama或LM Studio,并在符合条件的节点上下载或部署所需模型。
在已安装PAIR、且使用Ollama或LM Studio的系统上运行兼容的智能体。
NVIDIA PAIR项目为开源项目,开发者可以查看代码、报告问题,并为发现机制、配对流程、路由算法、引擎集成、模型支持、端点以及用户体验的改进做出贡献。
Q&A
Q1:NVIDIA PAIR是什么?它能解决什么问题?
A:NVIDIA PAIR是一款虚拟推理路由器,用于最大化利用家庭网络中的AI算力。它能将多智能体工作流中的独立推理请求分配到本地网络中的多个可用设备上,从而缓解单一设备因大量并发请求而产生的瓶颈问题。
Q2:NVIDIA PAIR支持哪些设备和推理引擎?
A:NVIDIA PAIR支持Windows、macOS和Linux系统,兼容NVIDIA GeForce RTX 20系列及更新GPU、NVIDIA RTX PRO工作站GPU、NVIDIA DGX Spark以及苹果M4及更新芯片。推理引擎方面,目前支持Ollama和LM Studio。
Q3:使用NVIDIA PAIR需要修改智能体或应用程序吗?
A:不需要。PAIR通过代理兼容Ollama和LM Studio的本地接口来工作,智能体运行框架可以继续使用其原有接口,无需针对新的集群API进行任何改动。
