英伟达在开放模型和本地 AI 上的布局已经酝酿了一段时间。对 Hugging Face 的收购只会加速这一进程,而在产品层面,该公司也在推动更多潜在用户在自己的设备上运行 AI 模型方面取得了一些进展。

周四,英伟达发布了 Nvidia Personal AI Router(PAIR),这是一款面向家庭网络的开源软件路由器,可以让用户利用家中闲置的 Mac 和 PC 按需运行小型模型,并借助子智能体来加速智能体工作流程。

PAIR 的主要目的是通过让智能体调用更多并行子智能体,来加快 NemoClaw、OpenClaw 或 Hermes 等智能体的运行速度。其思路是由一个主智能体将任务拆分给多个子智能体,这些子智能体的模型请求随后可以在这些闲置设备上运行。

英伟达将其称为“虚拟推理路由器”,并明确表示这并非一个新的推理引擎。相反,它利用的是设备上已经运行的 Ollama 或 LM Studio 安装程序,并让它们来运行模型。在每台设备上安装完成后,PAIR 就可以发现本地网络中的不同系统(通过 mDNS),并检查它们是否能够处理某个请求。

需要注意的是,PAIR 并不会将单个推理请求拆分到多台设备上运行。英伟达强调,这不会将多个 GPU 合并,也不会把显存池化成一个统一的加速器,也无法把单个推理请求拆分到多台设备上处理。

英伟达解释道:“智能体可以通过它所熟悉的本地接口发送请求。PAIR 通过其代理接收请求,识别所需的引擎和模型要求,然后选择一个符合条件的节点。该节点会从头到尾完整执行该请求,并通过 PAIR 将结果返回。智能体始终只看到一个连接,而 PAIR 则在背后处理任务分配。”

PAIR 支持配备兼容 GPU 的 Windows、macOS 和 Linux 设备。具体来说,包括英伟达 GeForce RTX 20 系列及更新型号的 GPU(英伟达表示这是基准配置)、搭载 M4 芯片或更新芯片的 Mac,以及 Nvidia DGX Spark(此外,今年晚些时候上市后,还将支持 RTX Spark PC 和笔记本电脑)。

值得一提的是,英伟达在这里也支持了 Mac 设备,尽管 Mac 并不使用英伟达的 GPU,但它显然已经成为运行本地模型和 OpenClaw 等智能体的热门选择。

每台设备可以托管不同的模型,但 PAIR 只会将请求路由到已启用所需引擎并且拥有确切请求模型的设备上。在多台设备上安装相同的模型,可以让路由器在分配并发请求时拥有更多选择。

PAIR 会持续监测哪些设备处于可用状态,一旦用户回到某台设备上继续工作(或开始玩游戏)并重新占用 GPU,本地推理引擎就会被停止。

在英伟达给出的示例中,使用两台配备高端 RTX 5090 GPU(32GB 显存,目前售价约 5000 美元,尽管其最初建议零售价为 2000 美元)的 PC,运行 Qwen3.6 35B A3B 模型,借助 PAIR 通过五个子智能体协同工作,速度提升了约 1.6 倍。

很少有人家里会有一堆 RTX 5090 显卡(或许还有几台 DGX Spark 台式机),因此如果换成比如一台 Mac Studio、几台 Mac mini 再加一台游戏 PC 的组合,实际效果还有待观察,但即便如此,这也应该能够加快本地智能体工作流程的运行速度。

可用性

Nvidia PAIR 目前已开放测试版。要开始使用,用户只需在每台希望加入网络的设备上进行安装,让系统发现并配对这些设备,并确保这些设备上已经安装了 Ollama 或 LM Studio(并下载好所需的模型)。

PAIR 还可以协助完成设置,在已配对的设备上安装 Ollama 或 LM Studio,并启动模型下载。

Q&A

Q1:Nvidia PAIR是什么?

A:PAIR是英伟达推出的开源软件路由器,能让家中闲置的Mac和PC按需运行小型AI模型,并借助子智能体加速智能体工作流程。

Q2:PAIR支持哪些设备?

A:PAIR支持配备兼容GPU的Windows、macOS和Linux设备,包括英伟达GeForce RTX 20系列及更新型号GPU、搭载M4芯片或更新芯片的Mac,以及Nvidia DGX Spark。

Q3:PAIR能否把一个任务拆分到多台设备上运行?

A:不能。PAIR不会合并多个GPU或池化显存,也无法将单个推理请求拆分到多台设备上,每个请求只会在选定的一台设备上从头到尾完整执行。

The New Stack