英伟达今日宣布推出两项新服务:高度可定制的Nemotron模型,以及一款名为NeMo Switchyard的智能体AI模型路由器。
随着企业面临日益繁多的AI模型选择,核心问题已不再是原始性能,而是如何为特定任务选择最合适的模型。随着智能体逐渐成为主流,其执行的任务从快速简单的序列操作,到跨深度知识领域的高复杂度推理,范围跨度极大。前者可能只需小型模型高效处理轻量排序任务,后者则需要具备强大智能与推理能力的前沿模型来应对。
Nemotron 3.5 Lightning加入开放模型家族,专为驱动全天候运行的智能体处理高并发任务而设计。这是一款拥有300亿参数的混合专家模型,英伟达称其输出速度最高可达同量级其他模型的4倍,智能体任务完成速度提升30%。该模型开放且可定制,企业可在自有硬件上通过英伟达NeMo,结合专有领域数据、工具和工作流进行后训练,从而提升专项任务的准确性。
仅凭这一点,该模型便已成为家族中强大的骨干主力。
英伟达于去年12月推出Nemotron 3模型家族,作为智能体AI系统的开放基础,最初包含Nano、Super和Ultra三个规格。公司表示,Lightning的差异化优势在于能够快速完成专项化定制。
企业可以用极少的设备和成本,在新训练的模型中可复现地重新生成自有数据与专项能力。
"我们听到的反馈是,Lightning的定制化操作非常简便,"生成式AI副总裁Kari Briski表示。
据Briski介绍,CodeRabbit公司使用英伟达标准自动模型方案,仅训练一个epoch,花费约85美元、用时约两小时,便构建出一个路由智能体。她还提到,另一家合作伙伴将Lightning直接接入现有后训练技术栈,"无需任何改动"。
她还举例说,一家公司仅用单张H100显卡以较低成本完成了训练,另一家则在夜间启动训练任务,第二天早上直接取用结果。这正在将后训练与微调的体验,变得像装好洗碗机按下启动键一样简单。
英伟达还将同步开放其数据集、后训练数据集,以及用于训练模型的方案与框架。开发者可将英伟达的后训练数据与企业自有数据混合使用,打造兼具两者优势的强力混合模型。
"这就是为什么我们看到大家能如此迅速地取得出色成果,"Briski说。
为任务选择合适的模型:为何AI智能体需要路由器
成本、准确性与效率的权衡,并非"廉价模型对比昂贵模型"的问题,而是为任务找到最佳匹配。当企业智能体执行工作时,任务在复杂度、专业要求、Token用量、预测难度和能力需求上各有差异。这意味着将任务路由至能够正确完成它的模型,类似于将工作分配给合适的人——有些模型擅长编程,有些更善于从文本中推断上下文,还有些则具备特定领域的专业知识。
NeMo Switchyard是一款面向AI智能体的开源模型路由库。它综合考量可用AI模型的数量与能力,在智能体工作流的每个步骤中,根据具体需求将提示词路由至最合适、最高效的模型。
"根据你的路由策略,它会选择最佳模型,"Briski解释道。
开发者可根据自身优先级定制路由策略,例如质量、延迟和成本要求。模型系统可按Token经济性、速度,或特定行业所需的专业特性等维度进行排序与筛选。
英伟达表示,正与AI生态系统中的多家合作伙伴共同推进智能AI模型路由工作,涵盖开发者常用工具,合作方包括Boomi、Cadence Design Systems、Classmethod、Cognition AI、Kong、Langchain、Nous Research和西门子。
Q&A
Q1:Nemotron 3.5 Lightning是什么模型?有哪些核心优势?
A:Nemotron 3.5 Lightning是英伟达推出的一款300亿参数混合专家开放模型,专为驱动高并发智能体任务设计。其核心优势在于速度快、易定制:输出速度最高可达同量级模型的4倍,智能体任务完成速度提升30%;同时支持企业在自有硬件上结合私有数据进行后训练,定制成本极低,有合作伙伴仅花费85美元、约两小时便完成了定制化路由智能体的训练。
Q2:NeMo Switchyard是做什么的?
A:NeMo Switchyard是英伟达推出的一款开源AI模型路由库,专为智能体工作流设计。它能够根据任务的具体需求——如质量、延迟、成本或专业领域要求——在智能体执行每个步骤时,自动将请求路由至最合适的AI模型。开发者可自定义路由策略,实现对模型系统的灵活调度。
Q3:企业如何对Nemotron 3.5 Lightning进行定制化训练?
A:企业可使用英伟达NeMo框架,在自有硬件上结合专有领域数据、工具和工作流对Lightning进行后训练。英伟达同步开放了训练数据集和方案框架,企业可将其与自有数据混合使用。整个过程门槛极低,有案例显示仅需单张H100显卡即可完成训练,甚至可以设置为夜间自动运行,次日直接获取结果。
