部署大语言模型只是走向生产可用服务的第一步。生产团队还需要在现有GPU基础设施上尽可能服务更多并发用户,同时保持应用响应所需的交互性。

对于智能体AI工作负载而言,这种权衡显得更加重要,因为其提示词往往较长,上下文可能在多个步骤间被复用,应用程序通常还需要向用户流式返回较长的响应内容。

NVIDIA NIM将模型和GPU相关的服务配置选择打包成可部署的微服务。开发者无需从空白的运行时配置开始,而是获得一套经过验证的服务配置和受支持的部署路径,同时仍可根据自身流量对NIM进行基准测试。

NIM带来的价值:性能工程与生产就绪能力

推理性能是一种系统属性。精度与内核、并行方式、调度、批处理、内存分配、前缀复用、模型专属状态缓存以及解码策略等因素相互影响。只有在满足应用延迟目标的前提下提升吞吐量的配置才是有价值的。

NIM将这些优化工作转化为经过测试的起点。NVIDIA工程师针对受支持的模型、GPU和精度组合验证配置,然后将运行时与模型工件打包在标准API之后。对于生产环境部署,NIM认证版还提供定期的推理栈更新、CVE处理、更广泛的硬件验证,以及通过NVIDIA AI Enterprise提供的商业支持。

NIM在一条部署路径中提供了两大优势:经过验证的性能工程,以及企业级容器生命周期与支持模式。

案例研究:Nemotron 3 Ultra NIM为智能体工作负载带来最高2.5倍的吞吐量提升

本文中使用的基准定义如下:

硬件:4块B200

智能体工作负载:64K/400/76% KV复用率/每用户50 TPS(20毫秒ITL)

该帕累托图对比了开源基准服务栈(NIM关闭状态)与完全优化的NIM 2.0.12服务栈(NIM开启状态)。

NIM 2.0.12优化服务栈的工作原理

所测得的性能提升来自各配置组合之间的相互作用,而非可以简单相加百分比的独立开关。主要优化层包括:

精度与自动调优的模型感知内核。自动调优的混合专家(MoE)与Mamba内核能高效地将混合架构映射到NVIDIA Blackwell GPU上。

并行执行。张量并行将模型分布在四块GPU上,而专家感知执行方式提升了混合专家层的利用率。

前缀与模型状态复用。前缀缓存避免了重复上下文的重新计算,部分前缀匹配可在仅部分前缀匹配时恢复复用能力,同时Mamba状态缓存设置针对该模型架构进行了调优。

调度器、批处理与内存调优。并发序列限制、批处理Token限制、块大小及GPU内存分配,使更多工作能够在不突破延迟目标的前提下同时进行。

MTP推测解码。NIM 2.0.12优化服务栈(包括MTP)将MTP及其相关修复纳入同一优化服务栈中。其增量收益取决于接受率与可用内存余量。

在自身工作负载上对NIM进行基准测试

已发布的曲线只是一个起点,并不能保证每个应用都能获得相同的结果。确定适配程度最快的方法是回放具有代表性的流量,并针对用户关心的延迟指标构建帕累托曲线。

部署确切的软件版本。使用NIM 2.0.12(或更新版本),并在每次运行中固定镜像标签或摘要。

准备具有代表性的流量。使用Mooncake格式的JSONL跟踪记录,或在适当的访问控制和敏感数据脱敏处理下捕获受控的NIM请求。

测量性能。使用NVIDIA AIPerf回放具有代表性的流量并获取性能基准。

选择满足SLO的帕累托点。在满足SLO/延迟约束的各点之间比较输出吞吐量,判断是否适合部署。

(示例代码:AIPerf并发扫描,请将跟踪记录、请求数量和端点详情替换为你想要模拟的工作负载。)

下载并运行Nemotron 3 Ultra NIM

从Nemotron 3 Ultra NIM页面开始,接受相关条款,并选择NIM 2.0.12标签或确切的已发布摘要。下载完成后,查找并选择一个配置文件。以下列出了该NIM中打包的所有配置文件。

(示例代码:列出模型配置文件)

若要为四GPU B200系统上的智能体工作负载选择优化配置文件,可将NIM_MODEL_PROFILE设置为vllm-nvidia-b200-nvfp4-tp4-pp1-throughput-90.0,并启用推测解码。

(示例代码:启动带推测解码的优化配置)

面向生产环境的性能工程起点

NVIDIA NIM将模型和GPU感知的服务优化打包成可部署的微服务。对于运行在4块B200系统上的Nemotron 3 Ultra,这些优化使企业能够在每用户50 TPS的条件下,相比关闭NIM的基准配置服务多达2.5倍的用户,同时保持部署路径在真实多用户服务场景中的实用性。

NIM将经过验证的性能工程与定期推理栈更新、CVE处理、硬件验证以及通过NVIDIA AI Enterprise提供的商业支持结合在一起。未来还计划针对更广泛的模型范围推出更多性能优化的NIM配置,为开发者提供更多经过验证的起点,以满足其自身的延迟、吞吐量和成本目标。

开始使用

从NGC下载Nemotron 3 Ultra NIM 2.0.12,在你的NVIDIA GPU基础设施上运行,并使用NVIDIA AIPerf回放具有代表性的流量,以选择满足你应用目标的帕累托点。

资源

在NGC上下载Nemotron 3 Ultra NIM

试用托管API

阅读NIM文档

Q&A

Q1:NVIDIA NIM能带来多大的性能提升?

A:在4块B200 GPU上运行Nemotron 3 Ultra时,NIM 2.0.12优化服务栈相比未优化的基准配置,最高可实现2.5倍的用户吞吐量提升,同时保持每用户50 TPS的响应速度。

Q2:NIM 2.0.12的性能提升主要来自哪些优化?

A:主要来自精度与自动调优内核、张量并行执行、前缀与模型状态复用、调度批处理与内存调优,以及MTP推测解码等多层优化组合共同作用的结果,而非单一开关的简单叠加。

Q3:如何在自己的业务场景中验证NIM的性能表现?

A:可以部署NIM 2.0.12版本,使用具有代表性的流量数据(如Mooncake格式的JSONL跟踪记录),通过NVIDIA AIPerf工具回放流量并测量性能,最终根据延迟约束选出满足业务需求的最佳配置点。

NVIDIA