人工智能

开源AI模型的演进速度前所未有,但将其集成到原生应用程序中,往往仍需要针对特定模型进行格式转换,并编写预处理、后处理及运行时代码。

NVIDIA TensorRT Model Connect开源参考实现集合正是为解决这一痛点而生。TensorRT Model Connect向开发者展示了如何在原生C++应用程序中,借助NVIDIA TensorRT运行已支持的模型。开发者可以自由使用、查阅、修改和扩展这些实现。Model Connect旨在支持开放模型生态系统,覆盖TensorRT所能运行的所有平台。

本文将介绍NVIDIA TensorRT Model Connect的核心功能,以及如何仅用两条命令,将一个Hugging Face模型从检查点部署到原生C++推理状态。同时,本文还将介绍TensorRT Model Connect提供的两个API层级、如何集成自定义GPU内核,以及该项目如何持续跟进开放模型生态系统的发展。

两个阶段,一份构件,快速完成部署

将模型投入生产环境,本不应要求开发者具备深厚的编译器专业知识。Model Connect将部署过程分为两个阶段,两者之间仅需一份中间产物(bundle)相连。

第一阶段:从Hugging Face模型ID或本地检查点构建部署bundle:

trtmc build Qwen/Qwen3-0.6B -o qwen3-0.6B.bundle

生成的bundle包含TensorRT引擎以及运行时所需的模型专属资源。

第二阶段:原生C++应用程序加载该bundle,直接处理任务级输入与输出:

#include <trtmc/pipeline.h>

auto pipeline = trtmc::load("qwen3-0.6b.bundle");

auto result = pipeline->generate("Explain why native inference matters.", {.max_new_tokens = 20});

std::cout << result.text << std::endl;

Model Connect负责处理检查点映射、TensorRT引擎构建、预处理、运行时调度和后处理等所有环节。开发者从一开始就能获得完整可用的实现,而无需为每个模型系列重复搭建集成流程。

模型准备阶段可以使用Python,但部署后的应用程序在生产环境中原生运行,无需PyTorch或Python解释器。

两级C++ API,灵活适配不同需求

Model Connect提供两个层级的C++ API。语义API层支持开发者直接操作熟悉的输入输出形式,例如文本提示、图像和音频,Model Connect在后台自动处理模型专属的预处理、执行和后处理流程。

若需要更精细的控制,模块级API支持开发者直接操作命名张量和独立的TensorRT组件,从而自定义推理流水线。两个API层级均基于相同的Model Connect实现,开发者可以先从简单的任务级接口入手,仅在有需要时再深入定制流水线。

通过TVM FFI集成自定义GPU内核

TVM FFI提供了一套与语言无关的接口,用于调用GPU内核,同时避免调用系统与内核实现框架或运行时之间产生紧耦合。

借助TensorRT Model Connect中的TVM FFI,开发者可以将模型中的特定部分替换为自定义GPU内核,同时由TensorRT继续执行推理流水线的其余部分。这使得集成专用内核或新开发的内核变得更加便捷,无需围绕独立运行时重构整个应用程序。具体示例可参考"自定义内核集成"教程。

Model Connect的定位:桥接工具,而非新框架

Model Connect并非一个新的推理框架,也不是TensorRT的替代品。它是开放模型端到端推理体验与TensorRT将计算图转化为GPU加速引擎能力之间的桥接层。

每个模型的实现承担三项功能:

在支持TensorRT的原生应用程序中运行已支持的开放模型;提供完整、可查阅的模型及其推理流水线的参考实现;为相关架构、自定义检查点或应用需求提供可扩展的基础。

这为更广泛的生态系统提供了一条从模型ID到TensorRT部署的更清晰路径。应用开发者可以直接基于可运行的代码展开工作;社区贡献者则可以复用现有模式为新模型添加支持,无需从零开始。

目标明确:只要TensorRT可用,所有受支持的开放模型就应有一条一致的Model Connect部署路径。

AI原生开发模式,持续跟进模型生态

开放模型生态系统演变迅速,新架构和检查点层出不穷,参考库必须以同等速度保持更新。

Model Connect采用AI原生软件项目的开发模式——编码智能体在人工指导和审核下生成实现代码、测试用例、集成方案和文档。这使得项目能够在保持一致架构和用户体验的同时,并行开发和验证多个模型实现。

Model Connect采用夜间发布机制,缩短从新模型出现、用户反馈或社区贡献到可用实现之间的周期。自动化验证是发布的把关环节。更快的发布节奏有助于新模型支持、问题修复和体验改进更及时地送达用户。

高性能与易用性兼顾

Model Connect基于TensorRT构建,性能始终是核心考量。对于已支持和经过验证的工作负载,Model Connect的推理速度可超越torch.compile,且每个实现会随项目演进持续接受测试和优化。

性能的提升不应以牺牲易用性为代价。Model Connect将完整工作流整合在一起:查找模型ID、构建模型、从C++加载模型、按需调整配置。开发者在获得一条通往高性能TensorRT推理的便捷路径的同时,仍保留了查阅、定制和优化底层推理流水线的能力。

立即上手

访问NVIDIA/TensorRT-Model-Connect GitHub仓库,查找已支持的实现并构建模型bundle。你可以直接使用现有实现,也可以针对自己的应用场景进行定制,或者贡献新的模型支持,帮助下一位开发者将更多开放模型引入TensorRT。

如果希望使用无需复杂配置的AI原生快速入门方案,可在任意可访问的目录下打开终端,将以下提示词粘贴到编码智能体中,几分钟内即可完成完整部署:

/goal 将 https://github.com/NVIDIA/TensorRT-Model-Connect.git 克隆到当前工作区的新目录 TensorRT-Model-Connect 中。检测当前GPU计算能力,修改仓库开发用Docker镜像,构建并启动容器,安装TensorRT-Model-Connect,仅针对该SM编译CLI、TensorRT后端及所有原生模型DSO,然后构建并运行Qwen/Qwen3-0.6B的端到端冒烟测试。不要提交或推送任何更改。报告测试结果,并展示推理运行的完整命令、输入和输出。

更多关于模型覆盖范围、架构细节和完整开发者指南的内容,请参阅TensorRT Model Connect官方文档。

Q&A

Q1:NVIDIA TensorRT Model Connect是什么,主要解决什么问题?

A:TensorRT Model Connect是NVIDIA推出的开源参考实现集合,旨在解决将开放AI模型集成到原生C++应用时,需要针对不同模型反复编写转换、预处理、后处理及运行时代码的繁琐问题。它将部署流程分为两个阶段:第一步用一条命令从Hugging Face模型ID构建部署bundle,第二步在C++应用中加载bundle直接运行推理,全程无需PyTorch或Python解释器。

Q2:TensorRT Model Connect提供哪两种C++ API,分别适合什么场景?

A:TensorRT Model Connect提供语义API和模块级API两个层级。语义API适合大多数开发者,直接操作文本提示、图像、音频等熟悉的输入输出形式,后台自动处理预处理和后处理;模块级API适合有精细控制需求的场景,支持直接操作命名张量和独立TensorRT组件,自定义推理流水线。两者基于相同底层实现,可按需选择或组合使用。

Q3:TensorRT Model Connect如何保持对新模型的持续支持?

A:Model Connect采用AI原生开发模式,由编码智能体在人工指导和审核下并行生成多个模型的实现代码、测试和文档。项目通过夜间发布机制缩短从新模型出现到可用实现的周期,以自动化验证作为发布把关环节,确保新模型支持、问题修复和体验改进能快速到达用户手中。

NVIDIA