随着大语言模型推理在个人、企业及受监管场景中处理越来越多的敏感信息与专有模型上下文,数据必须在可信环境中进行处理。NVIDIA机密计算(CC)提供了一种途径,通过内存加密的机密虚拟机(CVM)、机密GPU以及加密的NVIDIA NVLink,在可信硬件上安全运行这些工作负载,从而实现生产级AI推理的安全执行。

推理框架,如NVIDIA TensorRT LLM,通过将框架级优化与NVIDIA加速计算相结合,提供业界领先的AI推理性能。但当这些框架运行在启用机密计算的环境中时,安全执行会改变内存移动、时序、调度以及多GPU通信背后的原有假设。如果运行时不做相应调整,这些变化会带来性能开销。因此,要保持高性能,需要将推理框架与机密计算环境协同优化。

对于正在评估NVIDIA Blackwell GPU上机密推理方案的AI平台工程师,本文探讨了TensorRT LLM等AI推理框架为适应安全执行、同时尽力保持推理性能所做的机密计算感知优化。文中还提供了一套可控的评估方法,供团队据此量化其自身工作负载中的机密计算开销。

选择能够体现机密计算开销的工作负载

工作负载的特性决定了机密计算开销的可见程度。高请求量可以通过与其他工作重叠来分摊固定的加密成本,从而使直接影响更难被观察到。

为了显现这些影响,需要选择具有长输入上下文、较长输出生成过程以及低并发度的工作负载。长上下文会在预填充阶段加大数据移动压力,较长的生成过程会在解码阶段放大每个Token的机密计算开销,而低并发度则限制了在多个并发请求间分摊这些成本的空间。

NVIDIA性能工程团队在本次评估中即采用了具备上述特性的工作负载。

通过受控的开启与关闭对比测量机密计算开销

为了分离出机密计算对性能的影响,需要在两种条件下运行相同的工作负载:关闭机密计算(CC off)与开启机密计算(CC on),同时保持模型、硬件、框架版本、序列长度、并行方式以及并发度不变,使机密计算状态成为唯一变化的变量。

在每个并发级别下:

保留的输出吞吐量为:100 × (开启机密计算时的输出Token/秒 ÷ 关闭机密计算时的输出Token/秒)

每Token输出时间(TPOT)的延迟开销为:100 × (开启机密计算时的TPOT ÷ 关闭机密计算时的TPOT – 1)

性能团队可以利用这些指标,量化在目标工作负载启用机密计算后,相对于关闭状态基线还能保留多少性能。NVIDIA性能工程团队依据表2所示的硬件与软件配置进行了这一对比测试。

性能测试结果

如图1和图2所示,在并发数1至16的范围内,开启机密计算后仍能保留关闭状态下96.1%至98.2%的输出Token吞吐量,而平均TPOT相较基线的增幅在1.2%至4.3%之间。

识别并降低机密计算开销

NVIDIA Blackwell机密计算架构引入了硬件级安全路径,用以保护使用中的数据和工作负载。关于该架构的详细介绍,可参阅相关文档《不牺牲速度的硬件级AI安全》。

对于TensorRT LLM用户及框架开发者而言,以下内容说明了这些安全路径如何改变常见的运行时假设,以及TensorRT LLM如何进行适配以降低由此产生的性能开销。

适配主机到设备的数据移动

在B200机密计算环境中,主机到设备的数据传输需要经过一个软件加密的中转缓冲区,因为GPU无法直接访问受保护的CVM内存。这改变了推理框架原有的行为预期:固定内存(pinned memory)不再具备通常的异步传输优势,部分拷贝操作还可能阻塞调用线程。

针对主机到设备的优化:TensorRT LLM采用机密计算感知的内存选择策略,在受影响的路径上选择可分页内存,而非无条件使用固定内存。

针对设备到主机的优化:TensorRT LLM将重复的Token与采样数据回读操作转移至异步工作线程处理,避免受保护的拷贝操作在解码过程中阻塞主调度器。详情可参见TensorRT LLM PR #11573。

稳定内核自动调优的时序测量

内核自动调优器通常使用CUDA事件来比较候选执行策略。但在测试的机密计算配置下,CUDA事件时间戳产生的时序信号不稳定,可能导致自动调优器选择较慢的执行策略。

优化方案:TensorRT LLM在机密计算环境下使用GPU的%globaltimer进行策略测量,而在非机密计算环境中仍保留CUDA事件方式。详情可参见TensorRT LLM PR #11657。

选择适配机密计算的多GPU通信方式

在B200机密计算配置中,NVLS(NVLink SHARP)多播功能不可用。缺少NVLS支持时,NCCL_SYMMETRIC无法发挥其预期的多播优势,但在切换到非多播的集合通信路径之前,仍可能产生内存注册及跨节点同步的开销。

优化方案:面向机密计算场景的框架应检测NVLS的可用性,并根据消息大小、拓扑结构及工作负载特性,选择能够最小化延迟的通信算法。

开启NVIDIA机密计算之旅

NVIDIA机密计算将硬件级保护能力扩展至机密虚拟机、NVIDIA Blackwell GPU以及加密NVLink,在处理专有模型、企业上下文及敏感提示词的过程中提供全程保护。

机密计算并未消除对性能工程的需求,反而使框架层面的适应性变得更加重要。借助TensorRT LLM针对安全数据移动、自动调优与多GPU通信的机密计算感知优化,在8颗NVIDIA B200 GPU上运行的机密DeepSeek-R1推理,仍能保留超过96%的关闭状态输出Token吞吐量,同时将每Token延迟开销控制在5%以内。

随着企业将私有推理逐步推向生产环境,安全配置与推理优化应被视为同一个部署问题的两个方面。建议在启用机密计算、完成环境认证后,使用计划实际服务的工作负载进行开启与关闭状态的基准测试对比。对于正在将私有推理推向生产环境的AI平台工程师和TensorRT LLM用户而言,安全配置与推理优化应当作为一项全栈工程任务来对待。

如需规划机密推理部署,可参考NVIDIA可信计算相关文档,并了解TensorRT LLM的最新功能与发布说明。如需持续关注最新进展,可留意NVIDIA机密计算相关资讯。

致谢

感谢Dan Hansen、Sheel Pethe、Samuel Mendoza-Jonas、Moein Ghaniyoun、Vidhya Krishnan、Avinash Ahuja、Laikh Tewari、Laura Martinez以及Matheen Raza在本项工作中提供的工程贡献、技术指导、分析与细致审阅。

Q&A

Q1:NVIDIA机密计算是什么?

A:NVIDIA机密计算(CC)是一种通过内存加密的机密虚拟机、机密GPU以及加密NVLink,在可信硬件环境中安全处理敏感数据和AI工作负载的技术方案,可用于保护专有模型和企业敏感信息。

Q2:启用机密计算会不会明显降低AI推理性能?

A:测试显示影响较小。在并发数1到16的范围内,开启机密计算后仍能保留96.1%至98.2%的输出Token吞吐量,平均每Token延迟开销仅增加1.2%至4.3%。

Q3:TensorRT LLM是如何降低机密计算带来的性能开销的?

A:TensorRT LLM通过机密计算感知的内存选择、异步数据回读、调整内核自动调优的时序测量方式,以及优化多GPU通信路径等多项适配措施,减少了安全执行对性能的影响。

NVIDIA