存储是每一个智能体AI工作流的核心组成部分。当智能体检索企业知识、访问持久化内存、复用键值(KV)缓存数据、执行工具调用并生成新结果时,存储系统必须持续供给并保护驱动智能体推理循环所需的数据。
每个智能体执行步骤都可能触发多次存储操作,而这些操作会在数千个并发智能体之间反复执行,且上下文窗口规模不断增大。要完成这些数据的供给与保护,仅依靠基本的读写操作远远不够。AI推理在GPU上运行,但智能体进程、工具调用、数据管理任务以及支撑这些操作的存储服务,均运行在CPU上。
在写入过程中,存储系统可能需要对数据进行压缩和加密、计算校验和并计算冗余。在读取过程中,则需要在将数据返回给应用程序之前完成校验、解密、解压缩或数据重建。这些功能对于AI系统的安全性和可靠性至关重要,同时也需要CPU在数据流经存储路径时进行额外处理。
随着智能体并发量(多用户、多AI智能体或多任务并行运行)与上下文数据量的持续增长,存储系统必须在不影响应用响应速度或Token生成效率的前提下,完成更多处理工作,并以加速计算所需的速率供给数据。
上述许多功能直接位于数据传输路径上,任何一个操作的延迟都可能拖慢整体数据流。若依赖传统CPU进行扩展,则可能需要增加更多核心、消耗更多电力并加大散热投入,在提高基础设施成本的同时,性能仍受制于最慢的处理环节。如果负责数据加密、保护和预处理的处理器无法跟上处理速度,更快的SSD和网络也难以发挥其全部潜力。
NVIDIA Vera CPU加速存储处理
NVIDIA Vera BlueField-4 STX存储处理器是NVIDIA STX原生AI数据平台基础架构的核心组件,将NVIDIA Vera CPU的算力直接引入存储数据路径。这一Vera CPU架构最初为持续为NVIDIA Rubin GPU供给数据而设计,同样可以加速CPU端的存储处理工作。
基准测试结果显示,Vera在加密与解密、数据恢复、完整性校验、压缩与解压缩,以及多阶段存储管道等方面均优于x86 CPU。这些性能提升使存储平台能够以更低的CPU和功耗开销处理更多数据并提供完整的企业级数据服务,同时更高的压缩吞吐量有助于降低存储容量和带宽需求。
本文将介绍BlueField-4 STX中的Vera CPU如何加速智能体AI所需的存储处理,帮助原生AI存储平台在提升存储处理吞吐量与效率的同时,对更多数据实现安全保护、完整性验证和压缩处理。
Vera CPU架构概览
Vera CPU搭载88个NVIDIA自研Olympus CPU核心,完全兼容Armv9.2指令集,支持176个NVIDIA空间多线程(Spatial Multithreading)线程。这些核心与NVIDIA可扩展一致性互联结构(SCF)、小型压缩附加内存模块(SOCAMM2)LPDDR5X内存相结合,在保持强劲单线程性能的同时,能够在AI工厂级规模下实现高吞吐量CPU执行。
SCF在核心、共享缓存、内存控制器和I/O之间提供片上一致性数据路径,具备高达3.4 TB/s的截面带宽和164 MB统一三级缓存,确保活跃核心在工作负载扩展过程中拥有高带宽、可预期的共享数据访问能力。SOCAMM2 LPDDR5X内存子系统进一步提供高达1.2 TB/s的聚合内存带宽,即每核心最高14 GB/s,有助于在带宽密集型和高并发工作负载下持续供给Olympus核心。模块化、可现场更换的内存设计将LPDDR5X的能效优势与数据中心基础设施所需的可维护性和可靠性相结合。
存储基元对CPU提出两类不同的需求:一是在每条数据流内部,加密、完整性校验、数据恢复、压缩和解压缩必须快速完成,方能推进后续存储处理,因此持续的单核性能至关重要;二是在整个系统层面,这些操作需跨越大量并发数据流运行,并反复通过缓存和内存移动数据,因此带宽和可预期的延迟同样不可或缺。
Vera针对这两类需求均有所设计。Olympus核心融合了宽指令吞吐量、先进的分支预测、深层乱序执行,以及向量和密码学处理资源,帮助每个核心在控制密集型和数据处理代码中保持持续的指令吞吐量。
NVIDIA空间多线程、单片计算芯片、SCF、统一三级缓存和高带宽SOCAMM2内存协同作用,在减少线程间干扰的同时,帮助活跃核心持续获取数据供给,并支持在负载下实现更可预期的数据访问。这些能力共同解释了Vera在加密、完整性校验、奇偶校验计算、压缩以及多阶段存储管道测试中取得显著性能提升的原因。
这使BlueField-4 STX存储处理器能够在无需按比例增加CPU资源、功耗和散热的前提下,跨并发数据流持续提供更多CPU端存储处理能力。
基准测试方法论
存储任务在存储读取、写入和恢复路径上被反复执行。其吞吐量和效率决定了CPU端处理是否能够跟上SSD和网络的速度,还是会成为数据路径中的瓶颈环节。本文中的存储基元微基准测试对这些功能进行了独立评估,用于衡量处理器的实际贡献,展示Vera在构建高吞吐量、高效率存储服务方面的CPU性能与处理余量。
每项测试在单一进程内运行,使用已驻留于内存中的数据,不涉及文件I/O、磁盘性能、网络通信、命令启动及外部设备瓶颈(另有说明的除外)。测试套件采用了OpenSSL、Zstandard和LZ4等通用库,以及针对Arm和x86处理器原生指令优化的对应实现。
专用测试框架对每项工作负载进行一致性管理,控制缓冲区大小、线程数量、CPU分配、计时、正确性验证和结果收集。所采用的算法及大部分软件实现均被广泛采用。该测试框架对Vera和x86采用相同的工作负载定义和控制条件,从而实现处理器间的一致性比较。测试结果可通过源代码、脚本、固定软件版本、配置和结果文件进行复现,但完整测试套件并非现成的公开基准测试。
这些测量结果确立了Vera在影响数据安全传输、弹性恢复、容量效率和服务密度等关键存储构建块上的性能表现。在实际生产环境中,存储路径通常对同一数据执行多种操作,导致CPU处理需求累积叠加。
当这些操作组合应用于生产存储软件时,各单项操作的性能共同构成聚合吞吐量和CPU效率。各基元及多阶段管道吞吐量的提升,为存储软件提供了更多CPU处理余量,以跟上SSD和网络速度、支持并发数据流,并高效提供核心数据服务。完整的端到端测试仍需用于量化存储系统或GPU性能的整体结果。
加密与解密性能提升
AI工厂处理大量敏感信息,包括模型资产、企业知识、智能体上下文、提示词、输出结果及客户数据。AES-128广泛用于静态数据和传输中数据的加密。加密直接位于写入路径上,其吞吐量决定了平台每秒可处理的安全数据量。Vera提供的AES-128加密吞吐量最高可达对比x86 CPU的1.43倍。
解密则对应读取路径上的反向操作,Vera的AES-128解密吞吐量最高可达对比x86 CPU的1.29倍。
更高的加密吞吐量使存储系统能够在不制约写入速度的情况下保护更多数据,而更快的解密速度则缩短了将受保护数据返回给智能体、应用程序或加速器所需的时间。这有助于存储系统在不消耗更多存储性能预算的情况下,保护并返回规模持续增长的AI数据。
纠删码恢复性能
存储平台采用纠删码技术,在磁盘、节点或数据片段不可用时保护数据。Reed-Solomon编码用于创建冗余,而恢复操作则利用该冗余重建丢失或损坏的数据。编码通常发生在写入路径上,恢复则发生在重建、修复或降级读取期间,两者因计算模式和内存访问模式不同而呈现出差异化的性能结果。
Vera在恢复工作负载中的Reed-Solomon吞吐量最高可达对比x86 CPU的3.26倍。
更高的Reed-Solomon吞吐量使存储系统能够更快地写入受保护数据并重建丢失数据。在部分效率测量中,Vera还能在相同CPU功耗预算内完成更多保护工作,有助于缩短重建时间并减少与正常数据服务之间的资源竞争。
数据完整性校验
数据在移动、存储和检索过程中必须保持正确性。循环冗余校验(CRC)通过生成校验和,帮助存储系统检测意外数据损坏。
CRC与Reed-Solomon承担互补的职责:CRC用于检测数据是否与预期结果不符,Reed-Solomon则提供重建丢失或损坏信息所需的冗余。存储系统可能在写入和读取路径上均需计算CRC,包括在缓冲区之间复制数据时。随着数据量的增长,这些校验操作可能消耗大量CPU资源。
Vera的CRC32C吞吐量最高可达对比x86 CPU的3.67倍。
更高的CRC32C吞吐量使存储系统能够在不因完整性校验而限制读写速度的情况下验证更多数据。对于智能体工作负载而言,这有助于以更低的CPU端处理延迟返回可靠的上下文、持久化内存和企业数据。
压缩与解压缩性能
智能体AI产生大量上下文、日志、检查点、检索数据、中间输出和持久化内存数据。压缩可降低这些数据所需的存储容量及传输带宽,解压缩则在数据读取时还原原始内容。压缩可能以内联方式或在数据写入后执行,具体取决于存储架构;解压缩通常在读取压缩数据时触发。压缩吞吐量影响数据缩减速度,解压缩吞吐量则影响存储系统向智能体AI应用返回数据的速度。以下基准测试对这两项操作分别进行了独立评估。
Vera的压缩吞吐量最高可达对比x86 CPU的3.29倍,且在所测量的各线程数下均能保持这一优势。解压缩基准测试衡量读取压缩数据时的对应操作,在并发条件下,Vera的解压缩吞吐量最高可达对比x86 CPU的1.72倍,且随着并行工作线程数量的增加,优势进一步扩大。
压缩性能因算法、数据特性、压缩级别、缓冲区大小和线程数量的不同而存在差异,因此上述结果仅适用于所测量的工作负载。更高的压缩吞吐量使存储系统在保持CPU端处理性能的同时,能够减少写入、存储和传输的数据量;更高的解压缩吞吐量则帮助存储系统更快地将解压后的数据返回给智能体和应用程序。这两项能力共同降低了存储容量和带宽的压力,同时使每个处理器能够随智能体AI工作负载的增长压缩和解压缩更多数据。
多阶段存储管道测试
存储系统很少独立执行单项数据服务。在典型的安全写入路径中,可能先对数据进行压缩以减少存储占用,再进行加密后写入。本次基准测试包含一个内存驻留管道,该管道对每个数据缓冲区依次执行压缩和加密操作。与此前分别测量单项操作的基准测试不同,本测试衡量两项CPU密集型存储功能顺序执行时的总管道吞吐量。
在压缩与加密组合的两阶段管道中,Vera的管道吞吐量最高可达对比x86 CPU的3.21倍。
这一结果表明,Vera的性能优势不仅体现在此前测量的单项操作中,还延伸至代表性存储写入路径的多阶段处理序列——该路径同时实现了数据缩减和数据保护。更高的多阶段管道性能使存储系统能够以每个处理器处理更多数据,有助于在智能体AI数据量持续增长的情况下维持写入吞吐量。
结语:Vera CPU为智能体AI时代的存储加速而生
智能体AI使CPU执行与存储处理成为同一AI工厂数据路径的组成部分。CPU在模型调用之间运行工具、代码、检索、分析和数据处理步骤;存储系统则负责对这些步骤所需的数据进行安全保护、完整性验证、压缩处理和按需返回。两者都必须在AI工厂有限的CPU、电力和散热资源内实现扩展。
Vera专为加速智能体AI时代的CPU密集型工作而设计。在NVIDIA Vera Rubin中,它作为NVIDIA GPU的主机CPU承担智能体执行工作;独立Vera在智能体工具中可提供最高1.8倍的单核性能提升;在BlueField-4 STX中,Vera则为原生AI存储平台的CPU端处理提供算力支撑。
基准测试结果显示,Vera在以下方面均实现了显著加速:用于安全数据访问的加密与解密;用于在存储重建与修复过程中快速重建丢失或损坏数据的Reed-Solomon恢复;用于高吞吐量完整性验证的CRC32C;以及用于降低容量和带宽需求、加速数据检索的压缩与解压缩。
通过在单项操作和多阶段写入路径中持续提供上述能力,Vera帮助原生AI存储平台以更低的CPU端延迟处理并返回安全、可靠的数据,同时支持更多并发数据流和更高的服务密度,而无需按比例增加CPU资源、电力和散热投入。在部分工作负载中,Vera还实现了更高的每瓦性能,使处理器在有限的功耗预算内完成更多CPU端存储处理工作。
计算与存储之间统一的Vera CPU架构和软件工具链,为同步扩展智能体执行能力与支撑性数据基础设施提供了一致的技术基础。
Q&A
Q1:NVIDIA Vera CPU与传统x86 CPU在存储处理上的性能差距有多大?
A:根据基准测试结果,Vera CPU在多项存储处理任务中显著优于x86 CPU。具体来看:AES-128加密吞吐量最高提升1.43倍,AES-128解密最高提升1.29倍;Reed-Solomon恢复最高提升3.26倍;CRC32C完整性校验最高提升3.67倍;压缩吞吐量最高提升3.29倍,解压缩最高提升1.72倍;两阶段压缩加密组合管道吞吐量最高提升3.21倍。这些提升使存储平台能够在不增加CPU、功耗和散热资源的前提下处理更多数据。
Q2:BlueField-4 STX存储处理器的主要用途是什么?
A:NVIDIA Vera BlueField-4 STX存储处理器是NVIDIA STX原生AI数据平台基础架构的核心组件,专为加速智能体AI工作负载中的CPU端存储处理而设计。它将Vera CPU的算力直接引入存储数据路径,负责加密、解密、纠删码恢复、数据完整性校验、压缩和解压缩等关键存储操作,帮助存储平台在高并发AI推理场景下以更低延迟、更高效率供给和保护数据。
Q3:Vera CPU有哪些核心架构特点支撑其存储处理性能?
A:Vera CPU搭载88个自研Olympus核心,兼容Armv9.2指令集,支持176个空间多线程线程。其核心架构优势包括:NVIDIA可扩展一致性互联结构(SCF)提供高达3.4 TB/s截面带宽和164 MB统一三级缓存;SOCAMM2 LPDDR5X内存子系统提供高达1.2 TB/s聚合内存带宽(每核心最高14 GB/s);Olympus核心具备宽指令吞吐量、先进分支预测、深层乱序执行,以及向量和密码学处理资源。这些特性共同保障了高并发数据流下的持续存储处理能力。
