AI智能体已将推理从单轮交互扩展为多步骤工作流,能够进行推理、调用工具、协调子智能体,并在每轮对话中承载不断增长的上下文。这一转变的规模如今已在实际数据中清晰可见:OpenRouter的AI现状报告对10万亿Token的真实使用数据进行分析后发现,每次请求的平均提示Token数量增长了约四倍,而单次智能体请求所消耗的Token是普通对话的15倍。
如何准确评估此类工作负载下的硬件性能,带来了全新挑战。一个有效的基准测试必须能够覆盖长上下文预填充、KV缓存复用、交互式解码、工具调用间隙,以及在真实并发条件下的分布式混合专家(MoE)执行,同时还要呈现AI工厂在可接受的用户体验前提下,将功耗预算转化为有效智能体吞吐量的效率。
本文重点介绍SemiAnalysis AgentX基准测试,该测试通过回放生产级会话来评估AI基础设施在智能体编码推理场景下的表现。Vera Rubin NVL72预览结果显示,其每兆瓦AI工厂吞吐量最高可达GB300 NVL72的30倍;与此同时,Blackwell GB300 NVL72将其相较于上一代产品在每兆瓦吞吐量上的数量级优势,进一步延伸至动态智能体工作负载场景。
AgentX是SemiAnalysis开源基准套件InferenceX中的智能体编码基准测试,用于衡量加速器在处理真实编码智能体所产生请求模式时的效率。
智能体会话具有长时、有状态和多变的特点:它们将模型调用、工具使用和持续增长的上下文串联在一起,而非遵循固定的提示-响应模式。AgentX因此专门衡量平台能否快速响应地回放智能体流量、复用已处理的上下文,并最大化每个预配置兆瓦的智能体吞吐量。
在DeepSeek-R1-0528的传统InferenceX静态8K/1K序列长度测试中,GB300 NVL72领先H200多达40倍(以每兆瓦Token数计)。但该场景代表的是受控的固定长度服务,而非智能体在生产环境中产生的真实流量。
在真实的智能体会话中,请求长度因轮次而异,上下文在任务执行过程中持续累积,已处理的Token可被复用,模型调用也会因工具执行或任务委派而中断。随着智能体AI成为主流工作负载,固定序列长度的测试场景已越来越难以反映真实的服务性能,并已在InferenceX套件中降级为"维护模式"。
AgentX通过对包含交替推理和工具使用的Claude Code预录制会话进行测量,弥补了上述不足。它使用AIPerf客户端逐轮回放每个会话。由于所有系统接收的都是相同的录制流量,观察到的差异反映的是服务栈本身的性能,而非针对基准测试的专项调优。
回放过程保留了每个会话的上下文及输入/输出序列长度,以及原始轨迹中捕获的推理时间和工具调用延迟,从而复现KV缓存容量压力——这是一个真实基准测试必须捕获的关键要素。
AgentX通过改变并发数来映射吞吐量与交互性之间的权衡关系。在每个运行点,它会报告每预配置兆瓦的持续吞吐量,以及各服务栈复用重复上下文的能力。
对AI工厂而言,AgentX最关键的指标是每兆瓦Token数。该基准测试结合四种用户体验值来报告此指标,分别为:端到端归一化交互性、标准交互性、端到端延迟,以及首Token时间(TTFT)。
以下Vera Rubin NVL72结果由英伟达使用SemiAnalysis AgentX工作负载测量得出,目前正待SemiAnalysis审核。在AgentX DeepSeek V4-Pro工作负载、每用户每秒160个Token的条件下,Vera Rubin NVL72每兆瓦AI工厂吞吐量最高可达GB300 NVL72的30倍,表明在维持相同交互服务目标的同时,智能体推理能力实现了大幅提升。
在AgentX测试中,针对DeepSeek V4 Pro 1.6T工作负载,GB300 NVL72每兆瓦AI工厂吞吐量最高达到H200 NVL8的15倍,即在相同功耗预算内提供了更高、响应更及时的智能体推理吞吐量。
这一吞吐量优势直接体现在单位经济效益上。GB300 NVL72每百万Token的成本最高可降至H200 NVL8的十分之一。对于运营商而言,这意味着固定的功耗和基础设施预算可以支撑数量级更多的交互式智能体容量,或以大幅降低的运营成本提供相同容量。
GB300 NVL72的优势随模型规模的扩大而愈发显著。在AgentX工作负载中,针对Kimi K3 2.8T模型,GB300 NVL72每兆瓦吞吐量约为H200 NVL8的80倍,同时还将交互性边界扩展至每用户每秒约215个Token,远超H200 NVL8所能达到的运行范围。
GB300 NVL72的上述结果源于服务运行时、模型内核和扩展互联架构等系统层面的协同优化,使大型MoE模型能够在智能体会话上下文不断累积、并发数增加、解码需求持续加剧的情况下,保持高响应吞吐量。
MoE服务运行时:SGLang、TensorRT-LLM和vLLM等框架可在NVL72域内分布式执行专家模块。宽专家并行(Wide Expert Parallelism)和DeepEP等技术有助于跨更多GPU均衡专家工作负载,增加可用于并发智能体请求的有效批处理规模。
MoE内核与通信重叠:基于DeepGEMM的内核、MXFP4和MXFP8等混合精度格式,以及融合MoE执行路径,减少了专家阶段之间的数据移动耗时。通过将专家并行通信与Tensor Core计算重叠,服务栈可提升推理和编码工作负载的Token吞吐量。
英伟达Dynamo:Dynamo将预填充和解码拆分为可独立扩展的工作池,使每个阶段都能按自身性能需求进行配置。它还通过会话ID支持感知会话的服务,将相关模型调用、工具跨度和追踪信息关联到同一智能体运行过程中。其KV缓存感知路由器利用缓存重叠率和工作节点负载来选择目标,减少不必要的预填充计算,并在智能体会话复用上下文时帮助维持响应式多轮服务。
英伟达NVLink扩展互联架构:NVLink将GB300 NVL72中的72颗GPU连接在一个高带宽扩展域中,使服务大型模型所需的计算、内存、专家并行通信和KV缓存移动能够作为一个协调的机架级系统协同运行。
Vera Rubin NVL72展示了当机架级系统针对智能体推理所需的长上下文、交互式和分布式执行模式进行调优时所能达到的性能上限。更宏观的Vera Rubin平台将这一理念延伸至完整工作流:Rubin GPU高效处理大上下文与解码,Vera CPU负责工具执行和KV缓存卸载,Groq 3 LPX则实现超快交互响应。
在AI工厂层面,NVLink 6、ConnectX-9、BlueField-4和Spectrum-X负责在各资源之间传输Token、上下文和工具结果;Dynamo、Attention-FFN解耦、NVFP4、TensorRT-LLM WideEP和推测性解码协调跨最适合处理器的执行。其目标简单明确:减少重复计算和等待,在智能体会话增长过程中维持交互性能,并将固定功耗预算转化为更多有效的智能体产出。
Q&A
Q1:SemiAnalysis AgentX基准测试是什么?和普通基准测试有什么区别?
A:AgentX是SemiAnalysis开源基准套件InferenceX中专门针对智能体编码推理的测试工具。与传统固定序列长度的静态基准不同,AgentX通过回放真实Claude Code生产级会话,模拟包含推理、工具调用和上下文累积的动态工作流,能更真实地反映AI工厂在智能体场景下的实际服务性能,其核心指标是每兆瓦Token数,结合端到端延迟和首Token时间共同衡量用户体验。
Q2:Vera Rubin NVL72相比GB300 NVL72性能提升有多大?
A:根据英伟达使用AgentX基准测试的预览数据,在DeepSeek V4-Pro工作负载、每用户每秒160个Token的交互目标下,Vera Rubin NVL72的每兆瓦AI工厂吞吐量最高可达GB300 NVL72的30倍,意味着在相同功耗预算内,Vera Rubin NVL72能支撑大幅更多的交互式智能体并发请求,智能体推理能力获得显著提升。该结果目前仍待SemiAnalysis独立审核。
Q3:GB300 NVL72相比H200 NVL8在智能体工作负载下的成本优势如何体现?
A:在AgentX测试中,GB300 NVL72针对DeepSeek V4 Pro 1.6T模型的每兆瓦吞吐量最高达H200 NVL8的15倍,每百万Token成本最高降低至H200 NVL8的十分之一。对于运营商而言,这意味着同等功耗和基础设施投入可以支撑数量级更多的智能体并发容量,或以大幅更低的运营成本实现相同服务规模。针对更大规模的Kimi K3 2.8T模型,这一优势进一步扩大至约80倍每兆瓦吞吐量。
