AI智能体正在从云端数据中心走向车辆、机器人及其他边缘设备。与只回答单条提示的聊天机器人不同,智能体需要通过一系列步骤完成工作:它会选择工具、评估工具运行结果,并在不断延长的对话中持续推理。
这种工作方式对边缘推理提出了新的要求。模型必须快速生成Token、高效处理长共享历史记录,并在有限的功耗和内存范围内生成有效的工具调用。
在MLPerf Inference v6.1边缘智能体基准测试中,NVIDIA TensorRT Edge-LLM在单块NVIDIA Jetson AGX Thor开发者套件上运行了Qwen3.6-27B模型。该系统实现了每秒52.33个Token的处理速度,并在24分36秒内完成了性能测试工作负载中全部1007轮对话,比llama.cpp参考提交方案的2小时37分钟快6.4倍。该结果采用了NVFP4量化、基于树结构的多Token预测(MTP)以及KV缓存复用技术。
MLPerf如何衡量端到端智能体AI性能
MLPerf边缘智能体基准测试通过两个阶段来衡量与OpenAI兼容的模型端点:性能阶段和准确率阶段。
性能阶段会回放记录下来的软件工程智能体运行轨迹。模型接收用户请求、生成工具调用、观察工具结果,并在同一对话中持续推进。该工作负载包含20个对话和1007轮生成内容。输入长度会随轮次增加而增长,最终达到约2.35万个Token,这使得长上下文处理成为该测试的重要衡量部分。测试还会基于交并比(IoU)衡量内联准确率,以确保性能阶段能够正确运行智能体。
准确率阶段使用伯克利函数调用排行榜(BFCL)v4提示词,仅采用单轮对话并关闭推理功能,以此在边缘设备上兼顾准确率与评估时间。该阶段会评估模型是否选择了正确的函数、是否生成了有效参数,以及在无需调用工具时是否会避免调用工具。
Jetson AGX Thor上的MLPerf边缘智能体基准测试结果
TensorRT Edge-LLM的提交方案在MAXN功耗模式下,于一块配备128GB统一内存的Jetson AGX Thor开发者套件上,以单流(SingleStream)模式运行了Qwen3.6-27B模型。
表1:MLPerf v6.1 NVIDIA边缘智能体提交结果摘要
MLCommons边缘智能体示例还公布了在Jetson AGX Thor上运行的llama.cpp参考方案的测试结果,该方案使用采用Q4_K_M量化的Qwen3.6-27B模型,耗时2小时37分钟完成测试。而TensorRT Edge-LLM的提交方案仅用24分36秒就完成了该工作负载,耗时减少了6.4倍。
使用NVFP4量化加速Qwen3.6-27B推理
众所周知,边缘平台上的低批次大语言模型解码性能会受到DRAM带宽的严重制约。减小权重和激活值的大小,能够降低内核的内存占用,从而提升解码性能。
提交测试的Qwen3.6-27B模型对权重和激活值(包括语言模型头部)采用了NVFP4格式,KV缓存则采用FP8格式。NVFP4是一种4位浮点格式,Jetson AGX Thor中的NVIDIA Blackwell GPU支持这一格式。TensorRT Edge-LLM使用优化过的内核来加速量化后的模型,同时保持满足MLPerf要求的准确率。
更小的模型表征方式也为长上下文、推测解码状态及应用工作负载留出了更多可用的统一内存(总容量128GB)。开发者可以从已发布的、经过校准的Qwen3.6-27B NVFP4检查点开始使用。部署团队既可以直接使用已发布的量化检查点,也可以在任意开发系统上对模型进行一次训练后量化,再进行部署。
跨智能体轮次复用KV缓存
智能体运行轨迹中的每个新请求,都包含此前大部分对话内容,外加一个新的模型响应或工具结果。如果不进行复用,模型必须在每一轮都重新对共享历史记录进行预填充,且随着对话的增长,这一成本也会不断增加。
TensorRT Edge-LLM能够识别可复用的提示词前缀,并恢复其缓存的注意力KV分页。由于Qwen3.6采用混合模型架构,运行时还需要恢复循环状态以及正确继续执行所需的部分KV分页状态,之后仅对对话中新增的后续部分进行预填充。
KV缓存与循环状态的复用,减少了整个智能体运行轨迹中重复的长上下文计算。这一优化与基于树结构的MTP形成互补:缓存复用降低了生成开始前的成本,而MTP则减少了生成过程中目标模型的执行步骤数量。
在该工作负载中,约96%的提示词Token通过热缓存得以处理,运行时在各轮对话中仅需对总计1360万个提示词Token中的约50万个进行预填充。
使用基于树结构的多Token预测加速大语言模型推理
标准的自回归解码方式,每次模型调用只能生成一个Token。而多Token预测则使用一个草稿模型来预测多个未来Token,随后由目标模型对这些Token进行统一验证。目前最新的模型通常都会将官方训练好的MTP权重与主模型一同发布。
除了传统的线性MTP之外,TensorRT Edge-LLM还实现了基于树结构的MTP方案。该运行时并非只保留一个预测的续写内容,而是将高概率的候选内容组织成一棵树。目标模型通过一次前向传播完成对所有候选内容的验证,运行时则会采纳匹配的路径;若多个候选内容均被采纳,系统便可一次性推进多个Token的生成。
用户在启动服务器时可以调整草稿相关参数。MLPerf的服务器配置采用了8个草稿步骤、每个草稿深度下的前2个候选内容,以及一棵包含16个节点的验证树。基于树结构的验证对函数调用尤为有用,因为工具名称、JSON语法及常见参数结构往往具有可预测性,而多分支结构则能为单个参数值保留可能的备选方案。与采用3个草稿步骤的线性MTP相比,基于树结构的MTP在该工作负载中能额外实现约40%的解码性能提升。
如何运行MLPerf边缘智能体基准测试
本次提交所使用的实现方案已在TensorRT Edge-LLM的release/0.9.1-mlpinf分支上开源。该分支包含模型导出设置、TensorRT引擎构建命令、服务器配置以及MLPerf客户端配置。
1. 克隆TensorRT Edge-LLM代码库并初始化其子模块。
git clone --branch release/0.9.1-mlpinf \ https://github.com/NVIDIA/TensorRT-Edge-LLM.git cd TensorRT-Edge-LLM git submodule update --init --recursive
2. 下载经过校准的NVFP4检查点。
huggingface-cli download \ centml/Qwen3.6-27B-NVFP4-W4A4-mlpinf \ --local-dir "$WORK/Qwen3.6-27B-NVFP4-W4A4-mlpinf"
3. 按照mlperf/README.md文件中的说明,构建TensorRT Edge-LLM,使用树结构MTP接口导出检查点,并构建基础与草稿TensorRT引擎。
$VENV/bin/python -m tensorrt_edgellm.scripts.export \ "$WORK/Qwen3.6-27B-NVFP4-W4A4-mlpinf" \ "$WORK/onnx" \ --mtp-tree-base --skip-visual
4. 启动与OpenAI兼容的TensorRT Edge-LLM服务器。
export REPO="$PWD" export VENV=/path/to/venv-edgellm-export export WORK=/path/to/mlperf-artifacts bash mlperf/serve_edgellm.sh
5. 克隆MLCommons端点测试工具,安装其BFCL相关依赖项,在mlperf/config.yaml文件中更新模型和分词器的路径,然后运行基准测试。
git clone https://github.com/mlcommons/endpoints.git cd endpoints python3.12 -m venv .venv source .venv/bin/activate pip install -e ".[dev,bfcl]" inference-endpoint benchmark from-config \ --config "$REPO/mlperf/config.yaml"
所提供的配置文件会以温度参数0、种子值42、关闭推理功能、并发数1的设置,运行性能阶段和准确率阶段的测试。若只想运行BFCL准确率阶段测试,可使用--accuracy-only选项。有关数据集与客户端配置的更多信息,请参阅MLCommons边缘智能体示例。
如需查看MLPerf Inference v6.1所有提交方案的完整测试结果,请参阅MLCommons发布的公告。如需了解服务器规模的Vera Rubin性能表现,请参阅《NVIDIA Vera Rubin NVL72在MLPerf Inference v6.1首秀中展现领先性能》一文。
致谢
本项工作凝聚了NVIDIA TensorRT Edge-LLM、ModelOpt、Jetson及MLPerf团队的贡献,尤其要感谢Zihao Kong、Xiang Guo、Yoco Xiao、Qikai Li和Ashwin Nanjappa。同时感谢MLCommons社区开发了边缘智能体基准测试及端点测试工具。
Q&A
Q1:TensorRT Edge-LLM在MLPerf边缘智能体基准测试中表现如何?
A:TensorRT Edge-LLM在Jetson AGX Thor开发者套件上运行Qwen3.6-27B模型,实现了每秒52.33个Token的速度,24分36秒内完成全部1007轮测试,比llama.cpp参考方案快6.4倍。
Q2:TensorRT Edge-LLM是如何实现加速效果的?
A:主要依靠三项技术:NVFP4量化降低内存占用、KV缓存复用减少重复计算,以及基于树结构的多Token预测提升解码效率,三者结合共同实现了性能提升。
Q3:普通开发者能否使用TensorRT Edge-LLM运行该基准测试?
A:可以,NVIDIA已在TensorRT Edge-LLM的release/0.9.1-mlpinf分支上公开了完整实现方案,包括模型导出设置、引擎构建命令及服务器配置,开发者可按步骤自行部署运行。
