AI 智能体的实际效果,很大程度上取决于其所接收的上下文质量。即便底层模型能力强劲、NVIDIA 库文档完善,智能体仍可能在寻找正确工具时多走弯路,在无效方向上消耗大量 Token,或在专项任务中表现欠佳。技能包(Skills)将指令、示例和工具调用指引打包在一起,帮助智能体更快地从意图走向解决方案。为了衡量这些技能是否真正改善了智能体的执行路径和输出结果,NVIDIA 构建了一套面向智能体技能的开放评估体系。

NVIDIA SkillEvaluator 简介

NVIDIA SkillEvaluator 是一款开源工具,通过静态检查和带技能/不带技能两种条件下的实际任务运行,来量化技能对智能体性能的影响。NVIDIA 认证技能是经过打包和签名的能力描述符,能够精确告知智能体某个 NVIDIA 产品的功能、调用时机与调用方式。"认证"本身就是对技能就绪状态的一种度量。

本文分享了针对 30 余款 NVIDIA 产品、超过 300 项认证技能的首批基准测试结果。每项技能均在两套独立测试框架上完成评估,并通过比较安装技能前后的得分,计算出"技能提升值"(Skill Lift)。

目前,NVIDIA 已为 Claude Code、Codex 和 Cursor 发布对应插件,相同的技能也可通过 Skills.sh、ClawHub 和 Hermes Hub 获取。

三级评估体系

技能在发布前需经过三个层级的评估,每个层级回答不同的问题,且均可独立运行。

第一层:安全性与结构检查。执行静态检查,涵盖 Schema 与前置元数据验证、质量评分、提示注入与数据外泄安全扫描、敏感信息与个人隐私检测、许可证核查以及脚本代码检查。

第二层:差异性检验。通过嵌入相似度计算,识别单个技能内部的重复指导内容,以及技能目录中不同技能之间的覆盖重叠情况。

第三层:实时评估。在隔离沙盒中,分别在安装技能和未安装技能两种条件下,驱动智能体完成自动生成的任务,并量化两者的差异。

第三层评估基于 Harbor 框架运行。Harbor 是一个用于在可重复、隔离环境中执行智能体评估的开源框架,SkillEvaluator 负责处理 Harbor 的配置工作。它将评估用例转化为任务,在沙盒中运行智能体,收集结果,并计算技能的影响值。

所有结果均来自受控对比实验:针对每个评估用例,智能体测试框架分别在安装认证技能和不安装的条件下各运行一次,使用相同的提示词、模型、任务输入和评分标准,确保唯一变量为技能是否安装。这一对比在两套智能体测试框架中重复执行,两次得分之差即为该技能的贡献,以"Skill Lift"(单位:分)呈现。

快速上手

首先,为技能生成评估数据集:

skillevaluator create-eval-dataset ./my-skill --full

此命令将生成 evals/evals.json 文件,每个用例包含 ID、提示词和预期输出,以及可选的断言项。加上 --full 参数后,数据集将涵盖显式、隐式、上下文相关和负向用例。

完成用例审查后,执行实时对比评估:

skillevaluator tier3 evaluate ./my-skill \ --agents codex \ --env-mode docker

SkillEvaluator 会将用例转化为 Harbor 任务包,分别在安装技能和不安装技能两种条件下运行每个用例,对两次运行结果评分,并输出得分与 Skill Lift 值。整个流程对用户而言简洁清晰,底层执行与隔离管理均由 Harbor 负责。详细工作流程可参阅第三层实时评估文档。

基准测试结果

本节所有数据均来自 2026 年 8 月 12 日的 benchmarks.json 快照(提交记录 738d79e)。得分为各已发布技能与测试框架组合的宏平均值,赋予每个技能-框架对相同权重。Skill Lift 为安装技能后得分与未安装时得分之差,单位为分。由于目录持续评估更新,最新数据可在 nvidia/skills 仓库的 benchmarks.json 中实时查看。

在此次基准快照中,以下得分代表 NVIDIA/skills 仓库中各技能在未安装状态下,分别使用 Codex 和 Claude Code 两个框架完成相同任务时的平均表现。

评估维度共分五项。在"正确性"、"可发现性"、"有效性"和"效率"四个维度,基线平均分在 39 至 46 分之间(满分 100 分),说明存在较大的提升空间。"安全性"是例外,基线平均分高达 97 分,此维度的主要目的是验证安装技能不会引入安全回退。

已知局限性

正确性、有效性和安全性衡量的是运行结果,因此其基线反映了智能体在不安装技能时的原始能力。可发现性和效率同时衡量技能的使用过程,包括智能体是否找到技能、是否在行动前读取技能,以及是否避免了不必要的步骤。若未安装技能,这些动作本身就无从执行;但智能体仍可通过有效的工具使用、干净的执行过程,以及对不相关任务正确地不加载技能来获得得分,这也解释了为何上述基线约为 42 和 43 分而非零分。

大多数技能每个任务仅评估一次尝试,在已发布结果的技能中,85% 运行了一次,15% 运行了两次。由于智能体实时运行存在差异,单个技能得分会有所波动,目录级平均值汇总了数千次试验的结果,本文不报告置信区间。

技能安装后的性能提升

同一批评估使用了来自 NVIDIA/skills GitHub 仓库的技能。认证技能在两套测试框架上均提升了智能体性能,其中正确性、可发现性、有效性和效率的提升幅度最为显著。

在正确性和有效性这两个在两种条件下均可一致测量的维度,平均分分别从 46 分提升至 87 分、从 39 分提升至 78 分,提升幅度分别为 41 分和 39 分。这些得分并非通过概率估计,而是反映了智能体在评估专项任务上更高的平均表现。

可发现性和效率的 Skill Lift 分别为 40 分和 35 分。由于这两个维度的评分本身就以技能本身为参照对象,应将其解读为:一旦安装,智能体能够正确激活并使用对应认证技能的证据,而非对智能体无辅助行为的衡量。这一特性至关重要:智能体环境中的每项技能都在争夺智能体的注意力,一旦无关技能被错误加载,可能反而降低智能体的整体表现。

两套测试框架均呈现出一致且显著的性能增益。两者之间的差异在意料之中,这源于不同的默认系统提示、上下文处理方式和工具调用实现机制。认证技能提供的结构化上下文,是两套框架在无辅助条件下均无法自行产生的。

生态系统集成

OpenClaw 正在为 ClawHub 上的官方组织试点 SkillEvaluator。该集成运行第三层评估,并在"评估"标签页中展示安装技能前后的对比结果,方便开发者在发现和采纳技能的同时即可查阅评估信号。

Nous Research 在 Hermes Agent 中测试了 SkillEvaluator,并在技能安装流程中引入了 SkillSpector 的可选扫描功能。该集成对个人隐私、Unicode 注入、脚本代码规范、许可证和安全问题进行检查,并在安装前逐行呈现检测结果。整个工作流程由 29 个测试用例覆盖,每次技能扫描耗时约 1.4 至 1.5 秒。

三大实践发现

评估结果为构建和测试智能体技能的团队提供了三项实践性参考。

明确定义评估边界的重要性

明确界定核心任务、预期输出和超出范围的请求,能够在智能体实际运行前就产生更清晰的评估信号。技能的可测量精度,取决于其评估集对任务定义的清晰程度。

领域比测试框架的影响更大

不同产品之间的 Skill Lift 差异,远大于不同测试框架之间的差异。Claude Code 与 Codex 之间的平均差距约为 5 分,而各产品的 Skill Lift 从约 +2 分到 +46 分不等。领域特性、任务类型和评估设计,比使用哪套测试框架的影响更大。

Token 与执行效率的双向变化

SkillEvaluator 独立追踪 Token 使用量与效率指标。以单次尝试中的两个案例为例:jetson-optimize-memory 技能将 Token 用量从 617,306 个降至 142,540 个(降幅 76.9%),执行时间从 474.9 秒缩短至 220.0 秒(降幅 53.7%);相反,cuopt-install 技能将 Token 用量从 25,227 个增加至 55,582 个(增幅 120.3%),执行时间从 34.0 秒增加至 41.1 秒(增幅 20.8%),这一结果揭示了进一步优化的机会。SkillEvaluator 帮助识别某项技能究竟提升了 Token 和执行效率,还是需要进一步优化。

开始使用

如需上手,请访问 SkillEvaluator 文档,或在 GitHub 上浏览 NVIDIA 认证技能目录。

致谢

感谢 Roshni Malani、Meghana Puvvadi、Subodh Prabhu、Mohit Gupta、Yogesh Dangi、Yashraj Basaravaj Patil、Keshav Pradeep、Siddharth Itagi、Alejandro Sanabria Portala 和 Pranita Maske 对本项工作的贡献。

Q&A

Q1:NVIDIA SkillEvaluator 是什么工具,主要用来做什么?

A:NVIDIA SkillEvaluator 是一款开源评估工具,用于衡量"技能包"对 AI 智能体性能的实际影响。它通过在安装技能和不安装技能两种条件下分别运行任务,计算出"Skill Lift"(技能提升值),从而判断某项技能是否真正改善了智能体的执行效果。工具支持三层评估体系:静态安全检查、差异性检验和实时任务对比。

Q2:NVIDIA 认证技能的基准测试结果表现如何?

A:根据 2026 年 8 月 12 日的基准快照,针对 30 余款 NVIDIA 产品的 300 多项认证技能评估结果显示,安装技能后智能体在正确性维度平均分从 46 分升至 87 分(+41 分),有效性从 39 分升至 78 分(+39 分),可发现性和效率分别提升 40 分和 35 分。安全性基线已达 97 分,变化较小。两套测试框架(Codex 和 Claude Code)均呈现一致的显著提升。

Q3:SkillEvaluator 如何衡量技能对 Token 消耗的影响?

A:SkillEvaluator 独立追踪 Token 用量与执行时间。以实际案例为例,jetson-optimize-memory 技能使 Token 用量减少了 76.9%,执行时间缩短了 53.7%;而 cuopt-install 技能则使 Token 用量增加了 120.3%,执行时间增加了 20.8%。这说明技能对效率的影响因产品和任务不同而差异显著,SkillEvaluator 可帮助开发者识别哪些技能需要进一步优化。

NVIDIA