视觉语言模型已经能够在生产规模下构建理解视频内容的视觉AI智能体。更难的问题是如何将这种能力转化为可维护的系统,该系统需要结合数据接入、流处理、事件检测、检索、摘要生成和报告输出等多项功能。

NVIDIA Metropolis视频搜索与摘要(VSS)蓝图及其智能体技能,可帮助开发者更快构建视觉AI智能体。VSS将视觉语言模型(如NVIDIA Cosmos)、大语言模型(如NVIDIA Nemotron)、检索增强生成(RAG)和模型上下文协议(MCP)工具连接起来,把实时和录制的视频转化为自然语言搜索、视觉问答、经过验证的告警和自动化报告。

VSS Blueprint 3.3还从两个方面降低了成本:通过全新的构建视觉智能体技能(vss-build-vision-ai)加快应用组合速度,以及通过自适应高效视频采样(Adaptive EVS)降低运行时的VLM处理成本。

本文将介绍这两方面的成本降低情况。在开发端,一条提示指令可在30分钟内构建并部署一个灌装线溢出检测智能体,仅需几美元的编码智能体使用费用。在运行端,Adaptive EVS可为60分钟的摘要任务减少80%的VLM输入Token,并在同一GPU上将并发流数量提升46%。

想了解更多内容,欢迎加入10月1日太平洋时间上午9点的直播,届时我们将现场演示通过单条提示构建视觉AI智能体。

为什么视觉AI智能体成本高昂

一个生产级的视觉AI智能体通常涉及多个工作流。智慧城市应用可能需要车辆检测、碰撞告警、可搜索的事件片段、每小时摘要和运营商报告。仓储应用可能需要人员和叉车追踪、险情告警、标准作业流程(SOP)检查和后续问答。每个工作流本身都有用,但真正的部署价值在于这些工作流能够协同运作。

这就带来了3个反复出现的成本驱动因素:

开发成本:团队必须选择并连接微服务、Kafka等共享服务、Redis、Elasticsearch和视频输入输出及存储(VIOS)、模型端点、环境变量和API,同时避免重复建设基础设施。

运营成本:视觉AI工作负载可能导致大量Token消耗,每增加一路视频流、一个帧窗口、一条提示和视觉Token,都会增加GPU占用、排队延迟和端到端摘要延迟。

变更成本:团队必须从概念验证走向生产环境,增加新能力,同时保持配置、文档和运维的一致性。

VSS 3.3为构建和运行视频分析AI智能体带来的更新

VSS智能体技能让Claude Code、Codex等编码智能体或任何兼容agentskills.io的智能体,能够根据自然语言请求部署和操作VSS。VSS 3.3新增了两项更新,从部署的两个方面降低成本:

构建视觉智能体技能(vss-build-vision-ai):将告警、搜索、摘要等VSS工作流整合到一个应用中,适用于SOP合规检查或交通管理等场景,并可在不重建整个技术栈的情况下扩展正在运行的部署。

Adaptive EVS:这一新功能通过修剪与前一帧相比未发生变化的画面区域的视觉Token,并围绕事件发生时刻批量处理VLM任务,从而减少冗余的VLM处理。EVS已经以固定修剪率的形式集成在vLLM和Cosmos NIM微服务中。VSS 3.3中的自适应版本集成到了实时VLM微服务中,可按每个图像块和每一帧来决定保留哪些Token。

构建视觉智能体技能通过组合和扩展部署降低了开发和变更成本。Adaptive EVS通过减少用于处理未变化视频的VLM Token和GPU时间,降低了运营成本。

通过构建视觉智能体技能降低开发成本

早期的VSS技能分别处理部署、摄像头设置、摘要生成、搜索、告警和分析等单项操作。VSS 3.3将这些技能组织为部署技能、操作技能、工具和基准测试,其中vss-build-vision-ai负责整合其余部分。

开发者描述他们想要的应用,构建视觉智能体技能会将这一意图转化为涵盖配置文件、微服务、配置和运行时操作的部署计划。

该技能不会从零开始生成部署方案,而是从四个经过验证的开发者配置文件中选择最接近的一个开始(见下表1),每个配置文件都是针对某一工作流的完整、经过测试的技术栈。该技能将这个起始配置文件称为"基础方案",仅根据请求需要进行修改。

随后该技能计算出最小的变更量:只增加或删除确切需要的服务项,只保留请求功能实际用到的服务,并将共享角色收敛为单一实例。

两个都需要检测器的功能会共用一个检测器。两个都需要Kafka和Elasticsearch的功能会共享一条消息总线和一个Elasticsearch部署,各自写入自己的索引。当规则无法确定选择时,该技能会提出一个结构化问题,而不是随意猜测。

该技能自动化的内容包括

将应用目标映射到所需的VSS工作流和微服务。

将告警、搜索、摘要等工作流整合到一个部署计划中。

复用共享基础设施,包括VIOS、Kafka、Redis、Elasticsearch、HAProxy入口和MCP服务。

生成一个独立的构建方案:_builds/<name>/override.env(基础方案、生效的Compose配置文件,以及仅包含你所做更改的设置)、compose.yml以及resolved.yml(通过docker compose config生成的一个扁平化Compose文件,可独立部署)。代码库中的deploy/docker/目录内容不会被修改。

在写入或部署任何内容之前,展示架构图供审查,然后运行验证、部署和就绪检查,以便开发者在构建应用逻辑之前先验证整个技术栈。

询问是否部署智能体宿主环境。默认选项是NemoClaw,这是一个安装了VSS技能的主机侧沙箱环境;如果回答否,则生成一个由VSS命令行界面驱动的无界面技术栈。

通过更小的变更量扩展正在运行的部署,复用现有服务。

这缩短了探索时间,使组合过程可重复,并避免了不同工作流之间重复建设数据接入、存储、消息传递和分析基础设施。

用VSS构建灌装线视觉AI智能体

以橙汁灌装线为例,团队希望构建一个智能体,能够监控灌装机和封盖机的摄像头,对溢出或洒漏情况进行告警,搜索历史事件,并生成班次报告。

手动开发需要连接事件检测、告警验证、存储、搜索索引、摘要生成和报告等环节。使用构建视觉智能体技能,开发工作从预期结果出发即可开始。

示例提示

为橙汁灌装线构建一个VSS视觉智能体。使用灌装机和封盖机上的两路RTSP摄像头。检测瓶子溢出和果汁洒漏,用VLM验证每个告警,使告警片段可搜索,并为产线主管生成班次报告。

该智能体组装的内容

基于VIOS的RTSP摄像头和录制片段的数据接入。

根据基础配置文件的不同,提供实时检测、追踪、字幕生成或基于VLM的告警。

针对溢出、洒漏和停线事件的行为分析或规则。

确认告警并说明推理过程的VLM验证。

对已验证片段和已索引视频进行自然语言搜索。

用于操作员交接班和事件复查的摘要生成与报告功能。

共享的消息传递、存储、API和可观测性功能。

在一台配备双GPU的RTX PRO 6000 Blackwell主机上,该技能通过复用现有服务,仅新增一个告警桥接器和实时VLM,将搜索和告警功能结合起来。FP8 Cosmos 3 Nano与检测器共享GPU,避免了重复建设。一个录制告警构建方案在不到30分钟内就实现了可预览的实时部署。

其结果是一种可复用的模式:只需接入一次视频,在各工作流间共享证据数据,并为操作员提供自然语言搜索、告警、摘要和报告功能。

Adaptive EVS如何降低运营成本

上述灌装线智能体一旦投入运行,其摄像头就会全天候持续产生视频数据,而每一帧画面中的大部分内容几乎从不变化:灌装机、护栏、地面。只有流经其中的瓶子在变化,而溢出事件则很少发生。

每个帧窗口仍然会成为VLM的视觉上下文,因此模型大部分计算资源都耗费在重复读取与前一帧看起来完全相同的区域上。这种VLM处理正是已部署视觉AI智能体运行时成本的主要驱动因素之一,也正是Adaptive EVS所要解决的成本问题。

Adaptive EVS在流水线中的改变

动态修剪。每个图像块都会与前一帧进行余弦相似度比较;未变化的图像块会在传入语言模型之前被丢弃。

事件感知批处理。Token保留率可反映活动情况:保留率约70%以上的片段会被批量处理为事件,约30%以下的会被丢弃或清空,其余则正常运行。

性能影响

在运行Cosmos 3 Super FP8的NVIDIA RTX PRO 6000 Blackwell上,Adaptive EVS:

将告警情境化延迟降低了17%,从1021毫秒降至844毫秒,同时类似地减少了Token使用量。

将并发实时VLM流数量提升了46%,从13路增加到19路。

在减少80% VLM输入Token的情况下,以约一半的时间完成了60分钟视频的摘要生成。

结果会因场景运动程度、分块长度和相似度阈值而有所不同;在选定生产环境默认设置前,应对代表性素材进行基准测试。

Adaptive EVS在VLM需要读取大量帧并生成简短回复的场景中最为有用,例如密集字幕生成、长视频摘要和告警验证。但在少量帧生成长输出的场景中收益较小,该功能运行在RT-VLM容器内,而非针对远程端点,并且是可选功能。可在override.env中启用它,然后在代表性素材上测试准确性、吞吐量和延迟:

VIA_EVS_SESSION=true VLM_VIDEO_PRUNING_RATE=0.5 # 取值范围0.0到1.0;数值越高修剪越多 VLLM_EVS_SIMILARITY_THRESHOLD=0.2

成本影响:团队将迎来哪些变化

通过自然语言组合多工作流应用,降低集成难度。

减少告警、搜索、摘要、报告和问答功能之间的重复基础设施建设。

通过修剪未变化的视觉区域,提高GPU利用效率。

通过跳过无事件视频,降低摘要生成和事件复查的延迟。

通过复用正在运行的部署进行增量扩展,使扩展更加便捷。

综合来看,这些变化减少了前期开发工作量,以及在各种环境和应用中使用VLM处理视频所需的GPU工作量。

VSS 3.3入门指南

克隆VSS Blueprint代码库,并切换到包含3.3技能的分支。

将VSS技能安装到你的编码智能体的标准技能目录中。

描述你想要的智能体,包括视频来源、工作流和部署约束条件,或者直接说"构建一个视觉智能体"以获取引导。

审查架构图和_builds/<name>/override.env文件,特别关注GPU分配、模型端点、端口、存储和安全边界。

对于RT-VLM工作负载,启用Adaptive EVS,调整修剪率,并在代表性视频上测试准确性、吞吐量和延迟。

在受信任的隔离网络中部署,配置身份验证、TLS、速率限制和外部控制措施。

示例设置命令

git clone https://github.com/NVIDIA-AI-Blueprints/video-search-and-summarization.git cd video-search-and-summarization

让你的编码智能体安装技能:

阅读skills/README.md以及skills/目录下的每个SKILL.md文件。为该主机安装每一项技能,使用标准技能目录,建立符号链接而非直接复制,这样git pull就能保持技能更新。

技能安装完成后,你可以用这样的提示开始:

为我的仓库摄像头构建一个VSS视觉智能体,结合告警验证、自然语言视频搜索和每小时摘要功能。尽可能复用现有的Kafka和Elasticsearch服务,并在运行Docker Compose之前先生成一份部署计划。

进一步了解

克隆VSS Blueprint代码库

安装VSS智能体技能

在你自己的摄像头上,用上面的示例提示尝试构建视觉智能体技能

Q&A

Q1:VSS Blueprint 3.3有哪些主要更新?

A:VSS Blueprint 3.3新增了构建视觉智能体技能(vss-build-vision-ai)和Adaptive EVS两项更新,分别从开发端和运行端降低了视觉AI智能体的建设和运行成本。

Q2:Adaptive EVS能带来多大的性能提升?

A:在RTX PRO 6000 Blackwell上,Adaptive EVS可将告警延迟降低17%,并发流数量提升46%,60分钟视频摘要所需的VLM输入Token减少80%,耗时缩短约一半。

Q3:构建视觉智能体技能如何降低开发成本?

A:该技能通过自然语言描述需求,自动选择最接近的基础配置方案,计算最小变更量,复用共享基础设施(如VIOS、Kafka、Redis、Elasticsearch等),避免重复建设,从而大幅缩短开发时间和降低开发成本。

NVIDIA