企业在处理大量视频内容时,往往面临视频系统、企业知识库与操作工具相互割裂的问题。开发者需要捕获用户意图、检索正确的组织上下文、生成结构化报告,并将分析结果路由至下游系统。本文将介绍如何通过 NVIDIA NemoClaw 将视频分析能力升级为可编程的行动触发器,实现从"视频显示了什么"到"针对视频内容我们应采取哪些行动"的跨越。
NVIDIA NemoClaw 是一套用于构建自主智能体的开放蓝图集合,可帮助生态系统构建领域专属、始终在线的智能体,使其在数字与物理工作流中更安全、更快速、更高效地运行。
本文主要涉及以下几个核心蓝图:
NVIDIA Metropolis 视频搜索与摘要蓝图(VSS)负责摄取流式或归档视频,生成字幕和视觉元数据,并支持语义搜索、交互式问答及事件摘要。
NVIDIA 检索增强生成蓝图(RAG)将企业专有文档(手册、政策、法规、标准操作程序及参考数据)索引至 GPU 加速的向量数据库,以实现快速语义搜索。
系统架构与工具组成
VSS 通过一组内置于智能体的工具,提供有导引的、上下文感知的视频分析能力,并结合人机协同(HITL)提示在处理开始前捕获用户意图。与 NVIDIA NemoClaw 的自主智能体蓝图结合后,系统可进一步实现生成工单、跨多来源比较模式、起草修订流程、上报异常以及将结果输送至下游工作流等功能。
三个智能体工具协同工作以实现上述目标:
长视频摘要(LVS)视频理解工具:执行带有强制性 HITL 参数收集的长视频摘要,用户可交互式指定场景、关注事件、跟踪对象及可选的知识检索查询。
知识检索(frag)工具:调用 RAG 蓝图,从文档、政策、参考数据和知识库中检索特定组织的上下文,RAG 蓝图在内部负责嵌入、重排序和向量搜索。
报告生成工具:将视频分析与检索到的上下文相结合,生成包含时间戳、叙述性分析和引用来源的结构化报告,并可通过 HITL 让用户在生成前确认或编辑提示词。
健康饮食教练演示案例
为直观展示上述流程,本文以构建一个"健康饮食教练"为例,该系统能够分析食物视频,评估用户的饮食习惯,并返回可跟踪执行的具体后续步骤。
用户通过 VSS 界面上传餐食准备视频后,NemoClaw 启动工作流,读取技能定义文件(SKILL.md)以了解分析所需的参数,并将请求交给 VSS 智能体,后者通过一系列 HITL 提示引导用户完成配置,涵盖分析内容、场景设定、关注事件、跟踪对象,以及用于检索营养或法规指南等参考知识的可选 RAG 蓝图查询。
参数确认后,NemoClaw 开始协调整个流水线:LVS 视频理解工具首先向 RAG 蓝图查询相关营养指南,随后将参数、视频及检索到的上下文一并传递给 LVS 服务;该服务以分层方式对视频进行摘要,并将参考知识融入分析结果;报告生成工具最终将结果整合为结构化的带时间戳报告,包含检测到的事件、基于参考资料的叙述性分析、相关来源引用以及具体的行动建议。
下游行动编排
NemoClaw 读取完成的报告后,将其转化为协调一致的行动:呈现完整分析结果(包含 Markdown 和 PDF 报告链接及视频回放),并自动创建 Jira 工单,汇总发现内容与建议的饮食调整方案,设定适当的优先级与负责人。
这一下游步骤具有很强的通用性。根据报告内容,NemoClaw 还可以:创建附有优先级和负责人信息的调查结果工单;跨多次运行对涌现的模式进行汇总或上报;整合支撑性证据供审查或合规使用;将差距路由至适当的后续工作流。
系统整体架构分为四层:
编排层:NemoClaw 智能体、vss-generate-video-report-rag 技能及 HITL 提示
VSS 智能体层:包含视频输入/输出、搜索、理解、LVS、知识检索和报告生成等工具
RAG 蓝图层:包含 NVIDIA RAG API、Milvus 向量数据库、NVIDIA Nemotron 重排序 NIM 及已索引的参考与组织文档
大语言模型融合层:将 VSS 提供的摘要与通过 RAG 蓝图检索到的上下文进行融合增强
部署实施步骤
环境要求
至少配备 24 GB 显存的 NVIDIA GPU
Docker Engine 及 Docker Compose v2
NGC API 密钥(ngc.nvidia.com)
NVIDIA Build API 密钥(build.nvidia.com)
已部署并可从智能体访问的 RAG 蓝图(含服务器 URL 及集合名称)
已安装 NemoClaw(用于编程访问)
第一步:克隆 VSS 代码库
git clone https://github.com/NVIDIA-AI-Blueprints/video-search-and-summarization.git ~/vss-public cd ~/vss-public echo "$NGC_CLI_API_KEY" | docker login nvcr.io --username '$oauthtoken' --password-stdin
第二步:配置 LVS 环境变量
编辑 LVS 配置文件 deploy/docker/developer-profiles/dev-profile-lvs/.env,将 VSS_AGENT_CONFIG_FILE 设置为 config_rag.yml 以启用 frag 知识检索工具。RAG_ 相关的三个变量(RAG_SERVER_URL、RAG_API_KEY、KNOWLEDGE_COLLECTION)是智能体连接 RAG 蓝图所需的全部配置。
第三步:启动服务栈
创建绑定挂载所需的数据目录后,启动整个服务栈。compose 配置文件会根据 .env 文件中的 COMPOSE_PROFILES 自动选择。服务栈将启动所有基础设施组件(VST、Redis、Elasticsearch、LVS、NIM)及使用启用 RAG 配置的智能体。
注意:NIM 加载可能需要 5 至 15 分钟,请耐心等待。
第四步:初始化 NemoClaw
在代码库根目录执行以下命令:
NEMOCLAW_PROVIDER=build \ NVIDIA_API_KEY="$NVIDIA_API_KEY" \ bash deploy/docker/scripts/nemoclaw/init_nemoclaw.sh demo
此命令将完成全部初始化工作:注册 NemoClaw、配置模型提供商、应用 VSS 沙盒策略、安装包含 vss-generate-video-report-rag 在内的代码库技能,并打印 OpenClaw UI 的访问地址。
第五步:连接并开始使用
执行 nemoclaw SANDBOX_NAME connect openclaw tui 后,在 OpenClaw UI 中输入 /new 开始新会话,然后发送请求消息即可启动完整工作流。
性能表现
引入 NemoClaw 编排和 HITL 参数收集仅带来极小的延迟开销。HITL 阶段是异步的,NemoClaw 与用户交互时系统处于等待状态,参数确认后视频处理即刻启动。
合作伙伴落地案例
Computacenter 在 Run:AI 集群上部署了完整的"检测→推理→行动"流水线,用于预测性维护。该方案使用 VSS 3 分析无人机、内窥镜和热成像检查视频,结合 RAG 蓝图提供的原厂文档上下文,并通过 NemoClaw 自动起草 Maximo 工单,将视频到工单的处理时间从 30 至 45 分钟缩短至约 19 秒,覆盖四类资产。
VAST Data 使用 NemoClaw 在 VAST DataEngine 上编排实时 VSS 流水线,通过 VAST RAG 与 VastDB 和向量结合处理直播游戏流;该方案基于 NVIDIA 蓝图,使用 cosmos-reason2 和 Nemotron 模型,在 NVIDIA DSX AIR 上实现端到端运行。
总结与展望
VSS 3、RAG 蓝图与 NemoClaw 的集成代表着企业视频分析方式的根本性转变。视频分析不再止步于静态报告,而是成为协调行动的起点,具体体现在以下几个维度:
速度:响应时间从数小时或数天缩短至数分钟
规模:可跨多来源分析数千个视频并呈现企业级全局模式
一致性:政策、流程、法规和指南等参考知识得到一致应用
可追溯性:每项决策均可追溯至视频证据和来源文档
自动化:告警生成、工单创建、文档归档等常规工作流无需人工干预
这就是企业级视频 AI 的形态:专项分析引擎(VSS 与 RAG 蓝图)通过整洁、定义清晰的 API 组合成通用智能体工作流(NemoClaw),将组织智慧嵌入每一项决策之中。相关蓝图现已开放,可直接替换为您自己的视频来源和参考知识,例如将巡检视频与原厂手册配对、将零售卖场摄像头与陈列政策配对,或将直播内容与规则手册配对,然后从一个完整的"视频到决策到行动"闭环开始试点并逐步扩展。
Q&A
Q1:NVIDIA NemoClaw 是什么?它在视频分析中起什么作用?
A:NVIDIA NemoClaw 是一套用于构建自主智能体的开放蓝图集合,能够帮助构建领域专属、始终在线的智能体。在视频分析场景中,它充当编排层,将 VSS 视频分析结果与 RAG 蓝图检索到的知识相结合,自动触发下游行动,如创建 Jira 工单、上报异常、汇总跨视频模式等,从而将静态的视频分析报告转变为可执行的业务流程。
Q2:部署 VSS 与 NemoClaw 集成方案需要哪些硬件和软件条件?
A:硬件方面,需要至少配备 24 GB 显存的 NVIDIA GPU。软件方面,需要安装 Docker Engine 和 Docker Compose v2,并准备好 NGC API 密钥和 NVIDIA Build API 密钥。此外,还需要已部署并可从智能体网络访问的 RAG 蓝图实例,以及已安装的 NemoClaw。整个部署流程通过克隆 VSS 代码库、配置环境变量、执行初始化脚本完成,NIM 加载通常需要 5 至 15 分钟。
Q3:Computacenter 使用该方案后,视频处理效率提升了多少?
A:Computacenter 在 Run:AI 集群上部署了基于 VSS 3、RAG 蓝图和 NemoClaw 的完整预测性维护流水线,用于分析无人机、内窥镜和热成像检查视频,并自动起草 Maximo 工单。部署后,视频分析到生成工单的处理时间从原来的 30 至 45 分钟大幅缩短至约 19 秒,覆盖四类资产,效率提升显著。
