在将视觉推理模型适配到生产级视频任务时,开发者往往要花费数天时间处理数据格式化、容器配置、训练脚本、基线评估和超参数搜索,才能判断后训练是否真正提升了精度。
将开放物理AI世界基础模型NVIDIA Cosmos 3与NVIDIA TAO智能体技能相结合,为这一挑战提供了解决方案。Cosmos 3通过共享的全模态世界模型,将理解、生成、仿真与动作统一起来,在混合Transformer(MoT)架构下融合了文本、图像、视频、环境音效和动作追踪。尽管该模型具备出色的开箱即用视觉推理能力,但每一次真实部署都需要针对特定摄像角度、边缘案例和环境进行领域专项化适配,这正是后训练的价值所在。
本文演示如何借助编程智能体和NVIDIA TAO视觉模型智能体微调技能库,对NVIDIA Cosmos 3 Nano模型进行视频问答的无缝后训练。
NVIDIA的实验表明,通过使用低秩自适应(LoRA),该工作流高效完成了模型适配:在单次运行中,零样本基线的精确匹配准确率(四选一多项选择)从54.41%大幅提升至87.14%。进一步借助TAO AutoML系统性地扫描配置、消除人工猜测,峰值准确率最终达到93.35%——将原本需要数天的工程工作压缩至仅需两条自然语言提示、一天内自动完成。
NVIDIA Cosmos 3 MoT架构
Cosmos 3的MoT架构采用自回归Transformer负责稳健的推理与规划,同时搭配扩散Transformer精准预测未来世界状态与动作。Cosmos 3提供多种规格,包括Super 64B和Nano 16B,在多项基准测试中持续位居开放模型榜首:
VANTAGE-Bench(视频理解)
PAI-Bench与Physics-IQ(世界生成精度)
RoboLab与RoboArena(动作策略)
统一的双塔设计将模型分为自回归推理路径和迭代扩散生成路径。各模态输入经过Token化后,分别通过独立的LayerNorm和MLP模块处理,并通过跨流连接进行交互——键值状态(KAR、VAR)被传递至生成全注意力模块,用于处理文本和视觉上下文。
为何需要后训练
Cosmos 3等基础模型从海量多样化数据集中学习通用模式。后训练对于帮助模型更好地理解专业领域任务、词汇及特定摄像视角至关重要。
在对Cosmos 3 Nano等视觉语言推理模型进行后训练时,开发者通常在两种方法之间做出选择:
全参数监督微调(SFT):适用于领域偏移较大或任务需要对模型结构进行改动的场景。但由于SFT会更新所有模型权重,需要大量计算资源,且可能导致通用知识性能下降。
低秩自适应(LoRA):适合快速迭代。LoRA冻结基础模型权重,仅注入可训练的秩分解矩阵。
在本文示例中,LoRA后训练所需的GPU时间约为Cosmos 3 Nano全参数SFT的七分之一,使工程团队能够在一天内完成后训练。
两种后训练方式
对Cosmos 3 Nano进行后训练有两种选择:
开放框架:完全开放的Cosmos 3后训练框架直接提供训练方案、数据集格式和配置文件,适合需要自定义训练逻辑或与现有基础设施集成的场景。
TAO智能体技能:在上述能力之上进行自动化封装。编程智能体自主推进工作流、修复数据问题、运行训练容器并完成超参数搜索,将多天的配置工作压缩为本文所述的"两条提示、一天完成"的体验。
NVIDIA TAO推出的智能体技能,帮助编程智能体执行支持模型系列的视觉模型后训练工作流。这些技能封装了训练、评估、优化和部署模型所需的任务专项知识,涵盖框架细节、启动器行为、配置结构、数据加载和评估流程。
Cosmos 3架构将能力分为推理塔(用于多模态理解和逻辑的视觉语言模型)和生成塔(用于视频和动作生成)。使用TAO智能体技能时,工作流会自动处理权重分离,确保后训练专门针对推理塔权重进行优化。
安装TAO技能
TAO技能集可安装供任意编程智能体使用。本示例使用Codex,NVIDIA-TAO/tao-skill-bank GitHub仓库中也提供了适用于Claude的配置说明。最快的安装方式是使用TAO技能库仓库中的自动化安装脚本:
```
curl -fsSL https://raw.githubusercontent.com/NVIDIA-TAO/tao-skills-bank/main/scripts/install-codex-agents.sh | bash
```
如需逐步手动操作,仓库中也提供了分步说明。
在开始实验前,请在终端环境中配置所需密钥:
```
export HUGGINGFACE_TOKEN="your_hf_token" # 用于拉取模型
export NGC_API_KEY="your_ngc_key" # 用于TAO Docker容器
export AUTOML_LLM_API_KEY="your_llm_key" # AutoML大语言模型引导超参数搜索所需
```
实验数据集
本示例在丰田Woven交通安全(WTS)数据集上对Cosmos 3 Nano进行后训练,聚焦于四选一多项选择视频问答任务,包含超过8000个训练和验证样本。
该数据集适合演示Cosmos 3后训练,因为交通安全需要对真实场景进行细致理解——模型必须从视频中推理复杂的道路布局、信号灯、车辆、行人和事件上下文。同样的工作流也适用于其他下游视觉推理任务,如仓库监控、自动驾驶感知、机器人工作单元等。
数据集示例:
问题:道路的形态是什么?
A:单行道(右弯)
B:单行道(直线)
C:交叉路口(无信号灯)
D:交叉路口(有信号灯)
预期答案:D
一条提示完成端到端流程
在导出凭证的同一环境中,只需一条Codex提示即可启动完整的端到端流程:
对Cosmos 3模型在Woven交通安全数据集上进行LoRA后训练。
训练数据:/home/…/WTS_dataset/wts_data_train
验证数据:/home/…/WTS_dataset/wts_data_val
Hugging Face基础模型:nvidia/Cosmos3-Nano
同时先进行基线评估,以便与后训练模型进行对比。
在后台,Codex查询TAO库并选择专用的Cosmos-reason技能,智能体自主处理底层框架和数据加载器,并按顺序执行以下步骤:
自动错误修复:智能体扫描数据集标注,发现缺失的视频FPS参数,并即时应用配置补丁。
模型缓存:使用Hugging Face Token安全拉取Cosmos 3权重。
基线评估:在修改任何权重之前,运行零样本基线评估。基础Cosmos 3模型初始准确率为54.41%。
LoRA流程执行:智能体生成优化的LoRA训练配置并触发TAO训练容器。
后训练完成后,智能体评估LoRA适配模型并与基线进行对比。仅需一次运行,在8块NVIDIA A100 Tensor Core GPU上约30分钟的训练时间,模型准确率跃升至87.14%,提升了32个百分点,全程无需人工干预。
使用TAO AutoML进行超参数搜索
LoRA提供了强劲的初始结果,但后训练性能往往取决于配置的选择。学习率、LoRA秩、dropout、批大小、调度器设置等超参数都会影响最终准确率。
TAO AutoML支持多种参数搜索策略,包括:
贝叶斯优化
Hyperband
贝叶斯优化与Hyperband组合(BOHB)
批优先贝叶斯优化(BFOB)
大语言模型引导搜索(使用大语言模型推荐超参数,支持NVIDIA NIM、OpenAI或任何兼容OpenAI的端点,本实验使用Gemini API端点)
在同一编程智能体对话中,再输入一条提示即可启动AutoML搜索:
运行AutoML搜索以改进LoRA结果。让TAO选择合适的搜索策略并调整重要的训练超参数,优化验证准确率并汇总最佳模型。
智能体使用多种策略生成候选试验,启动每个实验,追踪超参数,评估结果并记录最佳配置。
实验结果
通过将TAO智能体技能的自动化与TAO AutoML的优化能力相结合,模型相对零样本基线取得了显著的准确率提升。整个实验仅通过两条提示,就完成了从未对齐的基础模型到高度专业化的交通安全专家模型的转变。
计算资源说明
本次多配置实验使用了云端NVIDIA硬件。得益于Cosmos 3 MoT架构的高效性,单次LoRA后训练epoch在一个NVIDIA A100(80GB)GPU节点上约需30分钟,不到一小时即可获得87.14%准确率的高精度模型。
若要突破这一准确率上限,则需通过TAO AutoML超参数搜索寻找最优配置。在本实验环境中,43个并行试验在5个并行节点上(每个搜索策略分配一个8×A100 GPU节点)共耗时19.5小时,涵盖5种搜索策略:贝叶斯(10次试验)、BFBO(10次试验)、BOHB(3次试验)、大语言模型-贝叶斯混合(10次试验)、大语言模型-BFBO混合(10次试验)。
作为对比,全参数SFT在8块NVIDIA H100 GPU上耗时3小时34分钟。
定性对比
数字只能呈现部分价值。领域专项化的真正意义体现在对复杂、模糊的真实边缘案例的评估上——后训练前后的定性对比清晰展示了模型能力的提升。
部署:Cosmos 3 Reasoner NIM
Cosmos 3 Reasoner NIM提供了最快速的生产级、兼容OpenAI的推理端点部署路径。它具备独立优化的自回归推理器,专为高效设备端推理而设计。NIM微服务以预构建的优化容器形式交付,无需手动配置vLLM依赖和CUDA版本匹配,支持从文本、图像和视频输入生成文本输出。
可以直接让编程智能体完成部署:
使用<checkpoints path>中的后训练检查点在本地部署Cosmos 3 Nano Reasoner NIM。运行NVIDIA/Docker预检,优先使用支持LoRA的配置文件,否则使用融合后的合并检查点。
与Llama风格VLM NIM的一个重要架构差异在于适配器的加载方式:Llama NIM可以同时服务基础模型和独立的LoRA适配器目录,而Cosmos 3 Reasoner NIM需要合并检查点(基础权重与LoRA适配器融合后的结果),而非单独的适配器。
如果使用编程智能体配合TAO技能,它会自动在后台处理权重融合,并向容器提供单一可加载的检查点。
如需手动部署,可从智能体获取合并检查点,并参考视频教程《如何运行NVIDIA Cosmos 3 Reasoner NIM进行视频推理》,按步骤完成模型部署。
结语
从通用AI到高度专业化物理AI的转变,不再需要与基础设施反复较量。通过将NVIDIA Cosmos 3推理塔的结构化推理能力与NVIDIA TAO智能体技能的自动化相结合,可以在一天内完成从原始视频数据到可部署的专业视觉语言模型的全流程。
仅需两条自然语言提示,编程智能体即可全程自动处理框架复杂性、修复数据缺陷、执行基线基准测试,并通过TAO AutoML运行高级超参数调优,让工程团队专注于解决核心物理AI和机器人挑战。
如需在本地开发环境中实践该工作流,可参考以下资源:
体验Cosmos 3:在Hugging Face下载Cosmos 3 Nano和Super检查点;在NVIDIA/cosmos GitHub仓库查找示例和代码;体验Cosmos 3 Nano Reasoner模型和Cosmos 3 Nano模型;观看视频教程《如何运行NVIDIA Cosmos 3 Reasoner NIM进行视频推理》。
安装TAO智能体技能:在NVIDIA-TAO/tao-skill-bank GitHub仓库获取安装脚本、实施指南和技能列表;如有技术问题,请访问TAO开发者论坛。
深入了解AutoML:查阅NVIDIA TAO文档,深入了解AutoML超参数优化策略和核心层。
观看教程:参考视频《使用TAO 7智能体技能对NVIDIA Cosmos 3进行后训练》的可视化配置流程。
加入直播互动:7月16日收看Cosmos Labs直播,7月30日参加Cosmos Labs答疑时间。
Q&A
Q1:NVIDIA Cosmos 3的MoT架构是什么?有什么特点?
A:MoT(混合Transformer)架构是Cosmos 3的核心设计,由两部分组成:自回归Transformer负责推理与规划,扩散Transformer负责预测未来世界状态和动作。该架构统一处理文本、图像、视频、环境音效和动作追踪等多种模态,在视频理解、世界生成精度和动作策略等多项基准测试中位居开放模型榜首。
Q2:LoRA后训练和全参数SFT有什么区别?哪个更适合Cosmos 3 Nano?
A:全参数SFT会更新模型所有权重,适合领域偏移极大的场景,但需要大量计算资源且可能损失通用能力。LoRA则冻结基础权重,仅注入少量可训练矩阵,所需GPU时间约为SFT的七分之一。对于Cosmos 3 Nano,LoRA在WTS数据集上单次运行30分钟即可将准确率从54.41%提升至87.14%,是快速迭代的首选方案。
Q3:TAO AutoML超参数搜索支持哪些策略?效果如何?
A:TAO AutoML支持贝叶斯优化、Hyperband、BOHB、BFOB以及大语言模型引导搜索等多种策略。在Cosmos 3 Nano的实验中,43个并行试验在5个节点上运行约19.5小时,将LoRA的87.14%准确率进一步提升至93.35%,相比零样本基线提升近39个百分点,全程无需人工干预。
