自动驾驶(AV)的开发通常依赖多个独立模型,分别承担轨迹生成、高层意图预测、场景理解和数据标注等任务。这种分散架构使得比较相关输出、排查模型行为以及在开发流程中复用同一套表示变得十分困难。

NVIDIA Alpamayo 2 Super 是一款开放的 340 亿参数推理视觉-语言-动作(VLA)模型,旨在加速自动驾驶的研发进程。该模型由 320 亿参数的 NVIDIA Cosmos 3 Super Reasoner 与 20 亿参数的基于扩散的动作专家(Action Expert)组合而成,并通过强化学习进行后训练。推理器负责解析多摄像头视频、语言上下文及历史运动信息,而动作专家则将模型生成的内部表示转化为未来自车轨迹。

Alpamayo 2 Super 的感知范围可扩展至最多七个摄像头的 360 度全景覆盖,并能输出多种互补结果:未来轨迹、因果链(CoC)推理轨迹、高层元动作、针对场景问题的有依据回答,以及推理自动标注。

这种多任务设计为自动驾驶开发者在多个开发阶段提供了统一的基础框架。同一个基础模型可充当离线策略教师、评估评判器、数据引擎或新任务定制的起点,无需为每个开发阶段单独维护一套模型。

本文将介绍 Alpamayo 2 Super 支持的四种典型工作流:

生成轨迹与 CoC 推理轨迹,并在开环和闭环基准上对结果进行评估;

预测元动作,例如让行、变道和停车,同时生成对应轨迹;

以自然语言对多摄像头驾驶场景提问;

在自有视频片段上生成带 2D 定位的 CoC 自动标注。

模型权重已发布于 Hugging Face,推理 Notebook 已发布于 GitHub。模型基于 OpenMDW-1.1 协议发布,该协议是 Linux 基金会针对开放模型发行的宽松许可证,涵盖微调、衍生模型及商业再发行。蒸馏模型可直接用于商业用途,无需额外获得 NVIDIA 的授权,模型输出也不附带任何许可限制。

轨迹生成与因果链推理

在全新场景中进行推理,是自动驾驶领域的核心挑战之一。应对施工区域、被部分遮挡的行人、异常路权交互以及突然进入道路的物体,不能仅靠匹配常见轨迹模式来解决,还需要识别关键场景上下文,将其与相应的驾驶决策关联,并生成与该决策一致的动作。

Alpamayo 2 Super 与其前代模型一样,能够联合输出轨迹和 CoC 推理轨迹。轨迹表达的是自车接下来可能执行的动作,CoC 推理轨迹则提供了基于观测场景上下文做出驾驶决策的原因分析。同时返回两类输出,有助于理解模型的决策逻辑、筛选困难样本、将部署策略与更大的教师模型进行比对,以及诊断失败是源于感知、推理还是动作生成环节。CoC 轨迹还可接入 NVIDIA Halos 安全验证工作流,通过对模型场景理解的内部审查来提升系统安全性。

Alpamayo 2 Super 代码库中的推理 Notebook 展示了如何加载环视视频片段、准备自车运动历史,并采样轨迹及其对应的 CoC 轨迹,核心推理步骤及输出如下所示:

from alpamayo2_super import helper

from alpamayo2_super.load_physical_aiavdataset import load_physical_aiavdataset

from alpamayo2_super.models.alpamayo2_super import Alpamayo2Super

from alpamayo2_super.visualization import plot_inference_result

data = load_physical_aiavdataset(

"030c760c-ae38-49aa-9ad8-f5650a545d26",

t0_us=2000000,

)

model = Alpamayo2Super.from_pretrained("nvidia/Alpamayo2-Super", dtype=torch.bfloat16, device_map="cuda:0")

model_inputs = helper.prepare_model_inputs(data, model.config, model.tokenizer)

model_inputs = helper.to_device(model_inputs, "cuda")

torch.cuda.manual_seed_all(42)

with torch.autocast("cuda", dtype=torch.bfloat16):

pred_xyz, pred_rot, logprob, extra = model.sample_trajectories_from_data(

data=model_inputs,

top_p=0.98,

temperature=0.6,

num_traj_samples=1,

diffusion_kwargs={"inference_step": 10},

return_extra=True,

)

fig, metadata = plot_inference_result(

data=data,

pred_xyz=pred_xyz,

extra=extra,

)

为评估模型输出的推理质量与轨迹质量,可采用开环和闭环两种评估方式。开环评估通过与真实标注进行对比,衡量模型在已记录场景中的轨迹与推理质量。

Alpamayo 2 Super 取得了以下评估结果:

轨迹预测方面:在 Physical AI AV 数据集的 1,434 个高难度样本上,6.4 秒 minADE_6 达到 0.911 米;

自动驾驶推理方面:在 Physical AI AV 推理基准上得分为 0.433;

LingoQA 方面:Alpamayo 2 Super 以 79.2 的得分位居 37 个评估模型之首,以 340 亿参数领先 Qwen2.5-VL(72B)17.0 分、Qwen3-VL(32B)7.0 分、Gemini 2.5 Pro 15.1 分,以及 GPT-4o 23.2 分。

其中 minADE_6 越低代表轨迹预测越准确,推理得分越高代表性能越好。

开环指标的主要局限在于,其评估基于固定的预录未来数据,无法捕捉模型第一步动作执行后场景可能发生的连锁变化。例如,若自车执行变道操作,开环回放可能仍按原始轨迹移动相邻车辆,而未考虑其对自车行为的响应。

闭环仿真则能在场景中执行每个预测动作,当仿真器包含反应式行为模型时,还能捕捉周围智能体的动态响应。NVIDIA AlpaSim 通过持续渲染观测画面、查询策略并应用其动作,使开发者能够随时间推移衡量这些闭环效应。

在 913 个重建场景上,Alpamayo 2 Super 取得了 1.50 ± 0.13 的 AlpaSim 得分。该闭环评分与开环结果形成互补,揭示了仅在策略影响未来观测后才会暴露的碰撞、道路偏离、近距危险等失效情况。

元动作预测

轨迹虽然精确,但并不总能简洁地表达驾驶意图。元动作以高层决策的形式对规划进行概括,例如让行、变道、停车或加速。这类输出有助于打通端到端基础模型与模块化自动驾驶系统之间的接口:下游规划器可直接使用该决策,评估器可核验轨迹几何形态是否与意图一致,团队也可通过此功能在数据库中检索特定驾驶动作。

元动作 Notebook 展示了如何在示例场景中生成元动作输出。核心推理步骤及输出如下所示:

from alpamayo2_super import helper

from alpamayo2_super.load_physical_aiavdataset import load_physical_aiavdataset

from alpamayo2_super.models.alpamayo2_super import Alpamayo2Super

from alpamayo2_super.text_tasks import generate_text, prepare_text_generation_inputs

data = load_physical_aiavdataset(

"030c760c-ae38-49aa-9ad8-f5650a545d26",

t0_us=2000000,

)

model = Alpamayo2Super.from_pretrained("nvidia/Alpamayo2-Super", dtype=torch.bfloat16, device_map="cuda:0")

task_inputs = prepare_text_generation_inputs(

data=data,

model_config=model.config,

tokenizer=model.tokenizer,

task="meta_action",

)

task_inputs = helper.to_device(task_inputs, "cuda")

torch.cuda.manual_seed_all(42)

with torch.autocast("cuda", dtype=torch.bfloat16):

result = generate_text(

model,

task_inputs,

top_p=0.98,

temperature=0.6,

max_new_tokens=512,

)

cot = result["cot"][0]

meta_action = result["meta_action"][0]

print("Chain-of-Causation:\n", cot)

print("\nMeta-action:\n", meta_action)

为评估元动作的预测准确性,我们将 Alpamayo 2 Super 的输出与真实标注进行对比,并以交并比(IoU)报告其元动作分类体系三个维度的分类准确率:横向、纵向和车道维度。

在含有真实元动作数据的 94,000 个内部视频片段上,Alpamayo 2 Super 在其元动作分类体系中分别取得了 74.59 的横向 IoU、61.91 的纵向 IoU 和 73.55 的车道维度 IoU。

场景理解与视觉问答

规划只是驾驶基础模型的用途之一。视觉问答(VQA)通过自然语言直接展示模型的场景理解能力。开发者可以询问场景中的关键要素、它们对驾驶行为的影响、自车减速的原因等各类场景相关问题。

VQA 在交互式调试和数据运营中具有重要价值:它可以帮助开发者排查策略行为异常的原因,对大规模视频集合构建语义过滤器,并生成供人工复核的候选标注。借助环视摄像头输入,问题还能涉及仅使用前视摄像头无法覆盖的侧方和后方场景。

对于每个视频片段,Alpamayo 2 Super 不仅能生成回答,还能通过在相关摄像头帧中预测 2D 边界框,对提及的交通参与者进行空间定位。这种定位能力使输出比纯文本更具实用价值:审核人员可以核验模型引用的是哪个具体目标,自动化检测可标记缺失或不一致的边界框,下游模型也可通过蒸馏等方式利用视觉证据、推理与动作之间更紧密的关联。

场景理解与 VQA Notebook 展示了如何使用相同输入执行视觉问答,核心推理步骤及输出如下所示:

from alpamayo2_super import helper

from alpamayo2_super.load_physical_aiavdataset import load_physical_aiavdataset

from alpamayo2_super.models.alpamayo2_super import Alpamayo2Super

from alpamayo2_super.text_tasks import generate_text, prepare_text_generation_inputs

data = load_physical_aiavdataset(

"ea4a6729-bf33-4997-905b-cd58774a3580",

t0_us=7500000,

)

model = Alpamayo2Super.from_pretrained("nvidia/Alpamayo2-Super", dtype=torch.bfloat16, device_map="cuda:0")

task_inputs = prepare_vqa_inputs(

data=data,

model_config=model.config,

tokenizer=model.tokenizer,

question="Describe the driving scene and identify the key traffic elements that should influence ego behavior.",

)

task_inputs = helper.to_device(task_inputs, "cuda")

with torch.autocast("cuda", dtype=torch.bfloat16):

result = generate_text(

model,

task_inputs,

top_p=1.0,

temperature=0.1,

max_new_tokens=1024,

)

answer = result["answer"][0]

print(answer)

为评估 VQA 性能,我们在 8,000 个内部问答对上将 Alpamayo 2 Super 生成的回答与真实答案进行比对。模型取得了 0.652 的回答相似度(越高越好),而 Qwen3-VL 32B 为 0.450。在 2D 定位方面,我们使用 IoU 将预测边界框与真实标注进行比较,Alpamayo 2 Super 取得了 0.71,而 Qwen3-VL 32B 仅为 0.17。这两项指标共同评估了模型是否能在准确回答问题的同时,将回答与环视摄像头中正确的视觉证据相关联。

CoC 自动标注

推理模型需要基于决策的推理数据,但对长尾驾驶场景进行人工标注既耗时又成本高昂。标注人员需要审查时序和多摄像头上下文,识别因果性交通参与者,描述其对自车的影响,并确保标注与预期驾驶动作保持一致。Alpamayo 2 Super 可作为离线自动标注器,在规模化场景下自动生成这一结构化内容,将标注周期从数月压缩至数天。

CoC 自动标注 Notebook 接受符合发布格式的视频片段,并为每个选定的关键帧输出一条结构化记录,核心推理步骤及输出如下所示:

from alpamayo2_super import helper

from alpamayo2_super.load_physical_aiavdataset import load_physical_aiavdataset

from alpamayo2_super.models.alpamayo2_super import Alpamayo2Super

from alpamayo2_super.text_tasks import generate_text, prepare_text_generation_inputs

data = load_physical_aiavdataset(

"b5f3756c-4f0e-4298-a1ff-cc92ed392ae0",

t0_us=11000000,

)

model = Alpamayo2Super.from_pretrained("nvidia/Alpamayo2-Super", dtype=torch.bfloat16, device_map="cuda:0")

task_inputs = prepare_text_generation_inputs(

data=data,

model_config=model.config,

tokenizer=model.tokenizer,

task="auto_labeling",

)

task_inputs = helper.to_device(task_inputs, "cuda")

torch.cuda.manual_seed_all(42)

with torch.autocast("cuda", dtype=torch.bfloat16):

result = generate_text(

model,

task_inputs,

top_p=0.98,

temperature=0.6,

max_new_tokens=1024,

)

auto_labeling_text = result["cot_auto_labeling"][0]

auto_labeling_json = result["cot_auto_labeling_json"][0]

print(json.dumps(auto_labeling_json, indent=2))

默认情况下,Alpamayo 2 Super 假设可以访问未来自车轨迹信息。但它同样支持对不包含未来轨迹信息的数据进行自动标注:模型可先自行预测一条未来轨迹,再将其作为"观测到的"未来运动信息用于自动标注流程。

为评估 CoC 自动标注的质量,我们在 8,000 个内部视频片段上将 Alpamayo 2 Super 生成的标注与专家标注进行比对,并使用内部评判模型评估相似度。Alpamayo 2 Super 取得了 0.652 的相似度得分,而 Qwen3-VL 32B 为 0.450。这些结果表明,该模型在规模化生成结构化推理标注的同时,能够保持与专家标注的一致性。

总结

Alpamayo 2 Super 将环视感知、推理、规划、场景理解与数据自动标注整合进一个开放的模型工作流。这些能力为开发者提供了一套实用的基础框架,可用于构建教师模型、筛选长尾数据、排查策略决策,以及超越单一开环轨迹指标对自动驾驶系统进行全面评估。作为教师模型,它还可被蒸馏为能够部署在车载 NVIDIA DRIVE AGX Thor 上的轻量级模型。

欢迎在 Hugging Face 上探索该模型,运行推理 Notebook,并在 Alpamayo 开发者论坛分享你的成果。

如需了解 Alpamayo 2 版本中更多更新内容,请参阅 Hugging Face 上的相关博客文章。

Q&A

Q1:NVIDIA Alpamayo 2 Super 是什么模型,有哪些核心能力?

A:Alpamayo 2 Super 是一款 340 亿参数的开放推理视觉-语言-动作模型,专为自动驾驶研发设计。它融合了 320 亿参数的 Cosmos 3 Super Reasoner 与 20 亿参数的扩散式动作专家,支持 360 度全景感知,可同时输出未来轨迹、因果链推理轨迹、元动作、场景问答以及推理自动标注等多种结果,为自动驾驶开发的多个阶段提供统一的基础模型。

Q2:Alpamayo 2 Super 的 LingoQA 评测结果如何,与其他模型相比怎么样?

A:Alpamayo 2 Super 在 LingoQA 基准测试中以 79.2 的得分位列 37 个评估模型第一。以 340 亿参数领先 Qwen2.5-VL(72B)17.0 分、Qwen3-VL(32B)7.0 分、Gemini 2.5 Pro 15.1 分,以及 GPT-4o 23.2 分,展现出在驾驶场景语言理解方面的显著优势。

Q3:Alpamayo 2 Super 的 CoC 自动标注功能有什么实际价值?

A:CoC 自动标注功能可以让 Alpamayo 2 Super 充当离线自动标注器,在大规模数据上自动生成结构化推理标注,无需人工逐帧审查多摄像头上下文和因果关系。在 8,000 个内部视频片段的测试中,其标注相似度得分为 0.652,远高于 Qwen3-VL 32B 的 0.450,可将标注周期从数月大幅压缩至数天。

NVIDIA