我们推出一个统一的多智能体框架,能够自主生成时间连贯的长篇视频叙事,克服了当前线性AI流程中存在的身份漂移和级联故障问题。

近期视频扩散技术的进展展现出卓越的高保真生成能力,相关模型能在几秒钟内渲染出逼真场景。然而,尽管扩散模型能够生成高保真视频片段,将其转化为连贯的长篇叙事引擎仍然充满挑战。

目前大多数智能体流程通过链式模块自动化这一过程,但由于独立、手工制作的提示词,这些流程存在语义漂移问题(角色服装或场景在不同镶头间发生细微变化)以及级联故障问题(例如上游资产的瑕疵会破坏下游的视频合成)。由于早期错误会不断传播并破坏长时程的一致性,这一过程往往需要大量人工干预。从结构角度看,这反映了经典的信度分配问题,因为最终的失败很难追溯到具体某个提示词。此外,现有方法还存在特征漂移问题(实体和环境会无意中逐渐发生变化)或内容坍缩问题(叙事无法有意义地推进)。

今天,我们介绍我们在AI视频联合导演方面的研究——这是一个统一的多智能体框架,可以明确规划多镶头叙事中的视觉连续性。该框架构建在Gemini和Veo之上作为一个编排层,天然继承了诸如SynthID水印等安全机制。通过将长篇视频生成视为一个全局优化和世界状态跟踪问题,我们开发了一系列框架——Co-Director(将发表于COLM 2026)、CANVAS(将发表于EMNLP 2026)、A?RD以及VQQA——这些框架将高层次的人类创意规范转化为具体执行,自动完成从多模型提示词生成、镶头衔接到闭环视觉优化等重复性编排任务。

我们设计这些框架的目的是让它们成为响应迅捷的创意伙伴,抽象掉维持视觉连续性的繁琉负担,让用户能够专注于讲故事这门艺术本身。这种架构通过将质量建模为一个测试时目标,将创意合成与一致性维护解耦开来。在全面的评估中,我们的框架在多镶头叙事一致性和角色持续性方面展现出显著提升,成功生成了数分钟长的视频,同时缓解了视觉漂移和流程错误传播问题。

工作原理

为解决长时程视频这一多维度问题,我们将研究拆解为四大基础支柱,每一个都针对生成流程中的特定瓶颈。

为确保整个视频的语义连贯性,我们提出了AI视频联合导演——一个分层多智能体框架,将视频叙事形式化为一个全局优化问题。我们不依赖僵化的线性提示词链,而是引入了分层参数化机制:一个多臂老虎机(MAB)算法在全局层面识别有潜力的创意方向。

这将创作过程形式化为在探索新颓叙事策略与利用有效创意配置之间寻求最优平衡的搜索过程。系统会采样抽象的创意轨迹——例如将信息型策略与小品叙事模式以及特定审美原型相结合——并将这些动态注入子智能体的系统提示词中。这种自顶向下的引导确保整个流程在统一的愿景下运作。由于我们的AI视频联合导演框架作为一个编排层运行,它通过将这些结构化提示词直接输入到基础的Gemini和Veo模型中来实现这一愿景(尽管其模型无关的架构使其能够搭载在任何基础生成模型之上)。这种架构确保所有生成的图像、视频和音频都天然携带原生安全保护措施,包括SynthID水印。在生产环境中,还可以在最终视频上应用额外的安全分类器,以防范单独安全的镶头之间产生意外的上下文交互。

该流程通过两个相互关联的循环执行全局优化:战略引导和多阶段制作。首先,编排智能体使用MAB算法评估输入内容,在三个维度上选择创意配置:(1)创意策略(意图)、(2)叙事模式(故事结构)、(3)审美原型(视觉基调和摄影风格)。这一配置驱动着整个制作层级。前期制作智能体将简要的逐场景故事线和视觉资产综合成统一的故事板。随后,制作智能体通过专门的子智能体将故事板转化为具体的音视频内容:关键帧智能体锚定角色和场景视觉效果,视频智能体添加运动效果,音频智能体叠加匹配的配音和配乐。

最后,一个多模态大语言模型(MLLM)评判者会从三个既定维度对合成后的剪辑进行评价,将分解后的奖励信号反馈给MAB,以便在后续的生成循环中迭代优化和调整选择。

AI视频联合导演多智能体流程。上:编排智能体利用MAB在分解的创意行动空间中导航。下:前期制作智能体综合创意简报、故事线和视觉资产,建立一致的故事板,制作智能体将其转化为同步的关键帧、视频片段和音频。MLLM评判者对最终视频进行评估,生成分解后的奖励信号,反馈给MAB,以便在多轮优化循环中迭代改进创意配置。

即使有了统一的剧本,生成长序列镶头仍常常导致角色漂移和环境不稳定。为解决这一问题,我们提出了基于视觉智能体故事板的连续性感知叙事框架(CANVAS),这是一个明确规划多镶头叙事中视觉连续性的多智能体框架。

CANVAS通过在叙事发展过程中维护角色、地点和物体状态的结构化表征来强制保持连贯性。该框架构建在Gemini之上作为编排层,依赖于一个持久性的视觉记忆库。通过从记忆库中检索视觉锚点或在需要时初始化新的锚点,CANVAS确保同一场景内的顺畅过渡。这种显式的世界状态建模确保角色在再次出现时保持身份一致,环境在再次出现时保持空间结构一致。

为直观展示效果,下图展示了一个多镶头博物馆盗窃场景,将CANVAS与代表性基线方法进行对比:直接使用底层基础模型(Gemini-3.1-Pro)生成,以及另一种多智能体框架(AutoStudio)生成。图底部的提示词突显了必须保持视觉特征一致的重复元素——例如小偷、展厅和宝石。请注意每种方法处理连续转场(例如角色的服装)与非连续转场(例如镜头绕道后返回主展厅)的方式有何不同。单独使用Gemini-3.1-Pro生成时会出现道具不一致(文物发生变化)和背景漂移(房间布局发生变化)的问题,显示出无引导生成的局限性。AutoStudio在跨镶头切换时也会出现质量下降,导致角色漂移(小偷的帽子消失)和背景不一致。相比之下,CANVAS的持久性视觉记忆确保角色、空间几何结构和物体状态在整个叙事过程中保持完全连贯。

来自HardContinuityBench博物馆盗窃场景的视觉故事板对比,将CANVAS与AutoStudio及Gemini-3.1-Pro基线进行对比。

为将故事板转化为实际的数分钟长视频,我们开发了A?RD,一种智能体自回归视频生成架构。A?RD具备逐段生成能力,并辅以能够追踪片段上下文和动态变化的多模态视频记忆。

对于每个片段,系统在一个检索-合成-优化-更新的循环中运作。该循环中的一个关键部分是智能体如何自适应地确定片段生成模式。它能平滑地在外推模式(允许叙事自然推进)和内插模式(将片段锚定到已存在的实体和环境)之间切换。这有效平衡了故事推进的需求与维护场景物理真实性的必要性。

为测试这一系统,下面这部十分钟的电影展示了一次长篇生成过程,要求在长达数分钟的时间间隔内保持一致的叙事推进。该视频突显了系统如何在两种操作模式间动态切换:利用外推模式将剧情推进到新的叙事节点,利用内插模式将重新出现的角色和环境锚定回其原始设计。标准视频生成器往往会遭受严重的视觉衰减——角色发生变异、场景发生形变——而A?RD则持续查询其多模态视频记忆,从开场镜头到最后一帧始终维持角色身份、服装细节和结构几何的一致性。

观看这部电影

链接至YouTube视频

这部长篇视频展示了A?RD在长达十分钟的连续时长内保持严格视觉一致性和叙事推进能力的表现。

最后,我们还需要一种方法,让系统能够自主识别并修复视觉瑕疵。现有的测试时优化方法通常计算成本高昂,或需要对模型内部进行白盒访问。为解决这一问题,我们开发了视频质量问答框架(VQQA),这是一个可推广至多种输入模态和视频生成任务的统一多智能体框架。

VQQA能够根据特定提示词动态生成视觉问题,并将由此产生的视觉语言模型(VLM)评价结果作为语义梯度使用(提供自然语言的方向性反馈以指导迭代优化,类似于反向传播中的数值梯度)。这用人类可理解的、可操作的反馈取代了传统的被动评估指标。系统随后能够通过自然语言界面执行高效的迭代反馈循环(模型生成视频、通过视觉问题进行评估,并根据评价结果优化文本提示词)。为防止此优化过程中出现语义漂移,VQQA采用了全局选择机制:系统不会盲目采用最后一次迭代的输出结果,而是由一个全局VLM评分器根据原始未编辑的提示词,对优化轨迹中生成的每一个视频进行评估。系统随后选择得分最高的候选结果,确保局部修正不会损害更广泛的上下文一致性。

在实际操作中,VQQA作为一个黑盒提示词优化器运作,而非像素级编辑器。它并不直接修改像素,而是迭代优化文本提示词,以纠正属性绑定错误或角色属性不一致等高层构图缺陷。这一更新后的提示词会引导生成器在其潜在空间中采样一条新的路径。在下面的示例中,VQQA并未对原始帧进行遮罩或涂改;相反,它通过将逼真的镀铝气球质感渲染到严格的立方体几何结构上,解决了模型的材质绑定难题;并通过在剪辑过程中始终保持小提琴手和钢琴手与各自乐器的一致锚定,修复了表演过程中乐器混乱切换的问题。

解决属性绑定错误。提示词:“一个立方体气球飘过圆形窗户,阳光透过玻璃窗洒落。”原始生成结果(左)未能捕捉到气球的特性,渲染出的是一个僵硬、无质感的立方体,而VQQA(右)成功呈现了预期的立方体形状,同时保持了充气气球的质感和材质特性。通过利用迭代视觉反馈,优化后的提示词引导生成器渲染出一个具有清晰边缘和接缝、轮廓分明的箱形镀铝气球,平稳地飘过阳光照射的窗户。

解决时间不一致问题。提示词:“小提琴手和钢琴手以和谐的二重奏表演吸引观众。”原始生成结果(左)在镶头转换过程中出现严重的连续性中断,最初显示一位女性钢琴手和一位男性小提琴手,但切换镶头后却突然显示该女性在演奏小提琴。VQQA(右)则在整个表演过程中保持严格的语义一致性,让女性钢琴手和男性小提琴手始终锚定在各自的乐器上。

关键成果与基准测试

为严格评估我们的各个框架,我们开发了三个专门的基准测试,旨在还原专业视频制作中面临的各种挑战。

我们的评估结果表明,相较于现有视频生成架构,各框架均取得了可衡量的性能提升。通过在创意策略搜索空间中导航,AI视频联合导演在GenAD-Bench上取得了81.4的峰值质量得分,并在ViStoryBench上提升了故事一致性。CANVAS利用结构化视觉记忆缓解场景漂移,在ST-Bench和HardContinuityBench上的场景重现测试中取得了显著的连续性提升。针对长时程时间动态问题,A?RD最大限度地减少了布局漂移,在VBench-Long和LVBench-C上持续数分钟的运行测试中提升了角色和环境一致性。最后,VQQA的闭环提示词优化解决了物理和构图上的不一致问题,在T2V-CompBench、VBench2和VBench-I2V上带来了显著的绝对质量提升。有关我们模型架构、训练配置和基线评估的详细信息,请参阅各篇独立论文。

未来方向

这些框架代表着为创作者解锁连贯、长时程视觉叙事的一个基础性步骤。在持续完善这些智能体架构的过程中,我们正在探索如何整合人机协同工作流程。我们的最终目标并非取代人类的叙事创作,而是通过抽象掉维护时间一致性和世界状态跟踪的繁琉复杂性,赋能创作者,确保他们始终掌控创意方向和叙事设计的主导权。

致谢

这项工作得以完成,离不开谷歌各研究团队成员的辛勤付出。我们要感谢Andrew Pan、Brett Slatkin、Burak Gokturk、Carina Claassen、Daniel Vlasic、Do Xuan Long、Ishani Mondal、Jasmine Leon、Jingyun Liu、Joe Timmons、Jordan Boyd-Graber、Khanh G. LeViet、Kuang Su、Long T Le、Mihir Parmar、Min-Yen Kan、Nathan Hodson、Nick Losier、Palash Goyal、Rhyard Zhu、Sebastian Ko、Scott Penberthy、Yan Xu、Yang Li、Ye Jin以及Tomas Pfister,感谢他们为这一系列研究做出的宝贵贡献。

Q&A

Q1:AI视频联合导演框架是什么?

A:这是一个统一的多智能体框架,构建在Gemini和Veo模型之上作为编排层,能够明确规划多镶头视频叙事中的视觉连续性,将高层次的创意需求自动转化为连贯的长篇视频内容,同时天然继承SynthID水印等安全机制。

Q2:CANVAS框架如何解决角色和场景漂移问题?

A:CANVAS通过维护角色、地点和物体状态的结构化表征以及持久性视觉记忆库来解决这一问题。它能从记忆中检索视觉锚点,确保角色在再次出现时保持身份一致,环境保持空间结构一致,从而避免了传统方法中常见的角色漂移和背景不一致问题。

Q3:VQQA框架是如何自动修复视频中的瑕疵的?

A:VQQA会根据具体提示词动态生成视觉问题,并利用视觉语言模型的评价结果作为反馈信号,迭代优化文本提示词,而非直接修改像素。它采用全局选择机制,从多个优化版本中挑选出与原始提示词匹配度最高的视频,从而修复属性绑定错误或时间不一致等问题。

Google