本文素材来自 a16z 播客节目,由 a16z 普通合伙人马丁·卡萨多(Martin Casado)主持,对话嘉宾是 World Labs 的三位联合创始人:李飞飞(Fei-Fei Li)、贾斯汀·约翰逊(Justin Johnson)和本·米尔登霍尔(Ben Mildenhall)。三人共同回顾了公司新一代世界模型 Atlas 的发布,以及这一模型对"空间智能"这条技术路线意味着什么。

李飞飞是学界公认的计算机视觉领军人物,ImageNet 的创建者,此前曾任斯坦福大学以人为本人工智能研究院院长,并在谷歌云担任过首席科学家。2024 年她创办 World Labs,明确提出要攻克"空间智能"这一比语言智能更古老、也更少被攻克的智能形态。此次登场的 Atlas,是这家公司继此前发布空间智能生成产品之后的又一次技术跃进,也是三位创始人首次公开、系统地拆解模型内部的技术判断。

节目录制于 Atlas 发布次日,创始人们坦言线上反响"还在持续涌入"。争议随之而来:市面上号称"世界模型"的视频生成产品已经不少,Atlas 究竟是又一次参数堆砌,还是真正代表了一种新架构?这场对话试图正面回答这个问题。

1. 三台iPhone,拍出《黑客帝国》的子弹时间

节目一开场,约翰逊就抛出了一个直观的例子。他提到《黑客帝国》第一部里尼奥(Neo)在子弹时间中后仰躲避的经典镜头:拍摄时剧组在绿幕影棚里架设了数百台相机排成一圈,捕捉尼奥倒地那一瞬间的每个角度,才拼出那个环绕镜头。

"但现在用 Atlas,我们只需要三台相机就能做到。"约翰逊说。不需要影棚拍摄,不需要绿幕,也不需要昂贵的相机标定。团队实际测试时,把三部 iPhone 架在三脚架上,拍摄一个人投篮,或者一颗草莓落入牛奶碗的瞬间。仅凭这三段手机视频,Atlas 就能重新构建整个拍摄场景,让时间"冻结",同时让虚拟相机绕着牛奶飞溅的瞬间自由环绕拍摄,生成过去只有好莱坞特效团队才能实现的镜头。

这类"子弹时间"效果在视频发布后在网上引发了大量关注,但米尔登霍尔强调,这只是 Atlas 众多能力中的一项外化表现,其底层是一套全新的技术逻辑。

2. "新视角预测":继下一个词元、下一帧之后的第三种预测

被问及 Atlas 最核心、最本质的能力是什么时,约翰逊给出了一个简洁的类比:"大语言模型建立在下一个词元预测(next token prediction)上,视频模型建立在下一帧预测(next frame prediction)上,而 Atlas 做的是新视角预测(new view prediction)。"

具体来说,模型接收若干张场景的图像或视角,这些输入会被编码成一种他们称为"空间上下文"(spatial context)的表示,隐式描述了整个场景的构成。此后,用户可以将一台虚拟相机指向空间和时间中的任意一点,模型会推理出从那个位置、那个时刻看过去,这个世界应该是什么样子。

约翰逊将这一点称为"一个此前从未有人做过的、全新的基础模型原语(primitive)"。这不只是概念包装。他解释说,Atlas 的输入天然是多模态的:文本、图像、视频,以及此前从未在预训练阶段作为原生输入使用过的相机位姿(camera pose)。模型使用的 3D 表示方式是深度图(depth map):每一帧画面在关联一个相机在三维空间中的位置和参数的同时,还携带该位置对应的 RGB 图像信息和深度图信息,描述这个位置的空间结构。文本、图像、视频、3D 相机——这些模态被统一在同一个联合训练体系中处理。

3. 每一帧都有"准确坐标",而不是任模型自由发挥

米尔登霍尔进一步解释了 Atlas 与市面上"号称是世界模型"的海量视频生成产品的本质差别。他指出,很多视频模型之所以出名,靠的是单一维度输入,或者首尾帧插值这类能力,如今也出现了能处理20张、30张甚至50张参考图像的"全参考"模型。但 Atlas 的关键不同在于,每一帧输入都携带着精确的空间锚定意义。

"这不是一张任由模型随意解读的图片,你也没法通过文本提示词跟它'讨价还价',让它做出你想要的效果。"米尔登霍尔说。在 Atlas 里,每张图像都关联着一个具体的三维相机位姿,这意味着重建任务可以达到极高的精度。他举了一个例子:如果给模型输入房间四个角落各拍的一张照片,模型会精确复现房间里的每个细节,而不会去"猜测"其他角落里可能有什么东西、物体之间的关系是什么——它只是精确地重现你给它的内容。

这种精确性同时也能服务于创作场景。用户可以拿两张来自不同 AI 生成结果或真实世界地点的照片,把它们摆放、布置在同一个虚拟空间里,构建出精确可控的运镜穿梭画面,相机看向哪里、如何移动,都由用户在空间中的精确布局决定。米尔登霍尔将这种体验与传统视频模型反复试错、依赖高层级文本控制的"老虎机式"生成体验做了对比,认为前者提供了一种全新的、更具确定性的创作方式。

4. 半个世纪的计算机视觉,第一次把生成和重建拧在一起

面对主持人的追问——"这是不是只是一个传统视频模型的规模放大版?"——约翰逊给出了否定的答案,理由有两点。

第一,Atlas 在同一个模型里同时完成生成与重建两项任务。历史上,三维重建一直是计算机视觉里独立的子领域,有自己专门的任务设定和专用模型;而生成则是过去几年所有文本到视频扩散模型擅长的领域,服务于"想象出前所未见的画面"这类创意应用。Atlas 第一次把这两种此前分立的视觉智能能力放进了同一个架构。

第二,为了实现这一点,团队从底层设计上就把模型做成了原生多模态:文本、图像、视频、相机位姿、深度图,这些模态从预训练阶段起就被作为原生输入统一处理,约翰逊认为这在此之前"没有人这么做过"。

李飞飞在此处补充了她认为被低估的一点。她指出,Atlas 是历史上第一次实现了像素生成与像素重建的统一。计算机视觉作为一个学科已经存在超过半个世纪,"我坐在这里,已经在这个领域几十年了,我无法告诉你有多少篇博士论文是围绕重建或者新视角合成这个问题写出来的。"她回忆道,传统的计算机视觉会议通常会把生成、识别、三维重建分成完全不同的分论坛,彼此互不相通。而 Atlas 的做法是,以视角(viewpoint)本身作为锚点,把生成和重建这两个长期分裂的问题统一了起来。"这非常优雅,也非常强大。"

5. 空间智能到底是什么:不只是生成,还要能推理、能编辑、能交互

对话回到了一个更根本的问题:李飞飞创办 World Labs 时提出要攻克的"空间智能",究竟指什么?Atlas 的"新视角预测"又是怎样服务于这个更宏大的目标的?

李飞飞给出的定义是:空间智能最终必须让人能够生成空间本身、在空间内部进行推理,并能够编辑和交互于这个空间。她指出这里可以讨论究竟是三维还是四维——终极形态一定是带有时间维度的四维——但即便只谈三维,生成、推理、编辑与交互也是空间智能必须完成的基本任务。在此基础上,才能谈到渲染、模拟以及规划动作。而要做到这些,一个根本前提是理解空间的几何结构、物理规律。

她认为 Atlas 是朝这个方向迈出的重要一步,原因在于:现在模型对每一帧画面,都能生成一个关键信息的估计值——视角,也就是相机位姿。而这恰恰是理解空间几何结构最核心的信息,也是团队在博客中展示的诸多下游"涌现能力"的源头。李飞飞总结道,在通往空间智能的道路上,单纯生成像素只是早期的一步,市面上已经有"数不清"(她用了"gazillions"这个夸张但生动的说法)的模型能做到这一点;但生成真正在空间上被语境化、被锚定的像素,是完全不同的、更难的一步,而这正是 Atlas 迈出的关键一步。

对话结尾处,几位创始人还谈到了这项技术在游戏、建筑和机器人领域的应用前景,李飞飞特别提到,当前限制机器人训练的最大瓶颈之一,正是真实世界训练数据的匮乏——而具备空间理解能力的世界模型,或许正是弥补这一缺口的路径。从子弹时间的视觉奇观回望,Atlas 真正想解决的问题,其实是如何让机器像人一样,理解自己所处的这个三维、乃至四维的世界。

playlist1 作者:智顶顶