这两天上海正在进行举办车展,据说一共有193场发布会。不过这次车展因为一次大家都知道的事故,氛围有些特殊。一个最主要的变化就是,原来车展上随处可见的智能驾驶四个字变成了辅助驾驶。
其实这就是物理AI和数字AI(也可以具体称作内容AI、编码AI)的区别。对于数字AI而言,比如文本、图形、视频生成,都发生在数字空间,它可能有风险,但是不会在短时间内对人的生命安全造成损失,但是物理AI就不同。尤其是汽车,它可能是人类在日常生活中所能接触到的动能最大的智能产品,和每一个普通人的生活都息息相关。但是另一方面,我们又很清楚地意识到,汽车的智能化浪潮(或者说任何事物的智能化)只会暂停,但是不会停止。所以在这个节点,我想发一下关于和智能驾驶相关的内容是有借鉴意义的。
美国无人出租车公司Waymo副总裁Drago访谈:自动驾驶一周20万次出行,安全水平超人类80%,“端到端这个概念被过度使用了”
内容的核心主体来自TWIML AI 播客主持人Sam Charrington和Waymo研究副总裁Dragomir Anguelov(简称Drago)的对话。他们就基础模型如何重塑自动驾驶做了很细节的技术探讨。说明一下,他们在2021年2月对谈过一次,这是时隔四年的再次交流。
至于我们为什么选择Waymo,则是因为它的代表性,这里我简单介绍一下。Waymo是一家专注于自动驾驶技术研发的公司,隶属于Alphabet(Google母公司),起源于2009年Google启动的自动驾驶汽车项目,2016年独立成为Alphabet旗下子公司,2020年开始商业化运营。
美国无人出租车公司Waymo副总裁Drago访谈:自动驾驶一周20万次出行,安全水平超人类80%,“端到端这个概念被过度使用了”
说到这儿,我们必须说Google谷歌还是厉害,无论是大语言模型,还是智能驾驶这样的物理AI,这家公司都是头部企业。怪不得当年山姆·奥特曼和马斯克两个骄傲的人会合作创立OpenAI,都是因谷歌在AI领域过于强大所致。
这家公司也创造了智能驾驶领域的几个首次:
1、Waymo是全球最早启动自动驾驶汽车研发的企业之一,拥有近15年的技术积累,核心自动驾驶技术实现完全自主研发。
2、Waymo已实现SAE定义的L4级自动驾驶,能够在特定区域实现无人驾驶出租车服务,无需(或者说只是抽查性的)安全员实时监控。比较而言,特斯拉目前的“全自动驾驶”(FSD)系统仍处于L2级别,意味着驾驶员必须保持警觉,随时准备接管车辆,尚未达到真正的无人驾驶水平。
3、2018年,Waymo在美国亚利桑那州凤凰城启动全球首个公共道路上的无人驾驶出租车服务。2019年,Waymo One成为全球首个在无安全驾驶员监控下运营的无人驾驶出租车服务。
美国无人出租车公司Waymo副总裁Drago访谈:自动驾驶一周20万次出行,安全水平超人类80%,“端到端这个概念被过度使用了”
而受访嘉宾Drago也是业内专家,他曾在Google工作8年,期间主要从事3D视觉和姿态估计,参与开发了Google Street View的关键技术,并领导了一个计算机视觉团队,开发了用于Google Photos图像标注的系统。他所在团队发明了著名的Inception神经网络架构和SSD检测器,赢得了2014年ImageNet图像分类和检测挑战赛。
最后说明一下,我没有任何在这个时间点试图鼓吹和诋毁这个行业的想法,只是想借此提供一些知识和思考。
一、商业化里程碑:从实验到大规模服务
距离上次访谈的四年间,Waymo取得了显著进步。Drago透露,目前Waymo已在四个主要市场(旧金山、凤凰城、洛杉矶和奥斯汀)提供全自动驾驶服务,每周完成超过20万次出行,且每周自动驾驶里程超过100万英里。
"我们的服务区域覆盖范围相当可观,"Drago解释道,"凤凰城是我们服务时间最长的区域,也是西方世界最大的自动驾驶服务区域,超过300平方英里。旧金山覆盖约55平方英里,包括整个城市和部分戴利城。洛杉矶约90平方英里,而在奥斯汀这个相对较新的市场,我们覆盖约37平方英里。"
在这些城市中,用户可以通过Waymo应用程序直接叫车。在旧金山、凤凰城和洛杉矶,用户可以直接通过Waymo应用叫车,而在奥斯汀,则是通过与Uber的合作,用户需要使用Uber应用,系统会根据情况分配Waymo车辆。
在安全性方面,Waymo发布的数据同样令人印象深刻。根据最近更新的安全仪表板(涵盖首批5千万自动驾驶里程),Waymo在导致安全气囊展开的碰撞事故上比人类驾驶减少了83%,在造成人身伤害的事故上减少了81%,在需要警方报告的轻微事故上减少了64%。第三方保险公司Swiss Ray的独立研究也证实,在可比较的驾驶量下,Waymo的财产损失和人身伤害索赔比人类驾驶减少了约80%
关于远程监控,Drago澄清道,虽然技术上操作员可以对车辆进行检查,但这种情况非常罕见。"考虑到我们的运营规模,不可能有人持续监控每一辆车。这根本不是一个好的产品模式,你不可能只是把驾驶员换成坐在工作站后面的人。"他强调,车辆并非远程操作,最多在极少数情况下,在车辆已经停止的情况下,操作员可能会确认车辆想要采取的某些行动。
二、Drago的技术旅程:从图像识别到自动驾驶研究
作为资深的机器学习研究者,Drago的专业旅程相当丰富。他在Waymo已工作近7年,自2018年夏季起领导Waymo研究团队,专注于通过机器学习和人工智能推动自动驾驶系统的前沿发展。
美国无人出租车公司Waymo副总裁Drago访谈:自动驾驶一周20万次出行,安全水平超人类80%,“端到端这个概念被过度使用了”
"我已经从事机器学习研究超过20年了,"Drago回顾道,"在加入Waymo之前,我曾在Alphabet(谷歌母公司)工作8年,主攻图像理解和深度神经网络。我们发表了一些早期的图像分类和目标检测架构,并在2014年赢得了ImageNet挑战赛。"
此外,Drago还在谷歌Street View项目上工作过,负责3D姿态估计和3D视觉技术。"当Street View车辆驾驶时,我们会在3D空间中重建周围世界,并对不同平台的轨迹进行对齐。我们不仅有汽车,还有雪地摩托、三轮车、自行车,有时甚至会把三轮车放在船上。这需要精确的位姿估计,以便在浏览这些照片和图像时,3D场景看起来合理自然。"
2015年左右,Drago进入自动驾驶领域,最初在另一家知名自动驾驶公司Zoox担任3D感知负责人,工作了两年半。随后,他有机会组建并领导Waymo研究团队,至今已有近7年的时间。
三、基础模型与自动驾驶的融合:Waymo的技术演进
自上次采访以来,人工智能领域经历了显著的技术进步,特别是基础模型、大语言模型(LLMs)、视觉语言模型(VLMs)等技术的崛起。Drago深入探讨了Waymo如何拥抱这些技术变革。
"我们一直关注机器学习和AI的最新技术,并尝试将这些进步适应到我们的领域中,通常需要一些创造性的调整,"Drago解释道,"在我的经验中,这个领域大约每两年就会出现一次重大技术飞跃,而过去两年出现的变革可能比以往更大,特别是多模态大语言模型和生成式AI技术的发展,它们能够处理图像、视频理解、音频处理等多种媒体形式。"
Waymo敏锐地意识到这些技术进步的潜力,并积极探索如何将它们应用于自动驾驶系统。Drago提到:"我们已经开始探索视觉语言模型、用于生成输出的扩散预测(包括视频和驾驶场景生成)以及3D重建技术的应用,如高斯溅射(Gaussian splatting)等。"
所谓视觉语言模型,是指能够理解图像内容并生成文本描述或回答关于图像问题的AI模型,比如谷歌的Gemini。扩散预测是一种生成模型技术,可以创建新的图像、视频或驾驶场景。高斯溅射则是一种新型3D场景表示技术,相比传统方法能更高效地重建和渲染复杂的3D环境。
事实上,Waymo在采用这些技术方面走在前列。"我们的模型已经扩展了一段时间,Transformer架构也已应用多年。如果查看我们的研究发表,早在2021年、2022年,甚至更早,我们就已在感知应用中使用Transformer。现在的变化主要在于我们对模型可扩展程度的认识有了质的提升。"
四、自动驾驶的特殊挑战:超越标准视觉语言模型
尽管视觉语言模型在多个领域取得了令人瞩目的成果,但Drago强调,自动驾驶领域有其独特的挑战,需要对这些技术进行深度改造。
"为什么我们的领域与标准视觉语言模型不同?"Drago提出了关键问题。他解释道,Waymo曾尝试将最先进的多模态大语言模型(如Gemini)适配用于驾驶任务,并在去年发表的名为"EMA"的论文中取得了相当成功的结果。(论文地址:arxiv.org/abs/2410.23262)
美国无人出租车公司Waymo副总裁Drago访谈:自动驾驶一周20万次出行,安全水平超人类80%,“端到端这个概念被过度使用了”
"Gemini带来的主要好处是世界知识。它在互联网上预训练,作为一个大型模型,已经理解了许多概念,不需要我们用自己的标签或数据直接教它。然后,我们用自己的任务和数据对其进行微调,使其能够在拥有这些预训练知识的基础上完成我们特定的任务。"
简单来说,传统方法可能需要人工标注大量数据来教会AI识别路上的各种物体,而使用像Gemini这样的预训练模型,它已经能识别大多数常见物体,Waymo只需教它如何在驾驶场景中应用这些知识。
然而,自动驾驶对AI系统提出了独特要求:
空间感知:"我们的系统依赖于对周围环境的强大空间感知能力。这对安全至关重要,但需要更深入地理解3D世界。我们有额外的传感器,如激光雷达(LiDAR)和雷达,它们在提供3D空间感知方面非常出色,而标准Gemini模型不具备处理这类传感器数据的能力。"
长时记忆:"在自动驾驶中,你需要基于几秒钟或更长时间的历史进行推理,这可能涉及大量帧。你需要以某种方式整合、维护和构建这种记忆,这对标准视觉语言模型来说是个挑战。"
防止幻觉:"模型可以预测事物,但在它未见过的领域,有时可能会出错或'幻觉'(即产生不准确的预测)。在我们的系统设计中,我们需要考虑如何缓解'脱离数据流形'和幻觉等问题,这对自动驾驶的安全性极其重要。"
简而言之,虽然基础模型提供了丰富的世界知识和强大的架构,但需要进一步开发才能满足自动驾驶的特殊需求。
五、Waymo Foundation Model:打造自动驾驶专属基础模型
基于对基础模型潜力与局限的深刻理解,Waymo正在开发自己的专用基础模型。Drago阐述了这一雄心勃勃的项目的愿景。
"我们正在构建我们称之为'Waymo Foundation Model'的东西,它不仅仅是对标准VLM的适配,我们希望引入我之前提到的所有能力,在数据中心构建一个大型模型,看看我们能在多大程度上理解我们看到和收集的所有数据。"
这个模型的构建方法与普通的视觉语言模型不同。它需要整合来自多种传感器的数据(如摄像头、激光雷达和雷达),具备长时记忆能力,并且能够防止产生不安全的"幻觉"。
Waymo的方法是首先在数据中心构建这样一个大规模模型,不受实时处理和车载计算资源的限制,然后将其知识"蒸馏"到能够在车辆上运行的更小模型中。
"这个模型随后可以作为车内模型的'老师'。你可以将其蒸馏(distill)下来,当然,你仍然需要通过周密的设计确保车载系统满足所有安全约束和延迟要求等。但这个基础模型成为知识的来源,你可以随时向它询问,用于挖掘数据和理解数据。"
这种方法对于自动驾驶系统的扩展至关重要:"现实是,我们在现有市场已经有良好的泛化能力和覆盖率,但新市场,特别是与现有市场差异较大或传感器组合不同的市场,会挑战你的能力。如果你拥有这种基础模型能力,你可以比今天的过程更快地适应新市场。"
传统上,进入新市场需要探索、收集数据、标注数据、理解差异并确保安全。虽然基础模型不会完全消除这一过程,但可以显著加速它,使Waymo能够更快地扩展到更多城市。
六、预测未来:传感器值预测与驾驶决策的新方法
在讨论自动驾驶系统的训练方法时,Drago提出了一个创新概念:"预测未来传感器值"。由于这个概念相对抽象,让我们更深入地解析它的含义和在自动驾驶中的应用。
1、什么是"预测未来传感器值"?
简单来说,"预测未来传感器值"是指AI系统尝试预测在未来几秒或更长时间内,车辆的各种传感器(如摄像头、激光雷达、雷达)将会捕捉到的数据。这不同于仅预测车辆应该如何行驶,而是预测整个环境将如何演变,包括其他车辆的移动、行人的行为,甚至是光线、阴影和天气条件在传感器中的表现。
Drago解释道:"在我们的EMA论文中,视觉语言模型可以预测你面前的道路图、看到的3D边界框,但最有趣的功能可能是预测你可能遵循的驾驶轨迹。"
这里的"驾驶轨迹"是指车辆在未来几秒内可能采取的行驶路径,包括速度、方向和位置的变化。系统会生成多个可能的轨迹,其中起始部分可以直接转化为实际的控制命令(如转向、加速或制动),而后续部分则更具推测性,显示车辆可能的长期行为。
2、传统方法与预测传感器值的区别
传统的自动驾驶系统通常采用以下步骤:
感知:识别和分类周围的物体(车辆、行人、交通标志等)
预测:预测这些物体将如何移动
规划:基于这些预测规划车辆的路径
控制:执行规划的路径
而"预测未来传感器值"的方法试图更直接地学习驾驶行为。Drago解释了训练这种模型的方式:"你会观察我们的驾驶员或其他人如何驾驶,记录他们在未来做了什么,然后教模型预测这些'驾驶令牌'在未来几步中的情况。"
"驾驶令牌"(driving tokens)可以理解为驾驶行为的数字化表示,包括位置、速度、加速度和转向角等信息。通过将这些连续的物理量转换为离散的"令牌",模型可以像预测文本中的下一个单词一样预测下一个驾驶动作。
2、预测传感器值的不同级别
Drago详细说明了预测的不同级别,从简单到复杂:
预测自己的驾驶轨迹:最基本的级别,模型学习在给定场景下应该如何驾驶。"这是一个信号,是关于你应该如何驾驶的最切题的信号。你观察人们如何驾驶,看到他们的令牌,并学习预测它们。"
预测周围对象的行为:"不仅预测你自己如何驾驶,我们还教模型预测我们周围其他人的运动令牌。我们有一个名为'MotionLM'的模型,它展示了如何做到这一点。你预测整个群体的联合行为。这是一个更丰富的信号——你教模型从每个例子中学习更多东西。"
这意味着系统不仅理解自己的行为,还理解其他道路使用者的行为和反应,从而能够更好地预测交通场景的演变。
预测整个传感器数据流:最复杂的级别,模型预测所有传感器在未来的完整读数。
Drago详细解释道:"这是非常高带宽、详细的变体。环境不仅因为你的驾驶路径而变化,还因为其他人对你的反应并改变了他们相对于你的行为。这也反映在传感器中。此外,你需要考虑一切如何改变外观,当你绕过物体时它们从另一侧看起来是什么样子,反射如何工作,特定光强度如何与RGB像素相关,因为你现在是在预测环境的未来,整个环境的全部细节。"
简单来说,这相当于模型在"想象"未来几秒钟内摄像头、激光雷达和雷达将看到的一切,包括所有物体的位置、外观、光影变化等。
3、优势与挑战
这种方法的主要优势是它提供了"最高带宽的预测"——它反映了环境的完整信息。如果模型能够准确预测所有传感器数据,那么它实际上已经深刻理解了驾驶环境的动态性质。
然而,Drago也指出了一个关键问题:"你是否过度了?人类在驾驶时不会思考树从另一侧看起来是什么样子,或者树枝如何相互遮挡。我不必考虑行人身上的阴影如何演变。虽然模型可以捕获大量知识,但并非所有知识都与驾驶相关。"
这指出了一个重要的权衡:预测传感器数据是非常详细的,但可能包含许多对安全驾驶决策不必要的信息。正如Drago所说:"预测人们在未来几步的行为是你能做的最少也是最相关的事情。然后随着你扩展,它变得越来越不相关。例如,你是否需要模拟天空中云的移动?这可能与一小时后是否会下雨有关,但我不确定它会对你的驾驶有所帮助。"
因此,在设计预测系统时,需要在预测的完整性和相关性之间取得平衡,确保系统关注真正对驾驶决策重要的信息,而不是浪费计算资源在无关细节上。
七、架构之辩:端到端学习与模块化系统的权衡
在自动驾驶研发社区中,关于系统架构的讨论始终是一个热点话题,尤其是端到端学习与模块化系统的比较。所谓端到端学习,是指从原始输入(如摄像头图像)直接学习到最终输出(如转向控制),而不经过明确定义的中间表示;而模块化系统则将任务分解为多个子任务(如感知、规划、控制),每个子任务由专门的模块处理
Drago提供了一个务实的视角:"我们站在实用主义一边。我们会采用效果最好的方法。端到端通常是一个被过度使用的概念。让我们明确一下端到端究竟意味着什么。"
他解释了端到端学习的不同定义:
"强定义是指,你从控制到传感器之间传递梯度,通过整个系统。在这个过程中,你可能会学习到你自己无法检查或没有语义意义的特征,这些特征是从训练过程中涌现出来的,可能有助于驾驶。"
这里的"传递梯度"是指在神经网络训练过程中,错误信号如何从输出层一直传回到输入层,以调整网络的权重。在端到端系统中,这种错误传递贯穿整个系统,而不是分别训练各个组件。
"但端到端通常是一种训练策略,与堆栈中是否有模块是正交的(即互不影响的)。只要模块连接得当,能够在它们之间传递梯度,你仍然可以有模块并进行端到端训练。"
关于实际经验,Drago分享道:"我们随着时间的推移所学到的是,你希望有尽可能少的大型组件。这简化了开发,允许你更多地扩展这些组件并对它们进行优化,而不是有一堆各自做不同事情、使用不同数据生成的小型定制模块。"
然而,关键问题在于:组件应该有多少?是否应该只有一个从传感器到控制的组件?Drago指出了纯端到端方法的挑战:
可测试性:"如何模拟和证明这个系统不会产生幻觉?你需要一个始终从传感器到控制的模拟器。在我们的领域,有很多传感器,它们不容易模拟。想象一下,在模拟器中每天驾驶超过100万英里,现在必须模拟所有可能在这些传感器中看到的东西。这项技术一直在发展,但这是个挑战。"
修改难度:"假设你训练了一个巨大的模型,现在想改变它。你能做的唯一事情就是改变数据来重新训练模型。你修复了一个问题,但可能破坏了其他东西。如果你只有一个输入输出的模型,很难快速修复某些东西。"
基于这些考虑,Drago总结道:"我认为在我们的领域内有一个合理的共识,即你需要少数几个大型组件,但关于它是否应该是一个组件,尚无共识。很多考虑来自可测试性。在我们的情况下,当我们进行完全自动驾驶时,这是首要考虑因素。你设计堆栈的方式要确保你能够测试它。"
这种平衡尤其重要,因为Waymo每周运营数十万次行程和数百万英里的驾驶,对安全性和可靠性的要求极高。
八、验证与模拟:确保自动驾驶系统安全可靠
在自动驾驶开发中,验证系统是否安全可靠是一项至关重要的任务。Drago详细讨论了Waymo的验证方法和面临的挑战。
"在我们的GTC演讲中,我也提到过有两个主要问题。一个是构建驾驶员,另一个是验证它并确保你有信心模型或驾驶员在绝大多数情况下表现良好。"
这里的"构建驾驶员"指开发自动驾驶系统本身,而"验证"则是确保这个系统在各种场景下都能安全可靠地运行。
关于验证的复杂性,Drago解释道:"车辆驾驶的环境包含各种多样性——不同的季节、不同的运营领域、各种人类行为(有些很少见)。所有这些最好在模拟器中进行测试,这是大规模测试的好工具。但问题是,如何构建这个模拟器?"
传统上,模拟环境主要依赖计算机图形学方法:"大约10年前当我开始时,模拟的最先进技术是计算机图形学方法。你收集大量资产——房屋、树木等,然后当你绘制场景时,你了解这些资产在哪里、它们的外观,然后用这些资产替换实景。"
然而,这种方法存在"模拟到现实"(sim-to-real)的问题,即模型对图形版本的反应可能与对现实世界版本的反应不同。"这是因为计算机图形学是一种近似,你需要正确设置大量参数——太阳应该是什么样子、环境的扩散方面是什么、是否有雾等。你需要设置大量旋钮,这在计算机图形学环境中非常困难。"
此外,还有另一个挑战:如何确保你能够准确重建你驾驶过的任何环境?是否有所有需要的资产?如果放置不同的资产,或者设置不同的条件,是否会产生差距?
Waymo正在探索使用机器学习来改进模拟器:
"可扩展模拟器的梦想是能够直接从你自己的传感器重建场景。我们有足够的传感器——相机和3D传感器,你应该能够在很大程度上直接从你驾驶过的内容构建模拟器。"
实际上,这意味着从实际收集的传感器数据创建虚拟环境,而不是使用手动创建的3D模型。这样可以确保模拟环境与真实世界更加接近。
Drago解释了这一愿景:"任何我用车驾驶过的情况,我都可以从中构建一个模拟环境。我可能需要用适当的交通来填充它,这就是生成式AI的用途。我可能需要让它随着我做的事情而演变,因为我的决定影响他人的决定。他们的反应会不同,我需要正确地建模这一点,否则就不会有现实的结果。"
在这方面,Waymo正在研究多种技术:
3D高斯溅射(Gaussian splats)和神经辐射场(NERF):这些是用于重建环境的技术,可以从多角度拍摄的图像中重建3D场景。
扩散模型:这是一种生成模型,可用于创建新的环境部分或模拟代理行为。与3D重建技术不同,扩散模型可以生成全新的内容,而不仅仅是重建已有的内容。
Drago总结道:"可以想象,如果你有一个模型可以预测传感器的未来值,你可以解构它在数据中的理解,这可以成为模拟器的基础。这非常令人兴奋,与当今的时代相符。我认为这是这类模型的时代。"
九、研究前沿:Waymo的2025年研究挑战
为了推动自动驾驶技术的边界,Waymo定期向更广泛的研究社区提出挑战。这些挑战基于Waymo认为重要且有进步空间的技术问题,鼓励研究人员提出创新解决方案。
Drago分享了2025年即将推出的研究挑战:
仅依靠相机输入的端到端驾驶:"我们分享了一些Waymo遇到的非常有趣的场景,我们想看看人们如何利用这些大型模型,让它们在相当罕见的条件下泛化。" 这个挑战考验的是AI模型在仅使用相机数据(而非激光雷达或雷达)的情况下,如何实现端到端的自动驾驶。特别是在罕见或复杂的驾驶场景中,模型是否能够准确理解环境并做出安全决策。
模拟代理(agents)挑战:"我们是唯一运行这种挑战的公司。这是一个非常有趣的问题,你要构建填充模拟器的代理模型,并有验证它们是否是好模型的方法。" 在模拟环境中,除了自动驾驶车辆外,还需要模拟其他道路使用者(如行人、其他车辆)。这个挑战聚焦于如何创建行为逼真的虚拟代理,以便在测试中提供更真实的交通场景。
交通生成:"假设我给你一个交叉路口的路图,我希望你用现实的交通来填充它,相关的位置、速度、行为是合理的,而不是临时的。我们有方法来衡量交通场景的真实程度,我们想看看人们能做什么。" 这个挑战关注如何生成真实的交通流,使模拟测试更接近实际驾驶环境。参赛者需要创建算法,根据道路布局生成合理的交通模式,包括车辆位置、速度和行为。
交互建模:"这是我们大约四年前运行的挑战,现在我们带着改进的指标重新推出。这是一个令人兴奋的挑战,建模代理之间如何良好互动是一个有趣的问题。" 此挑战聚焦于模拟不同道路使用者之间的互动,例如车辆如何对行人做出反应,或者多辆车如何在十字路口协调。准确模拟这些交互对于测试自动驾驶系统在复杂社交场景中的表现至关重要。
这些挑战不仅推动了研究前沿,也帮助Waymo与更广泛的研究社区保持联系,从外部创新中受益。通过公开数据集和明确的问题定义,Waymo鼓励全球研究人员参与解决自动驾驶领域的关键技术挑战。
至顶AI实验室 作者:高飞的电子替身