自动驾驶汽车长期以来被视为解放驾驶者双手的未来出行方式,但许多人对"完全交由机器驾驶"仍存有顾虑。如今,一项新研究有望让乘客像对待人类司机一样,通过日常语言对自动驾驶车辆发出指令。
自动驾驶汽车在行驶过程中需要精细平衡速度、加速度、转向平顺性等多项参数,以保证乘坐体验。然而,乘客的驾驶偏好往往因赶时间、晕车或路况繁忙等情况而动态变化。
自动驾驶系统中有一个关键软件模块称为"运动规划器",负责在交通环境中选择安全高效的行驶路径。该模块通常由工程师在车辆上路前预先调校完毕,乘客几乎没有机会实时调整车辆的驾驶风格。如今,荷兰代尔夫特理工大学(TU Delft)的研究人员开发出一套新系统,利用大语言模型将"我赶时间,请开快点"等自然语言指令转化为对自动驾驶控制系统的参数调整。相关预印本已发布于arXiv平台,研究团队将于今年9月在IEEE智能交通系统大会上正式发表该成果。
该系统并不直接接管车辆的驾驶决策,而是通过调整一套具备安全感知能力的运动规划算法的参数,确保车辆行为始终处于安全边界之内。同时,系统在执行任何调整前,会以通俗语言向乘客说明即将进行的改动,并请乘客确认后再实施,从而保持人在回路中的参与感。仿真测试结果显示,该系统能够根据自然语言指令,有效调整车辆的速度与行驶平顺性。
该研究的第一作者、TU Delft博士后研究员Diego Martinez-Baselga表示:"运动规划问题不仅仅是在避免碰撞的前提下抵达目的地,更重要的是如何抵达。我们的初衷是让终端用户仅通过与汽车对话,就能轻松调整自动驾驶的行驶风格。"
此前已有研究探索利用大语言模型和视觉-语言模型(VLM)直接指导自动驾驶决策,但该团队有意将研究目标聚焦于驾驶风格的调整。Martinez-Baselga指出,将大语言模型或VLM直接用于车辆控制面临诸多挑战:一方面响应速度相对较慢,难以满足驾驶场景对实时决策的高要求;另一方面,这类模型无法像确定性运动规划器那样提供可量化的性能保证。
因此,研究团队选择借助大语言模型的语言理解与推理能力,将模糊的人类偏好转化为运动规划器可直接使用的参数。系统的核心是研究团队此前开发的一种模型预测路径积分控制器,该控制器可生成多条候选路径,并从速度、转向角、碰撞概率等多个维度对其进行评估,最终综合各项评分较优的轨迹,规划出最优行驶路径。
研究团队将该控制器与OpenAI的GPT-4o-mini模型相结合,由大语言模型解析乘客的自然语言建议,并据此调整控制器的路径选择权重。模型的输入包括乘客的指令,以及对当前行驶场景的自然语言描述——后者在本次研究中由研究人员手动撰写,但未来可直接由车辆感知系统自动生成。
大语言模型并不直接修改控制器的参数值,而是根据乘客指令对各项评估标准的相对重要性进行打分,再以此为依据在研究人员预设的安全基线两侧对各项参数进行上下调整。例如,当乘客表示感到头晕时,大语言模型会提升与平稳转向和柔和加速相关的参数权重,引导车辆采取更加平缓的行驶方式。
在执行任何调整之前,模型会先向乘客提供一段自然语言描述,说明其计划实施的具体改动,待乘客确认后方才执行。该系统还支持持续交互,若车辆的实际行为未达到乘客预期,或乘客的偏好发生变化,可随时提出进一步调整请求。
Martinez-Baselga表示,这种"人在回路"的设计使乘客能够及时发现模型误解指令的情况,同时也能应对"开快一点"等主观性表达的固有歧义,或模型未能准确描述其计划改动的情形。遇到这些情况,乘客只需像坐出租车或朋友的车一样,继续补充说明即可。
研究团队在主流自动驾驶仿真平台nuPlan中对系统进行了测试,场景设定为并入繁忙高速公路。在八条不同指令的测试中,系统均能按照用户意图调整控制器参数——要求乘坐更舒适的指令会提升行驶平顺性,而表达紧迫感的指令则会相应提高车速。
利用大语言模型调整自动驾驶运动规划器并非首创。瑞士苏黎世联邦理工学院(ETH Zurich)博士生Nicolas Baumann去年发表的研究中,同样采用大语言模型调整模型赛车控制器的参数,不仅支持驾驶风格调整,还能响应"倒车"或"保持特定速度"等具体指令。
Baumann认为,将大语言模型与主控制器分离的最大优势在于安全性:即使模型产生幻觉,也不会引发危险行为。"你获得了语言交互的能力,同时又能保证行为始终在传统控制器的约束范围内,安全性因此得到了内置保障。"他同时指出,设定这些约束需要大量工程投入。
慕尼黑工业大学信息物理系统教授Matthias Althoff则认为,若要实现可证明的安全性,还需更进一步。他的团队构建了一套系统,由大语言模型提出驾驶决策建议,再通过数学方法对照交通规则和其他道路参与者的行为预测进行验证,确认安全后方才执行——而代尔夫特的研究尚未提供这一层面的保障。"与所有大语言模型一样,其输出结果并不能保证完全正确,"Althoff说,"正因如此,我们的研究会对大语言模型的决策结果进行安全性兜底。"
Q&A
Q1:TU Delft研究团队开发的自动驾驶语言交互系统是如何工作的?
A:该系统将大语言模型与运动规划控制器相结合。乘客用自然语言表达偏好(如"我赶时间"),大语言模型将其解析后,调整控制器各评估标准的权重,从而在安全边界内改变车辆的速度或平顺性。执行前系统会向乘客说明改动内容并请求确认,乘客可随时进一步调整。
Q2:为什么不直接用大语言模型控制自动驾驶汽车,而要单独调整运动规划器的参数?
A:直接用大语言模型控制车辆存在两大问题:一是响应速度较慢,难以满足驾驶场景的实时决策需求;二是无法像确定性运动规划器那样提供可量化的安全性保证。将大语言模型与控制器分离,即使模型出现幻觉,也不会突破安全约束,从而保障行驶安全。
Q3:GPT-4o-mini在该自动驾驶系统中扮演什么角色?
A:GPT-4o-mini负责理解乘客的自然语言指令,并结合当前行驶场景描述,对运动规划控制器的各项评估标准(如速度、转向平顺性、碰撞概率)的相对重要性进行打分,再将打分结果转化为对控制器参数的调整,使车辆行驶风格符合乘客需求,同时保持在预设安全基线范围内。
