一台搜救机器人在部分坍塌的矿井中寻找被困工人,必须在穿越危险地形的同时快速生成场景地图并确定自身位置。

研究人员近年来开始构建强大的机器学习模型,仅凭机器人车载摄像头的图像来完成这一复杂任务,但即便是最先进的模型,每次也只能处理少量图像。在分秒必争的真实灾难场景中,搜救机器人需要快速穿越大范围区域并处理数千张图像才能完成任务。

为突破这一瓶颈,麻省理工学院的研究人员融合了最新AI视觉模型与经典计算机视觉的思路,开发出一套能够处理任意数量图像的新系统。该系统可在数秒内精准生成复杂场景(如拥挤的办公室走廊)的三维地图。

这套AI驱动的系统会逐步创建并对齐场景的局部子地图,再将其拼接成完整的三维地图,同时实时估算机器人的位置。

与许多其他方案不同,该技术无需校准摄像头,也不需要专家对复杂系统进行调参。其方案的简洁性,加上三维重建的速度与质量,使其更易于在实际应用中推广。

除辅助搜救机器人导航外,该方法还可用于为VR头显等可穿戴设备开发扩展现实应用,或帮助工业机器人在仓库中快速定位和搬运货物。

"要让机器人完成日益复杂的任务,它们需要对周围世界有更复杂的地图表示。但与此同时,我们也不希望在实践中增加部署这些地图的难度。我们已经证明,使用一个开箱即用的工具,在数秒内生成精准的三维重建是完全可行的。"麻省理工学院博士生、该论文第一作者多米尼克·马吉奥说道。

论文合著者还包括博士后林炯泰,以及通讯作者卢卡·卡洛内——他是麻省理工学院航空航天系副教授、信息与决策系统实验室(LIDS)主要研究员,以及麻省理工学院SPARK实验室主任。该研究将在神经信息处理系统大会上发表。

寻找解决方案

多年来,研究人员一直在攻克机器人导航的核心难题——即时定位与地图构建(SLAM)。在SLAM任务中,机器人需要在重建环境地图的同时确定自身在空间中的位置。

传统优化方法在复杂场景中往往表现不佳,或需要预先校准机器人的车载摄像头。为规避这些问题,研究人员转而训练机器学习模型从数据中学习这一任务。

尽管实现更为简便,但即使是最好的模型每次也只能处理约60张摄像头图像,这使其难以胜任机器人需要快速穿越多变环境并处理数千张图像的应用场景。

为解决这一问题,麻省理工学院的研究人员设计了一套系统,将场景分解为较小的子地图,而非一次性生成整体地图,再将这些子地图"粘合"成一个完整的三维重建结果。模型每次仍只处理少量图像,但通过拼接子地图,系统能够更快速地重建更大的场景。

"这看起来是个很简单的方案,但当我第一次尝试时,发现效果并不理想,这让我很惊讶。"马吉奥说。

为寻找原因,他深入研究了上世纪八九十年代的计算机视觉论文。通过分析,马吉奥意识到,机器学习模型在处理图像时引入的误差,使子地图的对齐变得更加复杂。

传统方法通过旋转和平移来对齐子地图,直到它们吻合为止。但新模型可能会在子地图中引入一定的模糊性,使对齐更加困难。例如,房间一侧的三维子地图中,墙壁可能略有弯曲或拉伸。仅靠旋转和平移这些变形的子地图来对齐,并不奏效。

"我们需要确保所有子地图以一致的方式变形,这样才能将它们彼此对齐。"卡洛内解释道。

更灵活的方法

研究人员借鉴经典计算机视觉的思路,开发出一种更灵活的数学技术,能够表示这些子地图中的所有形变。通过对每个子地图施加数学变换,这种更灵活的方法能够以解决模糊性的方式完成对齐。

系统根据输入图像,输出场景的三维重建结果以及摄像头位置估计,机器人可据此在空间中定位自身。

"一旦多米尼克有了融合这两个世界——基于学习的方法与传统优化方法——的直觉,实现起来就相当顺畅了。"卡洛内说,"能想出这么有效又简洁的方案,在很多应用场景中都大有潜力。"

该系统在重建速度和精度上均优于其他方法,且无需特殊摄像头或额外的数据处理工具。研究人员仅用手机拍摄的短视频,就实现了对麻省理工学院礼拜堂内部等复杂场景的近实时三维重建。

这些三维重建的平均误差不足5厘米。

未来,研究人员希望进一步提升该方法在特别复杂场景中的可靠性,并推动其在真实机器人上的落地应用。

"深厚的传统几何学功底是有回报的。如果你真正理解模型内部的运作机制,就能获得更好的结果,并让系统具备更强的可扩展性。"卡洛内说。

本研究得到美国国家科学基金会、美国海军研究办公室及韩国国家研究基金会的部分资助。卡洛内目前正在休假,担任亚马逊学者,本研究在其加入亚马逊之前完成。

Q&A

Q1:麻省理工学院的新机器人地图系统是如何处理大型场景的?

A:该系统将大型场景分解为多个较小的子地图,每次只处理少量图像,再通过数学变换将子地图对齐拼接成完整的三维地图。这种方式突破了现有模型每次只能处理约60张图像的限制,使机器人能够快速重建大范围场景。

Q2:子地图对齐为什么困难,麻省理工学院是如何解决的?

A:机器学习模型在处理图像时会引入形变,导致子地图出现墙壁弯曲或拉伸等问题,简单的旋转平移无法对齐。研究人员借鉴经典计算机视觉方法,开发了一种能够表示并统一处理所有形变的数学技术,从而实现了准确对齐。

Q3:这套三维重建系统的精度和速度表现如何?

A:系统可在数秒内生成复杂场景的三维地图,平均误差不足5厘米。研究人员仅用手机拍摄的短视频,就实现了对麻省理工学院礼拜堂内部的近实时三维重建,且无需校准摄像头或额外工具。

MIT