生成式AI与机器人技术的融合,正让我们距离"开口造物"的未来越来越近。麻省理工学院(MIT)的研究人员开发了一套"语音转现实"系统——一种由AI驱动的工作流程,用户只需向机械臂发出语音指令,便能在短短五分钟内将家具等实物"说"出来。

系统工作原理

在这套系统中,固定于桌面的机械臂能够接收人类的语音输入,例如"我想要一把简单的凳子",随后利用模块化组件将物体组装成形。迄今为止,研究团队已用该系统制作出凳子、书架、椅子、小桌子,乃至狗狗雕像等装饰品。

"我们将自然语言处理、3D生成式AI与机器人组装整合在了一起,"MIT研究生、晨兴设计学院(MAD)研究员Alexander Htet Kyaw表示,"这些都是快速发展的研究领域,此前从未以这种方式被结合起来,让人仅凭一句简单的语音指令就能制造出实体物品。"

从课堂作业到系统研发

这一构想源于Kyaw在建筑学与电气工程及计算机科学双学院攻读研究生期间,选修了Neil Gershenfeld教授开设的课程"如何制造几乎任何东西",并在课上搭建了这套"语音转现实"系统的原型。此后,他继续在由Gershenfeld主持的MIT比特与原子中心(CBA)推进该项目,并与机械工程系研究生Se Hwan Jeon及CBA研究生Miana Smith展开合作。

技术流程解析

该系统的工作流程分为以下几个阶段:首先,语音识别模块将用户的请求输入大语言模型进行处理;随后,3D生成式AI生成物体的数字网格模型;接着,体素化算法将3D网格分解为可组装的模块单元。

此后,几何处理模块会对AI生成的组装方案进行调整,以适应现实世界中的制造与物理约束,例如组件数量、悬挑结构以及几何体的连接方式。最终,系统生成可行的组装序列,并为机械臂自动规划路径,从而依据用户的语音指令完成实体物品的组装。

该系统充分利用自然语言交互,使不具备3D建模或机器人编程专业知识的普通用户也能参与设计与制造。此外,与动辄耗时数小时乃至数天的3D打印不同,该系统可在数分钟内完成构建。

"这个项目是人类、AI与机器人之间的接口,共同创造我们周围的世界,"Kyaw说,"想象一下,你说'我想要一把椅子',五分钟内一把真实的椅子就出现在你面前。"

未来规划与可持续性

研究团队已计划近期对系统进行改进,通过将模块间的磁性连接升级为更牢固的连接方式,以提升家具的承重能力。

"我们还开发了将体素结构转化为可行组装序列的流程,适用于小型分布式移动机器人,这有助于将该技术扩展至任意尺寸的结构,"Smith表示。

使用模块化组件的核心理念在于减少物品制造过程中的浪费——通过拆解并重新组装,可将现有物品转变为全新用途,例如在不再需要沙发时,将其改造为一张床。

由于Kyaw此前还有利用手势识别与增强现实技术与机器人交互的经验,他目前正致力于将语音控制与手势控制共同融入"语音转现实"系统中。

受《星际迷航》中复制机以及动画电影《超能陆战队》中机器人形象的启发,Kyaw阐述了他的愿景:"我希望让更多人能够以快捷、便利、可持续的方式制造实体物品。我正在努力迈向一个未来——在那里,物质的本质真正由你掌控,现实可以按需生成。"

研究团队已将论文《语音转现实:基于自然语言、3D生成式AI与离散机器人组装的按需生产》提交至美国计算机协会(ACM)计算制造研讨会(SCF '25),并于11月21日在MIT举办的会议上正式发表。

Q&A

Q1:"语音转现实"系统是如何将语音指令转化为实体物品的?

A:系统首先通过语音识别将用户的请求输入大语言模型,接着由3D生成式AI生成物体的数字网格模型,再经体素化算法将网格分解为可组装的模块单元。随后,几何处理模块对组装方案进行优化,以适应现实中的物理约束,最终系统自动规划机械臂的路径,完成实体物品的组装,全程最快仅需五分钟。

Q2:"语音转现实"系统与3D打印相比有什么优势?

A:最大的优势在于速度和可持续性。3D打印通常需要数小时乃至数天,而该系统可在数分钟内完成制造。此外,系统采用模块化组件,物品用完后可拆解并重新组装成其他物品,大幅减少材料浪费,例如将一张沙发改造成一张床。

Q3:"语音转现实"系统目前能制造哪些物品?有没有局限性?

A:目前该系统已成功制造出凳子、书架、椅子、小桌子以及狗狗雕像等装饰品。主要局限在于现阶段模块之间采用磁性连接,承重能力有限。研究团队计划将其升级为更牢固的连接方式,以提升家具的实用性和稳定性。

MIT