工程师在设计飞机或汽车零部件等产品时,往往借助视觉语言模型生成新方案,再通过计算机辅助设计(CAD)软件构建3D模型,进而开展虚拟碰撞或耐久性测试。
麻省理工学院(MIT)联合其他机构的研究人员,近日开发出一套新系统,能够训练视觉语言模型将2D设计图自动转换为CAD程序,其准确性和实用性远超现有方法,同时所需计算量仅为后者的一小部分。
这一技术的突破,有望显著提升AI驱动CAD生成的性能与效率,从而加快快速原型制作流程、降低研发成本,并帮助工程师发现那些容易被忽视的优化设计方案。
该系统在模型尝试将2D图像转换为CAD程序的过程中,实时生成新的训练数据。它能够识别并修正模型的错误,同时将这些失败案例与成功结果一并纳入数据集,再利用这些数据教会模型如何修正特定错误,从而解决它原本难以独立攻克的难题。
"我们希望工程师只需将表现不佳的CAD模型交给我们的框架,设定好算力预算,剩下的交给系统来完成——把模型自身的错误转化为更优质的训练数据。"本文第一作者、麻省理工学院设计计算与数字工程(DeCoDE)实验室研究附属成员、红帽公司AI创新团队首席研究科学家Giorgio Giannone表示。
论文的其他参与者包括:麻省理工学院机械工程系研究生Anna Claire Doris、MIT博士后Amin Heyrani Nobari、红帽公司的Kai Xu,以及共同通讯作者——IBM核心AI总监、麻省理工学院-IBM计算研究实验室首席研究员Akash Srivastava,以及麻省理工学院机械工程系副教授、DeCoDE实验室负责人、MIT-IBM计算研究实验室首席研究员Faez Ahmed。该研究近期已在国际机器学习大会(ICML)上正式发表。
"我们身边几乎所有的实体产品——从飞机到家电——都是从CAD模型起步的。业界迫切希望AI能够加速设计创作,但现有模型生成的形状往往过于简单,难以满足实际需求。让我感到振奋的是,这项研究赋予了众多图像转CAD代码模型一种自我提升的能力——从自身错误中学习,而无需等待更多人工标注数据。这让值得信赖的AI设计工具离日常工程实践又近了一步。"Ahmed说道。
模型感知数据
研究团队致力于构建面向CAD生成任务的视觉语言模型(VLM)。这类模型接收2D图像和描述性文本作为输入,输出可在CAD软件中运行的Python代码,进而生成物理对象的3D模型。
在研究现有VLM在此任务中的部署挑战后,团队发现制约其能力的主要瓶颈在于:缺乏多样化、高质量的CAD数据集用于训练。
为此,他们通过数据增强的方式创建新数据,教会模型如何执行CAD生成任务。传统数据增强通常通过随机调整已有数据(如图像中物体的颜色、大小和形状)来生成更多样本。
MIT研究人员则另辟蹊径,构建了一套名为GIFT(Geometric Inference Feedback Tuning,几何推理反馈调优)的数据增强系统,专门针对特定VLM在特定任务上的表现生成改进数据。
GIFT通过测试模型来理解其优势与不足,再据此生成有针对性的数据,帮助模型攻克在CAD生成任务中难以解决的问题。
"我们希望实现由模型自身驱动的数据增强。"Giannone表示。
从错误中学习
为实现这一目标,GIFT让模型并行多次尝试生成解决某一CAD生成问题的代码,通过检验这些答案的正确性来评估模型的解题能力。
"对于模型而言,生成几乎正确的CAD查询代码并不困难,但生成完全正确且可执行的代码,对标准视觉语言模型来说则是相当大的挑战。"Giannone说。
对于接近正确的输出,GIFT会将其调整为成功的解决方案,并将这些"险些成功"的案例与正确结果一起保存到新数据集中,用以训练模型克服常见错误。
"如果对模型采样10次,它对同一个问题给出了10个正确答案,那它就没有太多可以学的。我们真正关注的是中间状态——比如模型只有50%的概率能解决某个问题。"他解释道。
正是这些"中间状态",使GIFT能够生成既感知模型能力、又感知任务特性的数据增强样本。此外,通过纳入同一问题的多个正确解法,新数据还能拓宽模型在CAD代码生成方面的通用知识。
整个过程完全自动化,无需人工干预来纠正模型错误。
GIFT从预训练VLM出发,采用推理时扩展(inference-time scaling)技术生成数据增强样本。该技术允许已完成训练的静态模型在无需重新训练整个模型的前提下,以较低的计算成本生成更高质量的输出结果。
借助推理时扩展,用户可以灵活指定GIFT所使用的计算量,从而根据时间和预算灵活调整。
实验结果显示,GIFT在性能上明显优于多个竞争方案——在仅使用约20%计算量的情况下,生成的CAD程序准确性更高,所生成的CAD模型与真实模型的形状吻合度也更好。
"在GIFT中,我们首先关注几何问题,因为在工程领域,如果3D形状的几何结构不正确,其他一切都无从谈起。当然,还有许多其他方面有待考虑。"Giannone表示。
研究团队未来计划拓展GIFT的功能,使其能够教会模型生成在性能和可制造性方面更为优化的CAD程序,同时也将探索将该系统应用于更大规模的模型和更多样化的CAD生成任务。
本研究部分由MIT-IBM计算研究实验室资助。
Q&A
Q1:GIFT系统是什么?它能解决CAD设计中的哪些问题?
A:GIFT(Geometric Inference Feedback Tuning,几何推理反馈调优)是由麻省理工学院等机构研究人员开发的一套数据增强系统。它的核心能力在于让视觉语言模型自动将2D设计图转换为可执行的CAD代码,同时通过分析模型自身的失败案例生成新的训练数据,帮助模型从错误中学习。该系统在仅使用约20%计算量的情况下,生成的CAD程序准确性显著优于现有方案。
Q2:GIFT与传统数据增强方法有什么区别?
A:传统数据增强通常通过随机调整图像的颜色、大小和形状等方式生成更多样本,这些新数据并不针对具体模型的薄弱环节。而GIFT会主动测试模型的能力,识别模型在哪些问题上成功率居中(既非总对也非总错),并专门针对这些"中间状态"生成数据,实现模型感知和任务感知的双重定向增强,无需人工介入。
Q3:GIFT采用的推理时扩展技术有什么优势?
A:推理时扩展允许已完成训练的静态模型在不重新训练整个模型的情况下提升输出质量,大幅降低了计算成本。用户可以根据自身的时间和预算灵活设定GIFT所使用的计算量,从而在资源有限的情况下也能获得明显的性能提升,适合工程团队在实际开发中灵活部署。
