世界模型能够帮助AI预测环境在特定行动下的变化,使其在采取实际行动之前对多种方案进行比较分析。随着研究人员的目光逐渐从以语言为中心的AI转向能够理解空间、时间和物理状态变化的系统,这一领域的研究热情正在持续升温。然而,逼真的模拟并不总是可靠的,世界模型本身、规划器以及实际部署的系统,都需要经过真实环境结果的检验。

设想一个仓库机器人正在伸手去取一个从未见过的包裹。在做出动作之前,它借助一个已学习的环境模型对几种可能的行动方案进行比较。研究人员和投资者押注于这种"先预测再行动"的能力,认为它能使AI系统在工厂、车辆和基础设施领域发挥更大的作用。这类系统被称为世界模型——它代表环境的变化方式,并预测行动可能带来的影响。

什么是世界模型

目前,业界对世界模型尚无统一定义。上海人工智能实验室近期发布的一份路线图将其描述为:对环境及其状态如何随时间变化的内部表征。它通过视频、图像、传感器读数等观测数据,以及将行动与结果相关联的数据进行学习,进而预测环境对特定行动的响应方式。

世界模型试图回答一个实际问题:如果一个智能体执行某个动作,接下来最可能发生什么?它会生成多种可能的结果,供独立的规划器进行比较后再选择行动。李飞飞与World Labs提出了一套分类法,将其区分为渲染器、模拟器和规划器,分别对应:世界的样子、世界的运行方式,以及智能体应该如何行动。

需要指出的是,准确的预测并不等同于真正的因果理解。当外部条件发生变化时,模型所习得的规律可能会失效。

发展历程与研究现状

这一理念并非新生事物。2018年的《世界模型》论文,以及DeepMind的MuZero和DreamerV3,已经展示了智能体如何通过对未来的建模来学习和规划。

当前的研究热潮折射出以语言为中心的AI所存在的不足。大语言模型能够对现实的文字描述进行推理,但大多数并非主要训练于将物理行动与其结果相关联的数据。世界模型的目标是追踪空间、时间、状态变化与干预行为。世界经济论坛《2026年十大新兴技术》报告指出,更丰富的物理世界数据、更大规模的模型,以及能够预测压缩表征而非每一个视觉细节的架构,是推动这一领域发展的关键动力。

物理AI还依赖于记录行动如何影响真实环境的数据,这些数据通常来自机器人、车辆、远程操控系统等,而非公开的网络内容。斯坦福大学以人为本AI研究院(Stanford HAI)警告称,此类数据的稀缺性可能导致控制权集中于那些拥有大型运营车队或同类交互数据来源的机构。

当前的研究和投资正朝三个方向推进:提升物理预测能力、生成交互式仿真环境,以及探索大语言模型规模化路径之外的替代方案。

Meta的V-JEPA 2将预测性表征应用于机器人规划,谷歌DeepMind的Genie 3则可生成交互式环境。Yann LeCun创立的AMI Labs已融资10.3亿美元,专注于以世界模型、推理和规划为核心的技术路线。据Dealroom统计,相关领域企业在2026年迄今已合计融资32亿美元。这些资金体现的是信心,而非通用世界模型已然成熟的证明。

世界模型的概念也开始向物理环境之外延伸。近期有关社会世界模型的研究探索AI能否表征信念、意图和交互关系,从而预测社会动态;相关的社会仿真工具也开始进入商业应用。然而,对复杂现实社会行为的可靠预测,依然是一个悬而未决的挑战。

典型应用场景

机器人领域目前提供了最为翔实的公开基准数据。由于真实世界的训练成本高、周期长、有时还存在安全风险,Meta报告显示V-JEPA 2在涉及新物体和新环境的部分抓取与放置任务中达到了65%至80%的成功率,但这些仍属于有限的实验室结果。

自动驾驶为世界模型仿真测试提供了更大规模的应用场景。Waymo表示,其世界模型能够为罕见场景和改变路线的情形生成可控的摄像头及激光雷达仿真数据。与主要依赖人工规则构建的仿真器相比,学习型模型可能更易于生成和变化场景;但其价值最终取决于仿真改进能否可靠地迁移到真实道路表现。

基础设施与工业领域的应用目前仍较具探索性。世界经济论坛的报告通过一个假想港口的案例加以说明:在工作人员审批之前,该港口利用运营数据和天气数据对装载方案进行压力测试。类似的系统最终或许能帮助决策者模拟交通、能源等互联基础设施之间的相互影响。但目前这些场景仍是对可能用途的展望,而非已落地的实际部署。

近期商业价值在于降低试验的成本与风险。学习型世界模型能够使仿真环境更易于生成、变化,并随着新运营数据的不断积累持续更新。团队可以在投入资金或将人员设备暴露于风险之前,提前排除不可行的方案。

治理层面还存在一个值得关注的问题:当同一供应商既提供自主系统、又提供用于验证该系统的仿真环境时,客户和监管机构可能难以分辨真正的鲁棒性,与供应商在特定条件下刻意呈现的良好表现之间的区别。除非审查者能够理解可选方案、及时介入并在必要时推翻系统决策,否则人工监督并不能从根本上解决这一问题。

可靠性挑战

仿真误差并不总是一眼可辨。Stanford HAI描述了一种"视觉可信度陷阱":环境表面上看起来连贯合理,实则对重要物理属性的建模存在错误。

例如,一个仿真机器人在屏幕上看似成功完成了物体操控,但其质量、摩擦力或刚性实际上已被错误建模,一旦在真实世界中执行,就会失败。同样的问题也会影响评估本身:当同一个学习型环境既用于训练又用于测试时,系统可能适应了仿真器的内在假设,获得了高分,却在真实条件下依然存在安全隐患。

目前的系统在范围和持续时间上也存在局限。DeepMind表示,Genie 3仅支持有限类型的动作,且只能维持数分钟的连续交互,这制约了其在长周期规划和大规模安全测试中的应用价值。

因此,评估需要覆盖完整的链条:模型的预测是否准确、规划器是否选择了恰当的行动、完整系统在真实世界中能否安全运行。这要求将结果与真实世界进行对照,测试边缘场景,开展部署后监控,并确保独立访问性能证据的渠道畅通。对于安全关键应用,仿真中的表现应视为初步依据,而非真实世界可靠性的证明。

何时选用世界模型

世界模型并非适用于所有AI应用。预测工具、优化系统、接入可靠数据的大语言模型以及传统仿真器,往往能以更低的成本解决许多问题。

以下情形适合考虑使用世界模型:行动会实质性地改变未来状态、真实世界的试验成本高昂或存在危险、结果可与独立证据进行对照验证,且存在可用的安全回退选项。若上述条件不具备,传统仿真、预测或优化方案往往是更经济、更可靠的选择。

Q&A

Q1:世界模型和普通的大语言模型有什么区别?

A:大语言模型主要对现实的文字描述进行推理,并非专门训练于将物理行动与其结果相关联的数据。而世界模型的目标是追踪空间、时间、物理状态变化与干预行为,能够预测智能体在执行某个动作后环境会如何响应,适用于机器人、自动驾驶等需要理解物理因果关系的场景。

Q2:V-JEPA 2在机器人任务中的表现如何?

A:Meta报告显示,V-JEPA 2在部分涉及新物体和新环境的抓取与放置任务中达到了65%至80%的成功率。不过,这些结果属于有限的实验室基准测试,并非真实部署环境下的大规模验证,距离实际应用仍有差距。

Q3:世界模型在使用中有哪些主要风险?

A:主要风险包括:一是"视觉可信度陷阱",仿真环境看似真实,但对物体质量、摩擦力等物理属性的建模存在错误,导致在真实世界中失败;二是当同一供应商同时提供系统和验证仿真器时,监管方难以辨别真实鲁棒性;三是当前系统持续交互时间短、支持动作类型有限,不适合长周期规划和大规模安全测试。

World Economic Forum