人工智能在理解文本方面已取得令人瞩目的进展。然而,若要构建真正理解物理世界的AI模型,仅凭文字显然不够——模型还需要捕捉建成环境中动态的、真实的功能规律。每个地点都有两种截然不同的特征:其纸面上的身份信息,以及它实际的功能节律。

传统大语言模型在构建地点表征时(业内通常将地点称为"兴趣点",即POI,包括商业场所、公园、地标等),往往高度依赖静态元数据,擅长解析地址、业务类别和文字描述。尽管Gemini等顶尖大语言模型在处理文本数据方面能力出众,但如果能将城市环境中真实的功能动态纳入其中,其地理空间表征将得到显著增强。将语义标签与移动数据相结合,可以让模型有效捕捉城市中各兴趣点独特的时间活动节律。

为验证这一互补能力,我们提出了移动嵌入兴趣点(ME-POIs)框架——一种改进大语言模型所生成的基于文本的地点表征的新型框架。ME-POIs利用公开基准数据集,融入聚合后的匿名化移动模式,包括到达时间、停留时长和周边移动规律。它不再将地点视为一组静止的文字描述,而是采用自监督方法,将文字描述与来自公开基准的大规模匿名移动模式(捕捉全天环境中聚合的空间活动足迹)相融合,从而构建出一种数值向量表征(即数学意义上的"签名",专业术语称为"嵌入"),同时编码地点的身份特征和动态功能。将ME-POIs与先进文本模型结合后,在预测访问意图方面取得最高81.9%的相对提升,价格等级分类准确率提高75.1%,对未见过地点的繁忙程度估计精度也提升了24.7%。

通过为AI模型预先提供经过丰富的地点表征,ME-POIs框架使模型能够更轻松地对多种属性(如营业时间、目标价格区间和当前经营状态)做出准确推断,无需每次都从头计算这些属性。

要构建对地点有深度理解的模型,必须区分地点的身份(名称与类别)和功能(聚合访问足迹)两个维度。在以往的地理空间AI研究中,移动模式几乎只被用于预测用户下一个将要访问的兴趣点。而ME-POIs框架将移动数据从输出预测任务转变为定义地点本身的输入特征。

那么,如何将原始地理坐标点转化为简洁且数值化的数学签名(即嵌入)?我们通过三步流水线来实现:访问对齐、空间多尺度访问传播,以及文本与移动的协同融合。

ME-POIs框架将静态文本元数据(兴趣点身份)与来自公开基准数据集的动态访问模式(兴趣点功能)相结合,从而创建地点的综合表征。

该模型将对特定兴趣点的聚合访问视为基础数据点,分析到达时间窗口、离开趋势和典型停留时长。时间编码器并不进行简单平均,而是将时间序列映射到密集向量空间,建立一个"功能质心"——一种独特的多维签名,能够跨越一年周期和一周中的不同天,映射出与该地点相关的聚合匿名移动模式。

地理空间数据科学中存在一个长期挑战——"长尾问题"。知名地标、大型购物中心和热门连锁门店能产生大量访问数据,而绝大多数本地小商家——街角精品店、专业维修店或新开咖啡馆——却严重缺乏数据。过去,当模型遇到访问记录极少的地点时,往往会错误地将其活动量视为零,导致预测失准。

ME-POIs通过新颖的空间多尺度访问传播机制解决了这一问题。该架构认识到访问行为通常受区域约束——高端购物街上的一家精品店与其周边商家共享系统性的行为特征。框架在多个空间尺度(即时街道、街区和更宽泛的社区)上审视相邻地点,并将数据丰富的繁忙邻居的聚合访问模式统计性地迁移至附近数据稀缺的地点。通过从活跃区域学习区域性"节律",模型即便面对访问记录极少的小商家,也能凭借智能的地理先验知识进行有效推断。

ME-POIs框架并不抛弃文字描述,而是对其加以丰富。具体做法是:通过最大化余弦相似度,将高层语言嵌入(从Gemini等先进模型中提取的标准向量表征)与新生成的移动向量对齐,直接在语言表征之上叠加移动信号,从而形成更为全面的地点视角。

这种混合方法确保模型在保留结构性语义(例如从文字描述中得知某地销售食物)的同时,也能吸收其运营背景(例如从移动签名中得知它是一家午餐场所还是深夜餐厅)。

为评估ME-POIs是否真正实现了对物理地点的泛化、属性无关的理解,我们在两个文化各异的大型都市区——洛杉矶和休斯顿——进行了大量测试。

我们在五项不同任务上对框架进行了评估。为证明模型培养的是通用能力而非仅仅记忆本地规律,我们在已观测的地点上训练框架,再要求其对完全未见过的地点进行属性预测。

在基准对比方面,我们将ME-POIs与标准纯文本嵌入模型(如Gemini嵌入)、现有的基于轨迹的地理空间模型(如TrajGPT),以及多种混合变体进行了比较,以精确量化移动模式所带来的额外价值。

实验结果令人振奋,证实了向现有文本模型加入真实世界移动数据能够带来显著的"上下文优势"。在对未见过的测试地点进行评估时,整合ME-POIs后,各预测任务的准确率均得到大幅提升,始终优于纯文本和纯移动的基线模型。

更值得注意的是,将仅使用移动数据训练的模型与仅使用文本元数据的模型进行对比时,发现了一个令人惊讶的现象:在价格等级分类等任务中,仅移动数据模型的表现甚至超过了仅文本的大语言模型。这揭示了城市动态中一个常被忽视的深刻规律:人们在某个物理场所的集体行为,往往比用于标记该场所的正式文字描述更具说明性。

通过成功突破静态数字标签的局限,ME-POIs框架展示了一种赋能AI建模和理解物理世界的全新路径。值得强调的是,该框架专注于从聚合层面理解世界,无法对个体用户进行任何推断或个性化分析。换言之,ME-POIs框架能够提供地点或商家的整体表征,捕捉其在广泛人群和时间维度上的访问规律,但不能用于个性化推荐。其真正的价值在于:为地点创建丰富的聚合数值签名,从而在下游系统需要对这些地点做出推断时,有效降低其计算负担。

归根结底,ME-POIs为AI模型真正理解城市节律奠定了基础,也是谷歌地球AI更宏观努力的组成部分——旨在构建能够将行星级数据转化为可行情报的地理空间模型和数据集。

感谢本文的共同作者:谷歌研究院的Neha Arora,以及南加州大学(USC)的Cyrus Shahabi教授和博士生徐尚凌。

Q&A

Q1:ME-POIs框架是什么?它如何提升AI对地点的理解?

A:ME-POIs(移动嵌入兴趣点)是一种新型框架,通过将聚合的匿名化移动模式(如到达时间、停留时长、周边活动规律)与文本描述相融合,创建地点的综合数值表征。相比单纯依赖文字描述,ME-POIs能让AI模型同时理解一个地点的"静态身份"和"动态功能节律",在预测营业时间、价格区间和繁忙程度等任务上取得大幅提升。

Q2:ME-POIs框架如何解决小商家数据稀缺的问题?

A:ME-POIs采用空间多尺度访问传播机制来应对"长尾问题"。该机制认识到相邻地点往往共享区域性行为规律,因此会在街道、街区和社区等多个空间尺度上,将数据丰富的繁忙邻居的访问模式统计性地迁移至数据稀缺的小商家,使模型即便面对访问记录极少的地点,也能做出有效推断。

Q3:ME-POIs框架会不会涉及用户的个人隐私数据?

A:不会。ME-POIs完全基于聚合后的匿名化移动数据,只分析地点层面的整体访问规律,无法识别或推断任何个体用户的行为,也不支持个性化功能。其所有数据均来自公开基准数据集,隐私保护是该框架的设计前提之一。

Google