谷歌推出了最新一代时间序列基础模型 TimesFM-3,该模型专为多变量时间序列预测而生,能够在单次前向传播中高精度预测多个相互关联的时间序列,在主流基准测试中显著优于其他预测模型。

自 2024 年 TimesFM 首次亮相以来,时间序列基础模型已在零售、金融、可观测性、制造业、医疗健康及自然科学等多个领域的实际预测任务中得到广泛应用。

此前版本的局限与突破

TimesFM-2.5(2025 年 9 月发布)之前,该系列模型严格限定于单变量预测,即仅根据单条时间序列自身的历史数据进行预测。然而,现实中的预测问题往往天然具有多变量特性:多条时间序列与外部辅助特征共同影响未来的预测结果。

以零售连锁店的冰淇淋销量预测为例,仅凭历史销量数据往往难以得出准确预测。理想的预测模型还应综合考量关联商品的销量(如蛋筒、糖浆)、历史客流量,以及天气预报、促销活动、节假日等已知未来事件。

TimesFM-3 的核心能力

TimesFM-3 拥有 3.3 亿参数,基于涵盖逾 1 万亿个时间点的真实与合成时间序列语料库进行预训练,在继承前代高效性与零样本泛化能力的基础上,以零样本方式为复杂多变量场景提供强力支持。模型可同时预测多条协同演化的时间序列,无需针对特定任务进行微调,即可捕捉序列间的依存关系、提升整体预测精度。其原生支持能力包括:目标序列预测、历史协变量利用,以及历史与未来协变量的联合建模。

架构设计

TimesFM-3 沿用经过验证的纯解码器 Transformer 架构。与前代版本一致,模型将时间序列数据高效打包为每段 32 个时间步的 patch,并对各序列进行归一化处理,以应对量纲差异显著的时间序列。

针对目标序列和历史协变量序列,直接由单个 patch 构建 Token。而对于历史-未来协变量,TimesFM-3 采用独特的"前瞻"策略:将当前 patch 与未来 patch 拼接为一个 Token,使模型能够感知已知的未来信号。

patch 完成 Token 化后,经过输入残差模块,进入二维网格结构的主 Transformer 层。该结构中,时间维度注意力与跨序列注意力交替运行,无缝融合时间模式与序列间关系。

单次前向传播完成全视界预测

前代 TimesFM 逐 patch 生成预测,存在延迟高、误差累积和计算成本大等问题。TimesFM-3 采用连续 Patch 掩码策略,在单次前向传播中完成整个预测视界的生成。模型在已观测上下文旁附加掩码占位 Token,目标序列和历史协变量在预测视界内被掩码,而历史-未来协变量(如节假日、已排期事件等已知未来信号)保持可见。通过交替注意力层,模型同步填充所有被掩码的视界 patch,无需迭代循环。针对每条目标序列的每个预测步长,模型输出 9 个分位数(第 10 至第 90 百分位),提供完整的概率性预测。

应用示例:促销计划下的冰淇淋销量预测

以下以冰淇淋销量预测为例说明多变量模式的优势。假设正在制定下月促销计划,并希望提前预估销量。标准单变量模型仅依据历史销量推算周期性规律,对未来特定日期的促销活动一无所知。而 TimesFM-3 的多变量模式则截然不同:将计划促销时间表作为历史-未来协变量输入后,模型从历史数据中学习促销与销量提升之间的关系,并将这一知识应用于未来有促销活动的日期,从而预测出每个促销日约 20% 的销量增幅,最终生成更贴近实际的月度预测。

基准测试表现

研究团队在三项权威公开预测基准——Gift-Eval、FEV-Bench 和 Time——上对 TimesFM-3 进行了全面评估。在所有三项基准的点预测与概率预测指标上,TimesFM-3 在所有预训练基础模型中均位列第一,超越了 Chronos-2、Toto 2.0 系列等支持多变量的近期基础模型,以及前代模型 TimesFM-2.5。

值得关注的是,即便在不使用任何协变量或跨序列信息的单变量模式下,TimesFM-3 的表现已与其他竞争模型持平或更优;切换至完整的多变量模式后,性能进一步跃升,在所有基准的点预测与概率预测平均排名中均摘得榜首。

获取方式

TimesFM-3 现已在 GitHub 和 Hugging Face 上正式发布,BigQuery 集成功能将于近期上线。在此之前,用户可立即通过 BigQuery 中的 AI.FORECAST 命令体验 TimesFM-2.5 的单变量预测能力,无需任何机器学习专业知识。

本项目由 Yichen Zhou、Petros Mol、Abhimanyu Das 和 Samet Oymak 联合完成。

Q&A

Q1:TimesFM-3 和之前的 TimesFM 版本有什么区别?

A:最核心的区别是多变量支持。TimesFM-2.5 及更早版本只能做单变量预测,即只能根据某一条时间序列自身的历史数据来预测未来。TimesFM-3 则原生支持多变量预测,可以同时处理多条相关时间序列以及已知的未来信息(如促销计划、节假日),从而捕捉序列间的关联关系,显著提升预测精度。此外,TimesFM-3 采用单次前向传播完成全视界预测,避免了逐步生成带来的误差累积问题。

Q2:TimesFM-3 的零样本预测是什么意思?

A:零样本预测是指模型在没有针对特定任务或数据集进行额外训练(微调)的情况下,直接对新的时间序列数据做出预测。TimesFM-3 基于超过 1 万亿个时间点的大规模语料库预训练,具备强大的泛化能力,用户无需为自己的业务场景专门训练模型,即可开箱即用地获得高质量预测结果。

Q3:TimesFM-3 怎么处理促销、节假日这类已知的未来事件?

A:TimesFM-3 通过"历史-未来协变量"机制来处理这类信息。用户可以将已知的未来事件(如促销日期、节假日安排)作为协变量输入模型。模型采用"前瞻"策略,在构建 Token 时将当前时间段与未来已知信号拼接在一起,使模型在预测时能够感知并利用这些未来信息,从而在对应时间点上给出更准确的预测,例如自动预测促销日的销量提升幅度。

Google