谷歌于本周一发布了 TimesFM-3,这是一款拥有 3.3 亿参数的时间序列预测模型,训练数据涵盖超过一万亿个真实世界与合成数据时间点。
这款新模型目前已在 Hugging Face 平台上线,采用非商业许可协议。
大语言模型擅长预测下一个词,而对企业而言,时间序列预测模型本质上是在对数据做类似的事情。过去几年间,业界在打造更优秀的预测模型方面投入了大量精力。去年,亚马逊推出了 Chronos-2,Salesforce 推出了 Moirai 2.0,而近期 Datadog 也发布了 Toto 2.0 模型。
这些模型代表了一类相对新兴的预测模型,因为它们能够处理多重时间序列。正如谷歌研究科学家 Ayush Jain 和 Rajat Sen 在发布公告中所解释的那样,“现实世界中大多数预测问题本质上是多变量的:多个时间序列及辅助外部特征会共同影响某一时间序列的未来预测结果。”
他们解释说,过去的销售数据只能讲述部分故事。“一份好的预测还应参考相关产品的销售情况(例如冰淇淋甜筒和糖浆)、历史客流量,以及天气预报、促销活动和节假日等已知的未来事件。”
TimesFM-3 是谷歌首款原生预训练即支持处理多重时间序列、并具备零样本泛化能力的模型。这也使其能够并行预测多个相关时间序列,并纳入历史数据,例如过往的客流量信息。
在谷歌公开的基准测试中,TimesFM-3 的表现超越了上述所有模型,且往往优势明显。研究团队参考了 Salesforce 的 Gift-Eval、Amazon/AutoGluon 的 FEV-Bench 以及 Time 相关基准。
也许最令人意外的是,2025 年 9 月发布时曾处于业界领先水平的 TimesFM-2.5,如今在基准测试中已排名垫底。这足以说明这一领域的发展速度之快。
架构解析
与前代产品一样,TimesFM-3 是一个仅含解码器的 Transformer 架构,它将每个时间序列切分为包含 32 个数据点的分块,处理方式大致与语言模型处理 Token 的方式相似。
新之处在于,这些 Token 现在会流经两种交替出现的注意力层。第一种注意力层会在单个序列内部回溯时间维度,并严格保持因果性,确保模型无法提前获知其本不应知晓的数值。另一种注意力层则会在某一时间点上横向扫视所有序列,例如,某一产品线的促销活动信息便能借此为另一产品线的预测提供参考。
解码方式也发生了变化。谷歌研究人员解释称,早期版本每次只能生成一个数据块的预测结果,这不仅增加了延迟,还会在过程中累积误差。
而 TimesFM-3 则会针对整个预测时间跨度附加带遮罩的占位 Token,随后通过一次前向传播将其全部填充完成。
非商业许可协议
谷歌决定以非商业许可协议的形式发布这款新模型。这在模型开发领域正逐渐成为一种趋势。
TimesFM-2.5 此前仍采用 Apache 2.0 许可协议发布,Toto 2.0 和 Chronos-2 同样如此。
TimesFM-3 的源代码仍遵循 Apache 许可协议。不过谷歌指出,“目前,TimesFM 3.0 的预训练权重将依据单独的 timesfm-non-commercial-license-v1.0 许可协议进行分发,仅限用于非商业、非生产环境。默认预训练权重不得用于商业或生产用途。”
谷歌即将用 TimesFM-3 取代 TimesFM-2.5,作为驱动 BitQuery 的 AI.FORECAST 命令的核心模型,这表明该公司正在积极将这些模型进行商业化变现。
当然,这种做法并不罕见。这一市场中的每一家参与者都已将自家的预测模型整合进各自的平台之中,但谷歌一方面限制最先进模型权重的商业使用,另一方面又通过其数据仓库开辟付费使用路径,这一信号相当清晰地表明,这些实验室认为长远来看利润所在何处。
Q&A
Q1:TimesFM-3 是什么?
A:TimesFM-3 是谷歌于近期发布的时间序列预测模型,拥有 3.3 亿参数,训练数据涵盖超过一万亿个真实世界与合成数据时间点,支持多重时间序列的零样本预测。
Q2:TimesFM-3 现在能不能用于商业场景?
A:目前不能。TimesFM-3 的预训练权重采用非商业许可协议发布,仅限非商业、非生产环境使用,商业或生产用途暂不被允许。
Q3:TimesFM-3 相比之前的版本有哪些改进?
A:TimesFM-3 采用了新的双重注意力层架构,能同时处理时间维度上的回溯与多个序列之间的横向关联,还改进了解码方式,通过一次前向传播完成整个预测时间跨度的填充,减少了延迟和误差累积。
