谷歌正在为BigQuery添加一个针对表格数据的预训练基础模型,使企业团队能够从结构化数据中生成预测结果,而无需从零开始训练和部署机器学习模型。
这款名为TabFM的模型由谷歌研究院开发,目前已进入预览阶段,可以执行分类和回归这两种常见的预测性机器学习任务。
分类通常用于预测类别或结果,例如判断某位客户是否可能流失,或某笔交易是否存在欺诈风险;而回归则通常用于预测数值型结果,比如客户的预期价值或未来理赔金额。
传统情况下,企业团队在典型的机器学习工作流程中,需要针对每个应用场景单独训练和部署一个机器学习模型。相比之下,谷歌在一篇博客文章中写道,TabFM会将历史数据作为上下文示例来进行预测。
这意味着团队可以提供已知结果的标注历史数据,连同需要进行预测的新数据一起,通过BigQuery的AI.PREDICT函数来生成预测结果。
该函数会利用历史数据作为示例来识别模式,然后将学习到的规律应用于新数据,团队无需单独训练和部署机器学习模型。
谷歌表示,TabFM还能自动处理以类别形式表达的数据,例如客户类型或产品类别,同时也能处理存在缺失值的数据集,从而减少了在进行预测之前所需的数据准备工作。
此外,谷歌还提供了AI.EVALUATE函数,用于评估模型在预测任务上的表现。谷歌写道,团队可以使用该函数将TabFM的预测结果与数据中已知的实际结果进行比较,衡量模型的准确程度,从而判断这些预测结果对于特定应用场景是否具有实用价值。
IT咨询公司Kanerika的AI开发负责人阿米特·库马尔·耶纳表示,对于企业而言,TabFM的加入可能会让预测性分析对那些缺乏丰富机器学习专业知识的团队变得更加易用,同时减少传统模型开发和维护过程中涉及的部分工程与基础设施工作。
耶纳解释道:"懂SQL的人现在就可以直接针对BigQuery中已有的表格,使用这两个新函数生成分类或回归预测,而不需要先训练、调优或部署模型,也不需要将数据迁移到单独的机器学习平台,这也简化了治理流程,并降低了运行并行平台的基础设施成本。"
Nord-IQ Research首席分析师马诺伊·钱德拉·贾表示,这意味着TabFM将传统的多角色工作流程——涵盖分析师、数据科学家和机器学习工程师——压缩为一次SQL调用,从而有可能降低人力需求。
然而,这款新模型也存在一些局限性,企业在用它替代传统机器学习工作流程之前应当有所了解。
谷歌自身的指导文档仍然指出,对于数据量非常庞大的数据集,或者特征数量超过TabFM当前20个特征列上限的数据集,应使用XGBoost(一种广泛应用于结构化或表格数据预测的机器学习算法)以及自定义模型。
谷歌写道:"如果你拥有非常庞大的历史数据集,需要对自定义超参数调优拥有完全控制权,特征数量超过TabFM当前的限制,或者需要特征重要性方面的可解释性(即哪些输入特征对预测结果的贡献最大),那么应当使用像XGBoost这样的传统模型。"
分析师指出,尤其是在大规模数据集和高频工作负载场景下,成本优势可能会有所减弱。
耶纳表示,尽管TabFM可以降低搭建模型训练流水线的成本,但谷歌计划从2026年10月30日起,在标准BigQuery收费基础上对TabFM实行基于Token的计费方式,这可能导致大规模生成预测的工作负载成本高于使用经过训练并缓存的模型。
因此,贾建议企业应先在自身的工作负载上试用TabFM,根据实际查询量进行成本核算,并将其与现有的机器学习基础设施成本进行比较,然后再决定是否将机器学习预算的重要部分转向该服务。
贾表示,换言之,这使得TabFM更像是一款针对特定工作负载的工具,而非对传统机器学习模型的全面替代,它更适合用于临时性分析、实验性项目以及频率较低的业务场景。
Q&A
Q1:TabFM是什么?它能做什么?
A:TabFM是谷歌研究院开发的针对表格数据的预训练基础模型,现已在BigQuery中进入预览阶段。它可以执行分类和回归两种预测任务,例如判断客户是否会流失、交易是否存在欺诈风险,或预测客户的预期价值等数值结果,而无需单独训练机器学习模型。
Q2:使用TabFM需要具备机器学习专业知识吗?
A:不需要。懂SQL的人员就可以直接使用BigQuery中的AI.PREDICT函数,针对已有表格生成分类或回归预测,不必先训练、调优或部署模型,也无需将数据迁移到单独的机器学习平台,从而降低了技术门槛和基础设施成本。
Q3:TabFM会完全取代传统机器学习模型吗?
A:不会完全取代。对于数据量非常庞大、特征数量超过20个上限,或需要特征重要性可解释性的场景,谷歌仍建议使用XGBoost等传统模型。分析师认为TabFM更适合临时性分析、实验和低频业务场景,是一款针对特定工作负载的工具。
