Google 的 TabFM 无需针对每个数据集进行训练,即... 笔记

Google 的 TabFM 无需针对每个数据集进行训练,即可对从未见过的表格进行预测。

Google Research 推出了 TabFM,这是一种旨在彻底变革表格数据预测的新型基础模型。传统方法需要为每个新数据集投入大量人工进行数据准备、特征工程和超参数调优。而 TabFM 将表格预测视为一种上下文学习问题,能够在单次前向传播中实现对未见数据的预测,从而将企业从数周的生产周期缩短至仅需一次 API 调用。与难以处理结构化数据的大型语言模型不同,TabFM 将表格视为网格进行处理,保留了结构完整性和数学精度。它通过结合早期模型 TabPFN 和 TabICL 的优势,利用交替的行与列注意力机制、行压缩以及上下文学习来实现这一目标。TabFM 在由结构因果模型生成的数百万个合成数据集上进行训练,学习基本的数据交互先验,而无需使用现实世界中的机密数据。在 TabArena 基准测试中,TabFM 的零样本预测表现与经过调优的监督基线相当甚至更优。虽然 TabFM 并非旨在取代所有高度优化的生产模型,但它为精简的工程团队提供了显著的开发速度。其权衡在于推理成本:训练过程被消除,但每次预测时因处理历史数据而导致运行时计算量增加。TabFM 提供与 scikit-learn 兼容的 API,并原生支持混合数据类型。当前局限性包括输出类别上限为 10 类,以及特征优化上限为 500 个。尽管代码已开源,但预训练模型的商业部署目前仍受限制。Google 正将 TabFM 集成到 BigQuery 中,以提供更便捷的云端访问。TabFM 适用于快速原型设计、高数据漂移场景以及中等规模数据集;而对于超低延迟或极大规模数据集,传统模型仍更为适宜。
CdXz5zHNQW_Di3ddngZfs.jpeg