VentureBeat 日本語
フォロー
GoogleのTabFMは、データセットごとのトレーニングをスキップし、見たことのないテーブルでも予測を行います
Google Researchは、表形式データ予測に革命をもたらすように設計された新しい基盤モデルであるTabFMを導入しました。従来のメソッドでは、新しいデータセットごとに、データ準備、特徴量エンジニアリング、ハイパーパラメータチューニングに多大な手作業が必要でした。しかし、TabFMは表形式予測をコンテキスト内学習問題として扱い、単一のフォワードパスで未知のデータに対する予測を可能にします。これにより、エンタープライズのプロダクションへの移行時間を数週間からわずかAPIコールに大幅に短縮できます。構造化データに苦労する大規模言語モデルとは異なり、TabFMはテーブルをグリッドとして処理し、構造的整合性と数学的精度を維持します。これは、交互の行と列の注意、行圧縮、およびコンテキスト内学習を通じて、以前のモデルであるTabPFNとTabICLの強みを組み合わせることで実現されます。TabFMは、構造的因果モデルから生成された数百万の合成データセットでトレーニングされ、実際の機密データなしで基本的なデータインタラクションの事前知識を学習しました。TabArenaでのベンチマーキングは、TabFMのゼロショット予測が、調整済みの教師ありベースラインに匹敵するかそれを超えることを示しています。すべての高度に最適化されたプロダクションモデルを置き換えることを意図したものではありませんが、TabFMはリーンエンジニアリングチームに大幅な速度を提供します。トレードオフは推論コストにあり、トレーニングは不要になりますが、各予測のために履歴データが処理されるため、ランタイム計算が増加します。TabFMはscikit-learn互換のAPIを提供し、混合データ型をネイティブに処理します。現在の制限には、10クラスの出力制限と500特徴量の最適化が含まれます。コードはオープンソースですが、事前トレーニング済みモデルの商用展開は現在制限されています。Googleは、クラウドベースのアクセスを容易にするために、TabFMをBigQueryに統合しています。TabFMは、ラピッドプロトタイピング、高いデータドリフトシナリオ、および中規模のデータセットに最適であり、超低遅延または非常に大規模なデータセットには従来のモデルが引き続き好まれます。