VentureBeat 한국어
팔로우
Google의 TabFM은 데이터셋별 학습을 건너뛰고, 이전에 본 적 없는 테이블에서도 예측합니다.
Google Research는 테이블 형식 데이터 예측에 혁신을 가져올 새로운 파운데이션 모델인 TabFM을 선보였습니다. 기존 방식은 새로운 데이터셋마다 광범위한 수작업 데이터 준비, 특성 공학, 하이퍼파라미터 튜닝을 요구합니다. 그러나 TabFM은 테이블 형식 예측을 인컨텍스트 학습 문제로 취급하여 단일 순방향 패스로 보지 못한 데이터에 대한 예측을 가능하게 합니다. 이는 기업의 프로덕션까지 걸리는 시간을 몇 주에서 단순한 API 호출로 크게 단축시킵니다. 구조화된 데이터에 어려움을 겪는 대규모 언어 모델과 달리, TabFM은 테이블을 그리드로 처리하여 구조적 무결성과 수학적 정밀도를 유지합니다. 이는 교대 행 및 열 주의, 행 압축, 인컨텍스트 학습을 통해 이전 모델인 TabPFN과 TabICL의 강점을 결합하여 달성합니다. TabFM은 구조적 인과 모델에서 생성된 수백만 개의 합성 데이터셋으로 훈련되어 실제 기밀 데이터 없이 기본적인 데이터 상호작용 사전 지식을 학습했습니다. TabArena에서의 벤치마킹은 TabFM의 제로샷 예측이 튜닝된 지도 학습 기준선과 일치하거나 능가함을 보여줍니다. 모든 고도로 최적화된 프로덕션 모델을 대체하기 위한 것은 아니지만, TabFM은 소규모 엔지니어링 팀에게 상당한 속도를 제공합니다. 트레이드오프는 추론 비용에 있으며, 훈련은 제거되지만 런타임 계산은 각 예측에 대해 과거 데이터를 처리하므로 증가합니다. TabFM은 scikit-learn 호환 API를 제공하며 혼합 데이터 유형을 네이티브로 처리합니다. 현재 제한 사항으로는 10개 클래스 출력 제한과 500개 특성 최적화가 있습니다. 코드는 오픈 소스이지만, 사전 훈련된 모델의 상업적 배포는 현재 제한됩니다. Google은 더 쉬운 클라우드 기반 접근성을 위해 TabFM을 BigQuery에 통합하고 있습니다. TabFM은 빠른 프로토타이핑, 높은 데이터 드리프트 시나리오, 중간 규모 데이터셋에 이상적이며, 초저지연 또는 매우 큰 데이터셋의 경우 기존 모델이 여전히 선호됩니다.