VentureBeat на русском
Подписаться
TabFM от Google пропускает обучение на каждом наборе данных и все же делает прогнозы на таблицах, которые он никогда не видел.
Google Research представила TabFM, новую базовую модель, призванную революционизировать прогнозирование на основе табличных данных. Традиционные методы требуют значительных ручных усилий при подготовке данных, инженерии признаков и настройке гиперпараметров для каждого нового набора данных. TabFM, однако, рассматривает прогнозирование табличных данных как проблему обучения в контексте, позволяя делать прогнозы для невиданных ранее данных за один прямой проход. Это значительно сокращает время вывода на рынок для предприятий с недель до простого вызова API. В отличие от больших языковых моделей, которые испытывают трудности со структурированными данными, TabFM обрабатывает таблицы как сетки, сохраняя структурную целостность и математическую точность. Это достигается за счет объединения сильных сторон более ранних моделей, TabPFN и TabICL, посредством чередующегося внимания к строкам и столбцам, сжатия строк и обучения в контексте. TabFM был обучен на миллионах синтетических наборов данных, сгенерированных из структурных каузальных моделей, изучая фундаментальные априорные знания о взаимодействии данных без использования конфиденциальных данных из реального мира. Тестирование на TabArena показывает, что прогнозы TabFM в режиме zero-shot соответствуют или превосходят настроенные контролируемые базовые модели. Хотя TabFM не предназначен для замены всех высокооптимизированных производственных моделей, он обеспечивает значительную скорость для небольших инженерных команд. Компромисс заключается в стоимости вывода; обучение исключается, но вычислительные затраты во время выполнения увеличиваются, поскольку исторические данные обрабатываются для каждого прогноза. TabFM предлагает API, совместимый с scikit-learn, и нативно обрабатывает смешанные типы данных. Текущие ограничения включают ограничение вывода в 10 классов и оптимизацию до 500 признаков. Хотя код является открытым исходным кодом, коммерческое развертывание предварительно обученной модели в настоящее время ограничено. Google интегрирует TabFM в BigQuery для облегчения доступа в облаке. TabFM идеально подходит для быстрого прототипирования, сценариев с высокой степенью дрейфа данных и наборов данных среднего размера, при этом традиционные модели остаются предпочтительными для сверхнизкой задержки или чрезвычайно больших наборов данных.