TabFM: модель на 400 млн параметров даёт прогнозы по таблицам без дообучения

В статье представлена TabFM, фундаментальная модель для табличных данных на 400 млн параметров. Авторы исходят из того, что машинное обучение на таблицах обычно строится вокруг отдельной работы под каждый набор данных: для каждой задачи с нуля обучают ансамбли деревьев или запускают поиск AutoML.
TabFM подходит к задаче иначе: контролируемое предсказание по таблице оформлено как обучение в контексте (in-context learning). По заявлению авторов, модель выдаёт откалиброванные прогнозы без дообучения (zero-shot) за один прямой проход и без настройки под конкретную задачу.
Обучена TabFM целиком на синтетических таблицах, сгенерированных из структурных причинных моделей. По словам авторов, благодаря этому она усваивает общие представления о табличных данных, которые без дообучения переносятся на реальные задачи.
Оценка проведена на всех 51 наборах данных бенчмарка TabArena (38 задач классификации и 13 регрессии). Авторы сообщают, что TabFM без дообучения занимает первое место среди табличных фундаментальных моделей в конфигурации по умолчанию и превосходит настроенные AutoML-конвейеры.
Есть и два расширения поверх тех же замороженных весов. TabFM+ добавляет расширение признаков с несколькими представлениями данных, ансамблирование и последующую калибровку. TabFM-Auto добавляет подготовку данных и конструирование признаков под конкретный набор, которыми руководит языковая модель. Оба расширения, как утверждают авторы, дополнительно улучшают результат на обоих треках.
Ключевые факты
- TabFM, табличная фундаментальная модель на 400 млн параметров: прогноз делается как обучение в контексте, за один прямой проход, без настройки под задачу.
- Обучение целиком на синтетических таблицах, сгенерированных из структурных причинных моделей; перенос на реальные задачи без дообучения.
- Оценка на всех 51 наборах TabArena (38 классификации, 13 регрессии): по заявлению авторов, первое место среди табличных фундаментальных моделей по умолчанию и выше настроенных AutoML-конвейеров.
- Расширения на тех же замороженных весах: TabFM+ (несколько представлений признаков, ансамблирование, калибровка) и TabFM-Auto (подготовка данных и признаки под набор с помощью языковой модели).
Почему это важно
Табличные данные, основа множества прикладных задач, и привычный подход требует отдельной работы под каждый набор: обучить ансамбль деревьев или запустить поиск AutoML с нуля. Авторы предлагают заменить это одним предобученным прогнозом за прямой проход. Если заявленные результаты подтвердятся, работа с таблицами сместится от настройки под задачу к использованию готовой модели.
Кому это важно
Специалистам по машинному обучению и аналитикам, которые работают с табличными данными в задачах классификации и регрессии, а также исследователям табличных фундаментальных моделей и AutoML.
Как это применить
В описании статьи ничего не сказано о доступности весов и кода, поэтому практическое применение пока оценить нельзя. По описанию, базовая модель выдаёт прогнозы без настройки под задачу, а при желании поверх тех же весов можно использовать расширения TabFM+ и TabFM-Auto.
Можно ли доверять
Все выводы, заявления самих авторов в аннотации статьи. Численных результатов, величины отрыва от AutoML и перечня конкретных сравниваемых систем в аннотации нет, поэтому оценить силу заявления по этому тексту нельзя. Независимой проверки в материале нет.
Риски и подводные камни
Заявленное превосходство относится к бенчмарку TabArena (51 набор) и к конфигурации моделей по умолчанию; на других данных результат может отличаться. Обучение только на синтетических таблицах означает, что качество переноса на реальные задачи подтверждено лишь этим бенчмарком. Стоимость обучения, скорость вывода и ограничения на размер таблиц в аннотации не указаны.