NVIDIA выпустила Kumo Tabular, открытую модель для прогнозов по таблицам

NVIDIA выпустила Kumo Tabular, открытую модель для прогнозов по таблицам

NVIDIA выложила на Hugging Face Kumo Tabular, открытую фундаментальную модель для табличных данных, входящую в коллекцию NVIDIA Kumo Structured. Ей передают таблицу с размеченными строками и строки, для которых нужен прогноз, а в ответ она за один прямой проход возвращает вероятности классов (классификация) или числовые значения (регрессия). Обучение, подбор гиперпараметров и ручное конструирование признаков не требуются. Модель работает по принципу обучения в контексте (in-context learning): размеченная таблица играет роль примеров в запросе, как в языковых моделях.

Модель предобучена только на искусственных таблицах, выпускается в трёх размерах (от 28 млн до 215 млн параметров) и распространяется по лицензии OpenMDW-1.1 с разрешением коммерческого использования. Запускается через открытую библиотеку structured-data-models, которая скачивает веса с Hugging Face при первом обращении. Классификация и регрессия обучены как отдельные модели.

Архитектура, трансформер, построенный вокруг структуры таблицы: он использует внимание по столбцам, по строкам и по контексту, как в TabICL и TabPFN. Значения ячеек кодируются через признаки Фурье (отдельные веса для числовых и категориальных), пропуски обрабатываются без импутации. Внимание по столбцу определяет, что значение означает в распределении своего столбца, и по стоимости растёт линейно с числом строк. Внимание по строке выясняет взаимодействие признаков; к каждой строке добавлены четыре обучаемых токена [CLS], которые служат итоговым представлением строки. На финальном этапе строки контекста смотрят друг на друга, а строки запроса, только на контекст, поэтому прогноз не зависит от того, какие ещё строки оцениваются рядом; ключи и значения контекста считаются один раз и переиспользуются для следующих прогнозов. Для регрессии голова модели выдаёт 999 квантилей, из которых следуют точечный прогноз и оценка неопределённости. Чтобы внимание не «размывалось» на очень длинных таблицах, запросы масштабируются температурой, растущей с логарифмом числа ключей, с отдельным коэффициентом на каждую голову внимания.

Обучающие таблицы генерируются из структурных причинных моделей (SCM): случайный причинный граф со скрытыми переменными, случайные функции в узлах (линейные, малые нейросети, деревья, гауссовские процессы), затем постобработка с пропусками, выбросами и коррелированными группами столбцов; таблицы без обучаемого сигнала отбраковываются. В генератор добавлены «шероховатости» реальных данных: разные паттерны пропусков, огрублённые признаки, категории со множеством уровней, регрессионные цели с тяжёлыми хвостами. Обучение идёт в три этапа: сначала таблицы по 1024 строки и до 100 столбцов, затем контекст от 400 до 10 240 строк, наконец до 60 000 строк (столбцов по-прежнему до 100). Всего Small/Medium/Large увидели примерно 35/71/137 млн искусственных таблиц. Рецепт обучения и генераторы данных NVIDIA обещает опубликовать позже.

Результаты, собственные замеры NVIDIA. На полном лидерборде TabArena (настройки по умолчанию для всех трёх размеров; в сравнении, настроенные градиентные бустинги, AutoGluon и новейшие табличные фундаментальные модели) Kumo Tabular занимает первое место с ELO 1950. В тексте также указано, что модель работает «17 faster» относительно LimiX-2 на единой конфигурации с одной картой RTX 6000 Pro (знака умножения в оригинале нет). NVIDIA утверждает, что по всем трём размерам модель задаёт новый фронт Парето «точность, эффективность». На BeyondArena, ELO 1418 и Improvability 7,78%, первое место. На TALENT, лучший общий результат при средних рангах 6,67 (точность классификации), 3,98 (log-loss классификации) и 4,22 (RMSE регрессии). На ScoringBench (предсказательные распределения) первое и второе места по среднему рангу занимают Large и Medium.

Ограничения: модель работает только с числовыми и категориальными столбцами (текст, изображения и временные метки превращаются в признаки встроенными рецептами предобработки). Один проход охватывает до 10 классов; библиотека расширяет это до любого числа классов с помощью кодов, исправляющих ошибки. Точность может падать на таблицах, сильно выходящих за диапазоны обучения, или если строки запроса распределены иначе, чем строки контекста; NVIDIA советует проверять точность и калибровку на собственных отложенных данных перед внедрением.

Ключевые факты

  • Kumo Tabular, открытая модель NVIDIA для классификации и регрессии по таблицам: прогноз новых строк за один проход, без обучения, подбора и конструирования признаков.
  • Предобучена только на искусственных таблицах (около 35/71/137 млн для Small/Medium/Large), три размера от 28 млн до 215 млн параметров, лицензия OpenMDW-1.1 с коммерческим использованием.
  • По данным NVIDIA, первое место на TabArena (ELO 1950), BeyondArena (ELO 1418, Improvability 7,78%) и TALENT; на ScoringBench Large и Medium, первое и второе по среднему рангу.
  • Ограничения: только числовые и категориальные столбцы, один проход, до 10 классов, возможное падение точности вне диапазонов обучения или при сдвиге распределения.
  • Рецепт обучения и генераторы искусственных данных пока не опубликованы, NVIDIA обещает выложить их позже.

Почему это важно

Табличные данные, основа корпоративного машинного обучения: оттоку клиентов, дефолтам, спросу и ценам прогнозы строят по таблицам, обычно градиентными бустингами, и под каждую задачу приходится собирать метки, конструировать признаки и подбирать гиперпараметры. Kumo Tabular переносит на таблицы подход языковых моделей: размеченная таблица служит контекстом, а прогноз выдаётся без обучения. NVIDIA заявляет, что модель обходит настроенные бустинги, AutoGluon и другие табличные фундаментальные модели на четырёх бенчмарках, а модель с весами и кодом открыта.

Кому это важно

Дата-сайентистам и инженерам, которые работают с табличными данными: аналитикам оттока, скоринга, спроса и цен. Также исследователям табличных фундаментальных моделей (TabICL, TabPFN и родственные подходы), для которых NVIDIA публикует веса и код, а позднее обещает рецепт обучения и генераторы данных.

Как это применить

Веса лежат на Hugging Face (nvidia/Kumo-Tabular), код, в репозитории NVIDIA/structured-data-models. Библиотека sdm работает на GPU: таблицу из pandas переводят в тензор, передают размеченные строки как контекст, а строки без метки, как запрос; веса скачиваются при первом запуске. Лицензия OpenMDW-1.1 разрешает коммерческое использование. Текст, изображения и временные метки предварительно превращают в признаки встроенными рецептами. Для задач с числом классов больше 10 библиотека применяет коды, исправляющие ошибки.

Можно ли доверять

Все результаты, собственные замеры NVIDIA из её блога на Hugging Face; независимой проверки в тексте не упоминается. Формулировка «первое место на четырёх бенчмарках» требует уточнения: на ScoringBench первое и второе места занимают только Large и Medium. Для сравнения со скоростью LimiX-2 в оригинале написано «17 faster» без знака умножения, поэтому единицу и масштаб ускорения корректно назвать нельзя. Значения ELO 1950 и 1418 приведены для Kumo Tabular в целом, без разбивки по размерам, а оценки конкурентов в тексте не даны.

Риски и подводные камни

NVIDIA сама предупреждает: точность может снижаться на таблицах, далеко выходящих за диапазоны обучения (до 60 000 строк контекста и до 100 столбцов), и при различии распределений строк запроса и контекста. Перед внедрением нужно проверять точность и калибровку на своих отложенных данных. Модель принимает только числовые и категориальные столбцы, один проход охватывает до 10 классов, для запуска нужна GPU-библиотека. Рецепт обучения и генераторы данных пока не опубликованы, так что воспроизвести обучение целиком нельзя.