NVIDIA выпустила Kumo Tabular, открытую модель для прогнозов по таблицам

NVIDIA выложила на Hugging Face Kumo Tabular, открытую фундаментальную модель для табличных данных, входящую в коллекцию NVIDIA Kumo Structured. Ей передают таблицу с размеченными строками и строки, для которых нужен прогноз, а в ответ она за один прямой проход возвращает вероятности классов (классификация) или числовые значения (регрессия). Обучение, подбор гиперпараметров и ручное конструирование признаков не требуются. Модель работает по принципу обучения в контексте (in-context learning): размеченная таблица играет роль примеров в запросе, как в языковых моделях.
Модель предобучена только на искусственных таблицах, выпускается в трёх размерах (от 28 млн до 215 млн параметров) и распространяется по лицензии OpenMDW-1.1 с разрешением коммерческого использования. Запускается через открытую библиотеку structured-data-models, которая скачивает веса с Hugging Face при первом обращении. Классификация и регрессия обучены как отдельные модели.
Архитектура, трансформер, построенный вокруг структуры таблицы: он использует внимание по столбцам, по строкам и по контексту, как в TabICL и TabPFN. Значения ячеек кодируются через признаки Фурье (отдельные веса для числовых и категориальных), пропуски обрабатываются без импутации. Внимание по столбцу определяет, что значение означает в распределении своего столбца, и по стоимости растёт линейно с числом строк. Внимание по строке выясняет взаимодействие признаков; к каждой строке добавлены четыре обучаемых токена [CLS], которые служат итоговым представлением строки. На финальном этапе строки контекста смотрят друг на друга, а строки запроса, только на контекст, поэтому прогноз не зависит от того, какие ещё строки оцениваются рядом; ключи и значения контекста считаются один раз и переиспользуются для следующих прогнозов. Для регрессии голова модели выдаёт 999 квантилей, из которых следуют точечный прогноз и оценка неопределённости. Чтобы внимание не «размывалось» на очень длинных таблицах, запросы масштабируются температурой, растущей с логарифмом числа ключей, с отдельным коэффициентом на каждую голову внимания.
Обучающие таблицы генерируются из структурных причинных моделей (SCM): случайный причинный граф со скрытыми переменными, случайные функции в узлах (линейные, малые нейросети, деревья, гауссовские процессы), затем постобработка с пропусками, выбросами и коррелированными группами столбцов; таблицы без обучаемого сигнала отбраковываются. В генератор добавлены «шероховатости» реальных данных: разные паттерны пропусков, огрублённые признаки, категории со множеством уровней, регрессионные цели с тяжёлыми хвостами. Обучение идёт в три этапа: сначала таблицы по 1024 строки и до 100 столбцов, затем контекст от 400 до 10 240 строк, наконец до 60 000 строк (столбцов по-прежнему до 100). Всего Small/Medium/Large увидели примерно 35/71/137 млн искусственных таблиц. Рецепт обучения и генераторы данных NVIDIA обещает опубликовать позже.
Результаты, собственные замеры NVIDIA. На полном лидерборде TabArena (настройки по умолчанию для всех трёх размеров; в сравнении, настроенные градиентные бустинги, AutoGluon и новейшие табличные фундаментальные модели) Kumo Tabular занимает первое место с ELO 1950. В тексте также указано, что модель работает «17 faster» относительно LimiX-2 на единой конфигурации с одной картой RTX 6000 Pro (знака умножения в оригинале нет). NVIDIA утверждает, что по всем трём размерам модель задаёт новый фронт Парето «точность, эффективность». На BeyondArena, ELO 1418 и Improvability 7,78%, первое место. На TALENT, лучший общий результат при средних рангах 6,67 (точность классификации), 3,98 (log-loss классификации) и 4,22 (RMSE регрессии). На ScoringBench (предсказательные распределения) первое и второе места по среднему рангу занимают Large и Medium.
Ограничения: модель работает только с числовыми и категориальными столбцами (текст, изображения и временные метки превращаются в признаки встроенными рецептами предобработки). Один проход охватывает до 10 классов; библиотека расширяет это до любого числа классов с помощью кодов, исправляющих ошибки. Точность может падать на таблицах, сильно выходящих за диапазоны обучения, или если строки запроса распределены иначе, чем строки контекста; NVIDIA советует проверять точность и калибровку на собственных отложенных данных перед внедрением.
Ключевые факты
- Kumo Tabular, открытая модель NVIDIA для классификации и регрессии по таблицам: прогноз новых строк за один проход, без обучения, подбора и конструирования признаков.
- Предобучена только на искусственных таблицах (около 35/71/137 млн для Small/Medium/Large), три размера от 28 млн до 215 млн параметров, лицензия OpenMDW-1.1 с коммерческим использованием.
- По данным NVIDIA, первое место на TabArena (ELO 1950), BeyondArena (ELO 1418, Improvability 7,78%) и TALENT; на ScoringBench Large и Medium, первое и второе по среднему рангу.
- Ограничения: только числовые и категориальные столбцы, один проход, до 10 классов, возможное падение точности вне диапазонов обучения или при сдвиге распределения.
- Рецепт обучения и генераторы искусственных данных пока не опубликованы, NVIDIA обещает выложить их позже.
Почему это важно
Табличные данные, основа корпоративного машинного обучения: оттоку клиентов, дефолтам, спросу и ценам прогнозы строят по таблицам, обычно градиентными бустингами, и под каждую задачу приходится собирать метки, конструировать признаки и подбирать гиперпараметры. Kumo Tabular переносит на таблицы подход языковых моделей: размеченная таблица служит контекстом, а прогноз выдаётся без обучения. NVIDIA заявляет, что модель обходит настроенные бустинги, AutoGluon и другие табличные фундаментальные модели на четырёх бенчмарках, а модель с весами и кодом открыта.
Кому это важно
Дата-сайентистам и инженерам, которые работают с табличными данными: аналитикам оттока, скоринга, спроса и цен. Также исследователям табличных фундаментальных моделей (TabICL, TabPFN и родственные подходы), для которых NVIDIA публикует веса и код, а позднее обещает рецепт обучения и генераторы данных.
Как это применить
Веса лежат на Hugging Face (nvidia/Kumo-Tabular), код, в репозитории NVIDIA/structured-data-models. Библиотека sdm работает на GPU: таблицу из pandas переводят в тензор, передают размеченные строки как контекст, а строки без метки, как запрос; веса скачиваются при первом запуске. Лицензия OpenMDW-1.1 разрешает коммерческое использование. Текст, изображения и временные метки предварительно превращают в признаки встроенными рецептами. Для задач с числом классов больше 10 библиотека применяет коды, исправляющие ошибки.
Можно ли доверять
Все результаты, собственные замеры NVIDIA из её блога на Hugging Face; независимой проверки в тексте не упоминается. Формулировка «первое место на четырёх бенчмарках» требует уточнения: на ScoringBench первое и второе места занимают только Large и Medium. Для сравнения со скоростью LimiX-2 в оригинале написано «17 faster» без знака умножения, поэтому единицу и масштаб ускорения корректно назвать нельзя. Значения ELO 1950 и 1418 приведены для Kumo Tabular в целом, без разбивки по размерам, а оценки конкурентов в тексте не даны.
Риски и подводные камни
NVIDIA сама предупреждает: точность может снижаться на таблицах, далеко выходящих за диапазоны обучения (до 60 000 строк контекста и до 100 столбцов), и при различии распределений строк запроса и контекста. Перед внедрением нужно проверять точность и калибровку на своих отложенных данных. Модель принимает только числовые и категориальные столбцы, один проход охватывает до 10 классов, для запуска нужна GPU-библиотека. Рецепт обучения и генераторы данных пока не опубликованы, так что воспроизвести обучение целиком нельзя.