NVIDIA выпустила Molt, компактный PyTorch-фреймворк для обучения ИИ-агентов с подкреплением

Исследования агентного обучения с подкреплением (agentic RL) требуют постоянных правок алгоритма: новых оценщиков (estimators), новых стадий пайплайна, новых схем сбора траекторий (rollout). В типичных фреймворках любое такое изменение приходится проводить через несколько слоёв кода, тренер, распределённый бэкенд, обвязку rollout, и вся эта сложность ложится на исследователя при каждой итерации. Molt, PyTorch-native фреймворк для обучения, созданный NVIDIA, чтобы снизить эту цену: кодовая база достаточно компактна и чиста, чтобы её целиком держал в голове исследователь и мог целиком прочитать и понять ИИ-помощник по коду, так поток алгоритма можно проследить и изменить от начала до конца. Агент в Molt устроен как обычная программа, а обучение идёт одним асинхронным циклом, который тренирует мультимодальные политики и политики типа mixture-of-experts (MoE, смесь экспертов), никогда не обучаясь на токене, который сам не сгенерировал, то есть согласованность токенов, версий политики и семантики модели соблюдается строго. По утверждению авторов, компактность не стоит производительности: при сопоставимом, полностью асинхронном протоколе Molt статистически сравним со state-of-the-art стеком на базе Megatron. Molt выложен с открытым исходным кодом, рецепты обучения и готовые контейнеры доступны на GitHub (NVIDIA-NeMo/labs-molt). Автор публикации на Hugging Face, Jian Hu.
Ключевые факты
- Molt, PyTorch-native фреймворк NVIDIA для обучения агентов reinforcement learning (agentic RL)
- Кодовая база компактна настолько, чтобы её целиком понимал и человек-исследователь, и ИИ-помощник по коду
- Обучение идёт одним асинхронным циклом, поддерживает мультимодальные политики и mixture-of-experts (MoE)
- По заявлению авторов, производительность статистически сравнима со state-of-the-art стеком на базе Megatron
- Открытый исходный код, рецепты и контейнеры опубликованы на GitHub (NVIDIA-NeMo/labs-molt)
Почему это важно
Агентное RL-исследование, это постоянные правки алгоритма: новые оценщики, новые стадии пайплайна, новые схемы сбора траекторий. В мейнстримных фреймворках каждое такое изменение приходится проводить через несколько слоёв, тренер, распределённый бэкенд, обвязку rollout, и цена этой сложности ложится на исследователя при каждой итерации. Molt решает именно эту проблему: код достаточно компактен, чтобы алгоритмический поток можно было проследить и поменять целиком, от начала до конца, без раскопок по слоям инфраструктуры, и, по утверждению авторов, без потери производительности относительно тяжёлого стека на Megatron.
Кому это важно
В первую очередь, исследователям reinforcement learning, которые работают с агентными сценариями (использование инструментов, многошаговые траектории) и часто меняют алгоритм: оценщики, схемы rollout, стадии пайплайна. Также фреймворк актуален для команд, которые уже работают в экосистеме PyTorch и хотят обучать мультимодальные или mixture-of-experts (MoE) политики без перехода на более тяжёлые распределённые стеки.
Как это применить
Molt распространяется с открытым исходным кодом; рецепты обучения и готовые контейнеры для запуска опубликованы на GitHub в организации NVIDIA-NeMo (репозиторий labs-molt). Поскольку фреймворк PyTorch-native, он рассчитан на интеграцию с уже существующими PyTorch-инструментами исследователя, а не на отдельный изолированный стек.
Можно ли доверять
В источнике заявлена статистическая сравнимость Molt со state-of-the-art стеком на базе Megatron при сопоставимом, полностью асинхронном протоколе обучения, но конкретных цифр бенчмарков, таблиц или названий задач/моделей, на которых проводилось сравнение, в тексте нет. Это заявление самих авторов работы, независимого подтверждения в источнике не приводится; на момент сбора публикация на Hugging Face набрала всего 25 очков и 1 комментарий, то есть внешнего обсуждения и проверки сообществом пока немного.
Риски и подводные камни
Как у нового фреймворка, у Molt пока нет истории долгосрочной поддержки и зрелой экосистемы, сопоставимой с Megatron. Заявление о «статистической сравнимости» производительности не означает превосходства и не подкреплено в источнике конкретными числами, детали бенчмарков, охват задач и условия тестирования остаются за кадром. Ставка на компактность кода ради читаемости человеком и ИИ-помощником потенциально может ограничивать гибкость для сценариев, выходящих за рамки заложенной архитектуры (мультимодальные и MoE-политики), но текст не даёт данных, чтобы судить об этом однозначно.