Вышла Miles v0.1, open-source система для RL-обучения ИИ

Вышел Miles v0.1, полный, готовый к промышленному использованию программный стек для пост-тренинга ИИ-моделей методом обучения с подкреплением (RL). Проект построен на дизайне более раннего фреймворка slime и организует каждый этап цикла RL-обучения вокруг одного принципа: компоненты должны быть проверяемыми, чистыми по коду и настраиваемыми. Заявленные цели, точность, эффективность, надёжность и масштабируемость; авторы говорят, что хотят сделать RL frontier-масштаба доступным не только крупным лабораториям, но и исследователям и компаниям.
Технически стек устроен так: rollout-движки построены на SGLang, тренер даёт выбор из двух бэкендов, NVIDIA Megatron-LM или PyTorch FSDP, а для синхронизации весов между узлами доступны три варианта транспорта под разные топологии развёртывания. Помимо полнопараметрового RL, Miles поддерживает LoRA RL, on-policy дистилляцию, supervised fine-tuning (контролируемое дообучение) и точное согласование rollout-этапа с этапом обучения по принципу true-on-policy; та же архитектура распространена и на диффузионные модели.
В качестве финального кейс-стади авторы приводят полностью асинхронный агентный RL на модели GLM-5.2 (744 млрд параметров, из них 40 млрд активных) на задачах кодинга через терминал. Запуск шёл на 64 GPU NVIDIA GB300, медианное время одного шага обучения составило 263 секунды, цифра посчитана по первым 30 замеренным шагам.
Код Miles открыт на GitHub (radixark/miles), у проекта есть отдельный сайт miles.radixark.com. В самом источнике не названы ни конкретные авторы, ни организация-разработчик, только эти два адреса под именем radixark.
Ключевые факты
- Miles v0.1, открытый (open-source) production-стек для RL-пост-тренинга ИИ-моделей, построен на дизайне фреймворка slime
- Rollout-движки на SGLang; тренер с выбором из двух бэкендов, NVIDIA Megatron-LM или PyTorch FSDP; три варианта транспорта для синхронизации весов под разные топологии развёртывания
- Помимо полнопараметрового RL поддерживает LoRA RL, on-policy дистилляцию, supervised fine-tuning и true-on-policy согласование rollout и обучения; та же архитектура распространена на диффузионные модели
- Кейс-стади: асинхронный агентный RL на модели GLM-5.2 (744 млрд параметров, 40 млрд активных) на задачах терминального кодинга, 64 GPU NVIDIA GB300, медианное время шага 263 секунды за первые 30 замеренных шагов
- Код открыт на GitHub (radixark/miles), сайт проекта, miles.radixark.com
Почему это важно
RL-пост-тренинг стал ключевым этапом доводки топовых ИИ-моделей, но производственная инфраструктура для него обычно остаётся внутренним инструментом лабораторий. Miles v0.1 выкладывает такой стек в открытый доступ целиком, от rollout-движков до тренера и синхронизации весов, и заявляет целью сделать RL frontier-масштаба доступным исследователям и компаниям, а не только крупным лабораториям.
Кому это важно
Инженерам и исследовательским командам, которые сами обучают или дообучают большие модели методом RL, от полнопараметрового обучения до LoRA, дистилляции и supervised fine-tuning, и которым нужен готовый проверяемый стек вместо сборки инфраструктуры с нуля. Релевантно и командам, работающим с диффузионными моделями: архитектура Miles распространена и на них.
Как это применить
Miles построен поверх дизайна фреймворка slime; rollout-движки работают на SGLang, тренер даёт выбор между бэкендами NVIDIA Megatron-LM и PyTorch FSDP, для синхронизации весов между узлами доступны три варианта транспорта под разные топологии развёртывания. Помимо полнопараметрового RL система поддерживает LoRA RL, on-policy дистилляцию, supervised fine-tuning и точное on-policy согласование rollout-этапа с обучением, а также распространяет ту же архитектуру на диффузионные модели. Код открыт на GitHub (radixark/miles), у проекта есть отдельный сайт miles.radixark.com.
Можно ли доверять
Материал, это собственный отчёт разработчиков на странице статьи (papers) Hugging Face, а не независимый обзор. В источнике не названы ни конкретные авторы, ни организация-разработчик, только адреса репозитория и сайта под именем radixark. Кейс-стади с GLM-5.2 на 64 GPU NVIDIA GB300 и медианным временем шага 263 секунды, тоже цифры самих авторов, без сравнения с другими решениями, включая slime, на дизайне которого построен Miles.
Риски и подводные камни
В источнике нет бенчмарков точности и сравнения Miles с другими системами RL-пост-тренинга, оценить реальный выигрыш стека со стороны невозможно. Не указано, как 263 секунды на шаг соотносятся со slime или другими альтернативами: быстро это или медленно, неизвестно. Отсутствие названных авторов и организации затрудняет независимую проверку заявлений.