MiMo-V2.6: отчёт о масштабировании обучения с подкреплением и открытые среды

MiMo-V2.6: отчёт о масштабировании обучения с подкреплением и открытые среды

В техническом отчёте представлено семейство MiMo-V2.6, омнимодальные модели, которые, по словам авторов, продвигают границу интеллекта моделей за счёт масштабирования вычислений на обучение с подкреплением (RL). Исходный тезис отчёта: RL, центральная парадигма обучения, которая ведёт большие базовые модели к самоулучшению.

Перед RL авторы провели промежуточное обучение (mid-training) на широком мультимодальном корпусе, чтобы дать модели достаточно пространства для исследования, и построили инфраструктуру поверх предобученной гибридной архитектуры hybrid-SWA, рассчитанную на дальнейшее масштабирование.

Вычисления на RL наращивали по трём направлениям. Первое, более крупные батчи и выше пропускная способность: асинхронное обучение потребляет 1 568 образцов и 2,7-3,7 млрд токенов за один шаг при длине контекста до 1 млн. Второе, более разнообразные и сложные среды: они охватывают области кода, общих задач, визуальных задач и кибербезопасности (cyber) и работают под набором разных агентных обвязок. Третье, больше вычислений на оценщиков (graders): групповая агентная оценка (groupwise agentic grading) даёт более точные сигналы награды для длинных задач и подталкивает модель к более коротким и экономным по токенам решениям.

Для устойчивости обучения в большом масштабе авторы заморозили маршрутизатор MoE (mixture-of-experts) и выстроили многоуровневую защиту от взлома награды (reward hacking). Отдельно они построили инфраструктуру для агентного RL на смешанных задачах: единое представление траекторий, высококонкурентную генерацию траекторий (rollout) сразу в нескольких фреймворках, разделённые плоскости управления и данных и согласованность между обучением и инференсом.

Авторы заявляют, что открывают динамику обучения, среды RL и RL-фреймворк, чтобы облегчить воспроизведение и дальнейшие исследования масштабного RL и самоулучшения моделей.

Ключевые факты

  • MiMo-V2.6, омнимодальное семейство моделей, обученное с упором на масштабирование вычислений в обучении с подкреплением.
  • Вычисления на RL наращивали по трём осям: размер батча и пропускная способность, разнообразие сред, мощность оценщиков.
  • Асинхронное обучение потребляет 1 568 образцов и 2,7, 3,7 млрд токенов за шаг при контексте до 1 млн.
  • Для стабильности обучения заморожен маршрутизатор MoE и введена многоуровневая защита от взлома награды.
  • Авторы открывают динамику обучения, среды RL и RL-фреймворк для воспроизведения результатов.

Почему это важно

Отчёт описывает практику масштабирования именно RL-этапа, а не только предобучения: размер батча, разнообразие сред и вычисления на оценщиков наращиваются как отдельные оси. Цифры за один шаг, 1 568 образцов и 2,7-3,7 млрд токенов при контексте до 1 млн, показывают порядок нагрузки, на которой авторы гоняют агентное обучение. Отдельный интерес вызывает заявленная открытость: авторы заявляют об открытии динамики обучения, сред и фреймворка.

Кому это важно

Исследователям обучения с подкреплением и агентных систем, командам, которые строят собственные среды и инфраструктуру для RL, и тем, кто занимается устойчивостью обучения больших моделей с MoE и защитой от взлома награды.

Как это применить

Практически полезны будут открытые среды и RL-фреймворк, если они действительно будут опубликованы: на них можно воспроизводить обучение и пробовать описанные приёмы, например групповую агентную оценку или заморозку маршрутизатора MoE. Условия лицензии и точное место публикации в тексте не названы, поэтому сначала стоит проверить сам отчёт и репозиторий.

Можно ли доверять

Источник, аннотация технического отчёта, то есть заявления самих авторов. В тексте не приведены результаты бенчмарков и сравнения с другими моделями, поэтому утверждение о продвижении границы интеллекта моделей остаётся самооценкой, которую нельзя проверить по этому тексту. Отчёт также не утверждает, что самоулучшение достигнуто: RL назван лишь парадигмой, ведущей к нему.

Риски и подводные камни

Неизвестны размеры моделей, конфигурация MoE, общий объём вычислений и длительность обучения, так что оценить стоимость повторения затруднительно. Сам отчёт называет риск взлома награды (reward hacking) и нестабильность обучения в большом масштабе: для них потребовались заморозка маршрутизатора и многоуровневая защита. Открытость заявлена авторами в виде обещания, а полнота и условия публикации требуют проверки.