Учёные разложили обучение ИИ-агентов долгосрочному планированию на три стадии

Исследователь Тяньи Мэнь с соавторами опубликовали работу о том, как агенты на базе больших моделей осваивают многоходовое планирование на длинном горизонте (multi-turn long-horizon planning), способность строить и удерживать план действий на протяжении многих шагов диалога или задачи. Проблема в том, что обычно такие модели обучают на неконтролируемых и непрозрачных интернет-данных, из-за чего невозможно понять, откуда именно берётся, как формируется и как объединяется навык планирования. Чтобы решить эту проблему, авторы создали единую контролируемую многоходовую среду и разложили изучение планирования на три последовательные стадии.
На первой стадии, приобретение навыка планирования во время предобучения, авторы изучили, как на результат влияют формат, распределение и качество обучающих данных. Оказалось, что явное построение модели мира через моделирование переходов состояний в формате цепочки рассуждений (CoT) даёт заметно более сильное обобщение на длинные горизонты. Одних только «атомарных» навыков недостаточно для композиционного обобщения (переноса на новые комбинации задач), а вот небольшая доля данных с длинными горизонтами уже заметно помогает. При этом неоптимальные (ошибочные) траектории в обучающих данных сильно портят итоговое качество, потому что ошибки накапливаются и усиливаются на длинных горизонтах.
На второй стадии, оттачивание навыка планирования через дообучение методами GRPO и OPD (on-policy distillation, дистилляция по текущей политике модели), авторы с помощью взаимной информации разделили общие паттерны планирования и знания, специфичные для конкретной задачи. Для общих паттернов планирования они выделили три зоны действия дообучения: где оно не нужно, где эффективно и где не работает вовсе. При этом OPD показал более широкую зону эффективности, чем GRPO, в условиях низкокачественных данных и длинных горизонтов, за счёт более согласованного направления обновлений модели. Для специфических знаний о планировании выяснилось, что дистилляция незнакомых процедур от «учителя» с иным набором знаний может испортить уже имеющуюся у модели-ученика модель мира, так и не сформировав взамен новое знание полностью.
На третьей стадии, объединение навыков планирования через дообучение методом MOPD (multi-teacher on-policy distillation, дистилляция по текущей политике сразу от нескольких «учителей»), авторы показали, что этот метод сводит разные навыки к общим, разделяемым паттернам планирования сразу для нескольких сред. Если паттерны от разных «учителей» совместимы, это даёт обобщение сразу на несколько сред; если они частично пересекаются, поддерживает непрерывное дообучение; а если паттерны полностью противоречат друг другу, вызывает сильную взаимную интерференцию, которая портит итоговое качество.
Ключевые факты
- Авторы построили единую контролируемую многоходовую среду, чтобы точно проследить три стадии освоения агентом планирования: предобучение, дообучение (GRPO/OPD) и объединение через MOPD
- На предобучении явное построение модели мира через цепочку рассуждений (CoT-моделирование переходов состояний) даёт более сильное обобщение на длинные горизонты, чем «атомарные» навыки без неё
- Неоптимальные (ошибочные) обучающие траектории сильно портят итог, потому что ошибки накапливаются на длинных горизонтах
- На дообучении OPD показал более широкую зону эффективности, чем GRPO, при низком качестве данных и длинных горизонтах
- Метод MOPD (мультиучительская дистилляция по текущей политике) объединяет навыки за счёт схождения к общим паттернам планирования; полностью противоречащие друг другу паттерны от разных «учителей» вызывают сильную интерференцию и портят качество
Почему это важно
Многоходовое планирование на длинном горизонте, ключевая способность агентов на базе языковых моделей: без неё агент не может надёжно вести многошаговую задачу от начала до конца. До этой работы было плохо понятно, откуда именно берётся такая способность, потому что модели обычно учат на неконтролируемых интернет-данных. Авторы впервые предложили контролируемую среду, которая позволяет разложить формирование навыка планирования на конкретные, изучаемые стадии, от предобучения до объединения знаний от нескольких источников.
Кому это важно
В первую очередь работа адресована исследователям и инженерам, которые обучают агентов на основе базовых моделей для многошаговых задач, от автономных помощников до систем, планирующих последовательности действий. Полезна она и командам, которые занимаются дообучением моделей методами RL/дистилляции (GRPO, on-policy distillation) и сталкиваются с деградацией качества при переносе знаний от одной модели-«учителя» к другой.
Как это применить
Практические выводы работы: при подготовке данных для предобучения агента стоит явно тренировать модель мира через цепочки рассуждений о переходах состояний, а не полагаться только на «атомарные» навыки; даже небольшая доля данных с длинными горизонтами заметно помогает. Обучающие траектории нужно тщательно фильтровать от ошибок, они усиливаются на длинных горизонтах. При дообучении в условиях низкокачественных данных или длинных горизонтов авторы советуют OPD вместо GRPO. А для объединения навыков от нескольких «учителей», метод MOPD, но с оглядкой на совместимость паттернов планирования между источниками, иначе вместо пользы получится взаимная интерференция.
Можно ли доверять
Работа опубликована как препринт на HuggingFace Papers, независимого рецензирования по доступному тексту не подтверждено. При этом исследование выглядит методически основательным: оно строится на собственной контролируемой экспериментальной среде, а не на общих рассуждениях, и раскладывает результаты по трём чётко разделённым стадиям с конкретными эмпирическими находками (роль CoT-моделирования, разница OPD и GRPO, эффект MOPD). На момент подготовки материала у публикации 21 отметка и 2 комментария на HuggingFace, заметный, но не массовый отклик научного сообщества.
Риски и подводные камни
Выводы получены в специально созданной контролируемой многоходовой среде, и неясно, насколько они перенесутся на открытые, менее предсказуемые задачи из реального мира. Разделение «общих паттернов планирования» и «специфичных для задачи знаний» через взаимную информацию, само по себе методический выбор, который может давать неточную границу. Отдельный риск для практиков: дистилляция знаний от «учителя» с иной базой знаний может ухудшить уже имеющуюся у модели картину мира, а объединение через MOPD работает хорошо только при совместимых или частично совместимых паттернах, при полностью конфликтующих паттернах результат ухудшается из-за интерференции.