RetireOPD: агентные модели сами «увольняют» ИИ-наставника ради роста результатов

RetireOPD: агентные модели сами «увольняют» ИИ-наставника ради роста результатов

Многошаговых ИИ-агентов обучают методом RL (reinforcement learning, обучение с подкреплением), но за целую траекторию действий модель получает всего один общий числовой сигнал награды, обратная связь получается разреженной, и обучение идёт медленно. Чтобы дать модели более плотную, пошаговую подсказку, применяют self on-policy distillation (OPD): роль учителя играет та же модель, но наделённая привилегированной информацией о навыке решения задачи (skill-conditioned), а «ученик» без этой привилегии учится у неё одновременно через RL и дистилляцию.

Авторы работы находят два изъяна такого подхода именно в агентных задачах: наличие у учителя привилегированной информации само по себе не гарантирует, что его подсказки надёжны, а польза от учительской подсказки меняется по ходу обучения, то есть учитель не одинаково полезен на всех стадиях.

Решение, RetireOPD (Self-Retiring On-Policy Distillation). Сначала отдельно обучают «учителя», модель, привязанную к навыку задачи, с помощью наград среды. Затем «ученика» без этого навыка обучают одновременно двумя сигналами: RL и OPD от учителя. Ключевая идея метода, Adaptive Retirement (адаптивный выход учителя «на пенсию»): вместо заранее заданного расписания дистилляции ученик сам решает, когда отказаться от учителя, как только расхождение между ними перестаёт сокращаться и ученик достигает целевой доли от успешности учителя. После этого момента обучение продолжается только через RL, без учителя.

На моделях семейства Qwen2.5 размером от 1,5 до 7 миллиардов параметров RetireOPD повысил успешность выполнения задач в бенчмарке ALFWorld (симуляция бытовых задач для агента) по сравнению с базовым RL-обучением на 14,1, 18,8%, а точность в бенчмарке WebShop (задачи по покупкам в интернет-магазине), на 11,8, 19,0%. При этом во всех протестированных сценариях RetireOPD превзошёл собственного учителя, модель со skill-conditioned привилегией, у которой он учился.

Ключевые факты

  • RetireOPD, метод обучения агентных ИИ-моделей с подкреплением, где ученик сам решает, когда перестать учиться у более сильного учителя
  • Проблема, которую решает метод: привилегированная информация не делает учителя надёжным всегда, а польза от его подсказок меняется по стадиям обучения
  • Механизм Adaptive Retirement: ученик отказывается от учителя, когда их расхождение перестаёт сокращаться и ученик достигает целевой доли успешности учителя
  • На моделях Qwen2.5 (1,5, 7 млрд параметров) метод поднял успешность в ALFWorld на 14,1, 18,8% и точность в WebShop на 11,8, 19,0% относительно базового RL
  • RetireOPD превзошёл собственного учителя во всех протестированных сценариях

Почему это важно

Многошаговые агентные задачи обучают через RL с разреженной наградой, один числовой сигнал на всю траекторию действий, из-за чего модели медленно учатся. Дистилляция от учителя с привилегированной информацией должна была дать более плотный сигнал, но по фиксированному расписанию она работает плохо: подсказки надёжны не всегда, а их польза зависит от стадии обучения. RetireOPD впервые даёт ученику самому решать, когда отказаться от учителя, не по расписанию, а по фактическому прогрессу.

Кому это важно

Тем, кто обучает ИИ-агентов методом RL для многошаговых задач, например, для симулированных бытовых сред (как ALFWorld) или агентов, работающих с интернет-магазинами (как WebShop), а шире, для любых команд, использующих дистилляцию для ускорения RL-обучения LLM-агентов.

Как это применить

Рецепт из двух этапов. Сначала обучают отдельного «учителя», модель, которой дают привилегированную информацию о навыке решения задачи, и обучают её через награды среды. Затем «ученика» без этой привилегии обучают одновременно двумя сигналами: обычным RL и дистилляцией от учителя (OPD). Вместо заранее прописанного расписания отключения учителя используют Adaptive Retirement: отслеживают расхождение между учеником и учителем и долю успешности ученика относительно учителя, и как только расхождение перестаёт сокращаться, а доля достигает целевого порога, учителя отключают, и обучение продолжается только через RL.

Можно ли доверять

Материал взят со страницы статьи на Hugging Face Papers, источник полный, с числовыми результатами. Эффект проверен на пяти масштабах моделей Qwen2.5 (от 1,5 до 7 млрд параметров) и на двух разных агентных бенчмарках (ALFWorld и WebShop), и метод превзошёл собственного учителя во всех сценариях, это говорит в пользу устойчивости результата. Но в тексте не названы ни авторы, ни организация, стоящая за работой, нет сравнения с другими методами дистилляции (только с RL-базой и собственным учителем), и не раскрыто, какому конкретно порогу равна «целевая доля» успешности учителя.

Риски и подводные камни

Работа не сообщает, сколько вычислений и времени потребовало обучение и какого размера были обучающие данные, оценить практическую стоимость подхода по источнику нельзя. Результаты получены только на семье моделей Qwen2.5 и только на двух бенчмарках, поэтому перенос на другие архитектуры и задачи не подтверждён. Метод сравнивается лишь с RL-базой и собственным учителем, насколько он выигрывает у прочих подходов дистилляции, из текста не следует.