Предложен KLPO: обучение ИИ-агентов с одним прогоном на запрос и без критика

Предложен KLPO: обучение ИИ-агентов с одним прогоном на запрос и без критика

В препринте рассматривается асинхронное обучение с подкреплением (RL) для агентов на основе больших языковых моделей. В таком режиме одна политика обучается на траекториях, которые сгенерировала другая: прогоны берутся из устаревших контрольных точек, а вероятности движка вывода отличаются от вероятностей обучающей стороны даже при одинаковых параметрах.

Стандартные способы справиться с этим, по словам авторов, имеют цену. Либо обрезают отношения весов важности, и это смещает обновление. Либо, как в GRPO, на каждый запрос сэмплируют группу ответов, и при длинных эпизодах это дорого.

Авторы предлагают KL-Regularized Policy Optimization (KLPO). Идея в том, что KL-регуляризатор привязывают к сэмплеру, тому, кто генерировал траектории. Тогда шаг улучшения с регуляризацией имеет решение Гиббса в замкнутой форме. KLPO подгоняет условие оптимальности в виде логарифма отношения вероятностей методом наименьших квадратов на собственных траекториях сэмплера. Вероятность сэмплера входит только через логарифм отношения, поэтому веса важности не нужны. Если «вынести» свободный член регрессии, неподъёмный логарифм статистической суммы заменяется средним значением сигнала по сэмплеру плюс KL-дивергенцией между сэмплером и обучающей стороной.

Для целей токенного зеркального спуска по политике (policy mirror descent) авторы показывают, что градиент можно вычислить по итоговым наградам без критика, через центрированные по сэмплеру оценки (scores) или через единственную остаточную ошибку по траектории, причём даже при стохастических ответах инструментов. Кроме того, они доказывают, что независимые оценки KL-слагаемого методом Монте-Карло сохраняют градиенты несмещёнными, выводят точный разрыв по KL для более дешёвых приближений top-K и бинарного, и показывают, что методы SPPO, GPO, REBEL и BPO являются частными случаями KLPO.

Итог, как его формулируют авторы: обновление без критика, которое использует один прогон на запрос и не требует ни обучаемого нормировщика, ни группы ответов.

Ключевые факты

  • KLPO, метод асинхронного RL для LLM-агентов: KL-регуляризатор привязан к сэмплеру, поэтому веса важности не нужны.
  • Обновление использует один прогон на запрос, без критика, без обучаемого нормировщика и без группы ответов, как в GRPO.
  • Градиент вычисляется по итоговым наградам, в том числе при стохастических ответах инструментов.
  • Доказано, что независимые монте-карловские оценки KL-слагаемого сохраняют градиенты несмещёнными; выведен точный KL-разрыв для приближений top-K и бинарного.
  • SPPO, GPO, REBEL и BPO, по утверждению авторов, частные случаи KLPO.

Почему это важно

При обучении агентов на длинных эпизодах каждый прогон дорог, а асинхронность неизбежно создаёт расхождение между тем, кто генерирует траектории, и тем, кто учится. Обрезка весов важности смещает обновление, а группы ответов на запрос, как в GRPO, умножают стоимость. KLPO, по заявлению авторов, снимает обе проблемы: веса не нужны, хватает одного прогона на запрос. Дополнительный довод в пользу работы, теоретическая связь: несколько известных методов (SPPO, GPO, REBEL, BPO) выводятся из неё как частные случаи.

Кому это важно

Прежде всего исследователям и инженерам, которые обучают LLM-агентов с подкреплением в асинхронных конфигурациях и упираются в стоимость групповой выборки. Также тем, кто занимается теорией методов оптимизации политики и сравнивает семейство методов вроде SPPO, GPO, REBEL и BPO. Для широкой аудитории работа пока носит чисто технический характер.

Как это применить

Из текста источника практическая применимость не видна: в нём описан метод и его теоретические свойства, а сведений о выпуске кода или деталях реализации нет. Практикам имеет смысл дождаться полного текста статьи и изучить, как именно строится обновление: подгонка логарифма отношения вероятностей наименьшими квадратами на траекториях сэмплера, вычисление градиента по итоговым наградам и выбор между полной оценкой KL и приближениями top-K или бинарным.

Можно ли доверять

Это препринт, а источник, его аннотация, поэтому все утверждения принадлежат самим авторам. В аннотации нет экспериментальных результатов, бенчмарков, размеров моделей и численных улучшений, нет сравнения стоимости, точности или стабильности с GRPO и другими базовыми методами, и не сказано, проверялся ли KLPO на реальных задачах LLM-агентов. Авторы и организации в тексте не названы. Заявленные теоретические результаты (несмещённость, точный KL-разрыв, частные случаи) нужно проверять по полному тексту.

Риски и подводные камни

Главный риск, разрыв между теорией и практикой: преимущества «один прогон на запрос» и «без критика» в аннотации не подкреплены измерениями. Неизвестно, как метод ведёт себя на длинных эпизодах с реальными инструментами и насколько дешёвые приближения top-K и бинарное сказываются на качестве, хотя точный KL-разрыв для них авторы выводят. Пока нет данных о воспроизводимости и о реализации, сравнивать KLPO с GRPO по затратам и результату нельзя.