OPD: обучение на одном примере восстанавливает основную часть эффекта обучения на всём датасете

OPD: обучение на одном примере восстанавливает основную часть эффекта обучения на всём датасете

On-policy дистилляция (OPD), способ дообучения языковой модели-«ученика», при котором она обучается на собственных сгенерированных ответах (rollouts), а более сильная модель-«учитель» даёт по каждому такому ответу плотную, токен за токеном, обратную связь. До сих пор исследования OPD в основном разбирали её алгоритмическую сторону, а роль самих обучающих данных оставалась непонятной. Новая работа Фу с соавторами, вторая в серии статей о переосмыслении OPD, проверяет крайний случай: что будет, если обучать «ученика» не на большом датасете, а на одном-единственном запросе.

Оказалось, что обучение на одном запросе продолжает улучшать модель сотни шагов подряд и восстанавливает основную, хотя и не всю, часть прироста качества, который даёт обучение на полном датасете, причём это работает в разных предметных областях и семействах моделей. Авторы объясняют эффект через «покрытие состояний», долю тех состояний (ситуаций, через которые модель проходит по ходу генерации ответа), которые встречаются при обучении на полном датасете и которые достигаются при обучении на меньшем наборе запросов. Один-единственный запрос уже даёт 71,5% такого покрытия, причём большая часть этого покрытия достигается в первые 100 шагов обучения. Если добавлять к нему новые, непохожие по смыслу запросы, покрытие состояний и точность на проверочных данных растут вместе, а на 16 таких разных запросах покрытие доходит до 98,9% и результат сравнивается с обучением на всём датасете.

При этом скорость, с которой «ученик» подстраивается под «учителя», от объёма данных почти не зависит: она одинаково медленно растёт что при обучении на одном запросе, что на всём датасете, а усвоение даже одного и того же, фиксированного набора состояний всё равно требует сотен шагов. Отсюда вывод, который авторы формулируют так: OPD «перекормлена данными, но недокормлена алгоритмом», собственные сгенерированные ответы модели очень быстро охватывают почти всё разнообразие ситуаций, нужных для обучения, а вот сам процесс усвоения учительской подсказки идёт медленно и от количества данных не ускоряется.

Результат про покрытие состояний работает и для варианта OPD сразу с несколькими «учителями» (в статье он называется MOPD): там 16 разных по смыслу запросов на каждую предметную область снова выводят результат на уровень обучения на полном датасете. В качестве дополнительной проверки авторы заменили реальные, содержательные запросы на обеднённые по содержанию шаблоны и на запросы не по теме задачи, взятые из открытого датасета реальных диалогов пользователей с чат-ботами WildChat. Оба варианта лишь приближаются к результату на настоящих, относящихся к делу запросах, но не дотягивают до него: содержание запроса и то, какое покрытие состояний оно порождает, могут расходиться.

Авторы надеются, что эти результаты развернут дальнейшие исследования OPD в сторону эффективности самого процесса обучения по шагам, а не сбора всё больших датасетов, и заставят заново разобраться, что на самом деле стоит за недавними успехами OPD в дообучении передовых моделей.

Ключевые факты

  • Одного-единственного обучающего запроса достаточно, чтобы модель-«ученик» прошла 71,5% состояний, которые она проходит при обучении на полном датасете, причём большая часть этого покрытия достигается уже за первые 100 шагов обучения.
  • 16 семантически разных запросов поднимают покрытие состояний до 98,9% и выводят точность на проверочных данных на уровень обучения на всём наборе данных, результат полного датасета фактически повторяется.
  • Скорость, с которой «ученик» подстраивается под «учителя», от объёма данных почти не зависит: она одинаково медленно растёт что на одном запросе, что на всём датасете, а усвоение даже фиксированного набора состояний в любом случае занимает сотни шагов, отсюда вывод авторов: OPD «перекормлена данными, но недокормлена алгоритмом».
  • Вывод про покрытие состояний переносится и на OPD сразу с несколькими «учителями» (MOPD): 16 разных по смыслу запросов на предметную область снова выводят результат на уровень обучения на полном датасете.
  • В стресс-тесте обеднённые по содержанию шаблоны запросов и запросы не по теме задачи (из открытого датасета диалогов WildChat) лишь приближаются к результату на настоящих, относящихся к делу запросах, но не дотягивают до него, содержание запроса и порождаемое им покрытие состояний могут расходиться.

Почему это важно

Работа переворачивает интуицию, на которой строится значительная часть дообучения языковых моделей: что качество on-policy дистилляции определяется прежде всего объёмом и разнообразием обучающих данных. Если один-единственный запрос уже даёт основную часть эффекта полного датасета, а узким местом оказывается не нехватка данных, а скорость самого алгоритма усвоения, то ресурсы, вложенные в сбор больших датасетов для OPD, вполне могли уходить не туда, куда стоило бы. Это меняет сам вопрос, который стоит задавать про недавние успехи OPD в дообучении передовых моделей: дело не в том, сколько данных было собрано, а в том, как быстро модель их усваивает.

Кому это важно

Тем, кто занимается дообучением и дистилляцией больших языковых моделей, исследовательским и инженерным командам, которые проектируют пайплайны обучения «ученика» на сигнале от более сильного «учителя». Важно и тем, кто отвечает за сбор и курирование обучающих датасетов для такого дообучения: результат прямо говорит, что ресурсы, потраченные на разнообразие и объём данных для OPD, во многих случаях можно сократить в пользу работы над самим алгоритмом обучения. Полезен результат и тем, кто занимается дистилляцией сразу от нескольких «учителей», вывод про покрытие состояний переносится и на такой вариант (в статье, MOPD).

Как это применить

Практический вывод: при построении пайплайна OPD не обязательно сразу собирать большой и разнообразный датасет запросов, можно начать с одного-двух десятков (в эксперименте, 16) семантически разных примеров и получить результат на уровне обучения на всём наборе данных. Ресурсы, которые раньше уходили на курирование датасета, стоит переносить на ускорение самого процесса усвоения моделью учительского сигнала, именно это, а не объём данных, оказалось узким местом. Стоит учитывать и ограничение из стресс-теста статьи: содержательные, по-настоящему относящиеся к задаче запросы работают лучше, чем обеднённые шаблоны или запросы не по теме (например, взятые из открытого датасета диалогов WildChat), поэтому подбор даже небольшого набора запросов имеет значение, это не «любые 16 случайных строк».

Можно ли доверять

Текст статьи не называет ни институтов, ни полного состава авторов (по метаданным известен только первый, Фу), ни статуса публикации (препринт это или прошедшая рецензирование статья, не указано), ни конкретных моделей, предметных областей или бенчмарков, всё это описано лишь обобщённо: «разные семейства моделей», «разные предметные области». Это ограничивает возможность независимо оценить, насколько результат воспроизводится на конкретных, реально используемых моделях. При этом сами цифры, 71,5% и 98,9% покрытия состояний, ровно 16 запросов, окно в 100 шагов, выглядят как результат выверенного контролируемого эксперимента, а сама работа заявлена как вторая в серии статей, целенаправленно разбирающих OPD, что говорит скорее о систематическом исследовании темы, чем о разовой находке. Тем не менее до независимого воспроизведения на других задачах и моделях к выводам стоит относиться как к сильной, но пока не перепроверенной эмпирической гипотезе.

Риски и подводные камни

Главная оговорка: сама статья говорит, что обучение на одном запросе восстанавливает БОЛЬШУЮ ЧАСТЬ, а не весь прирост качества от обучения на полном датасете, разрыв с полным датасетом остаётся. Второе, более существенное ограничение: скорость усвоения моделью сигнала от «учителя» от количества данных практически не зависит и остаётся такой же медленной (сотни шагов) даже на одном запросе, то есть подход экономит данные, но не ускоряет и не удешевляет сам процесс обучения по шагам. Третье: в стресс-тесте шаблонные и взятые не по теме запросы (из WildChat) лишь приближаются к результату на реальных релевантных запросах, но не дотягивают до него, значит подбор запросов всё ещё важен, и «любой один пример» не гарантирует такого же эффекта, как в эксперименте статьи. Наконец, обобщённые формулировки («семейства моделей», «предметные области») без конкретных названий не позволяют заранее сказать, на каких масштабах и типах моделей эффект сохранится.

«OPD перекормлена данными, но недокормлена алгоритмом.»

— авторы работы