LoopOPD: зацикленная языковая модель учит сама себя на математике
Статья на arXiv посвящена зацикленным языковым моделям (Looped Language Models, LoopLM). Они повторно используют одни и те же общие параметры на нескольких рекуррентных шагах вычислений, и авторы называют это экономным по числу параметров способом масштабировать способность к рассуждению. Однако дообучать такие модели после предобучения, по словам авторов, остаётся трудно. Существующие подходы либо опираются на награду, которая редкая или дорого распространяется на все циклы, либо требуют внешних учителей или привилегированной информации. Из-за этого учителей мало, а контекст учителя и ученика не совпадает.
Чтобы обойти эти ограничения, авторы вводят LoopOPD, фреймворк дистилляции между циклами на собственных траекториях ученика (on-policy distillation). Идея в том, что дополнительные рекуррентные вычисления внутри самой модели становятся источником обучающего сигнала. Замороженная политика последнего (терминального) цикла работает как учитель, которому доступно больше вычислений, а ученик, это промежуточный цикл. Обучение идёт на прогонах, которые генерирует сам ученик. Так получается плотный обучающий сигнал без внешнего учителя и без привилегированной информации.
Вторая часть работы, Dynamic LoopOPD (D-LoopOPD). Здесь учитель из последнего цикла постоянно обновляется по мере изменения общих параметров модели. Именно это, по формулировке авторов, обеспечивает рекуррентное самоулучшение.
На теоретическом уровне авторы описывают, как обновления от дистилляции распространяются по глубинам циклов, и выводят достаточные условия, при которых один шаг обновления даёт одновременное локальное улучшение на обеих глубинах.
На моделях Ouro-Thinking, как сообщают авторы, LoopOPD улучшает математическое рассуждение, а D-LoopOPD даёт дополнительный прирост за счёт динамического обновления учителя. Хотя обучение шло только на математических данных, полученные модели, по заявлению авторов, также стали лучше на бенчмарках общего рассуждения и генерации кода. Из этого авторы делают вывод, что рекуррентные вычисления могут быть эффективным источником обучающего сигнала для LoopLM. Код и контрольные точки моделей обещаны после принятия статьи, пока они не опубликованы. В тексте аннотации нет численных результатов: ни точности, ни названий бенчмарков, ни размера прироста.
Ключевые факты
- LoopOPD: у зацикленной языковой модели замороженный итоговый цикл служит учителем для промежуточного цикла-ученика, обучение идёт на прогонах самого ученика.
- Внешний учитель и привилегированная информация не нужны: сигнал плотный и берётся из дополнительных рекуррентных вычислений внутри модели.
- D-LoopOPD постоянно обновляет учителя из итогового цикла по мере изменения общих параметров, что авторы называют рекуррентным самоулучшением.
- Авторы выводят достаточные условия, при которых один шаг обновления одновременно локально улучшает модель на двух глубинах циклов.
- На Ouro-Thinking улучшилось математическое рассуждение; при обучении только на математике, по заявлению авторов, выросли и результаты по общему рассуждению и коду. Код и чекпоинты обещаны после принятия статьи.
Почему это важно
Зацикленные модели получают качество рассуждения за счёт повторных вычислений на общих параметрах, а не за счёт роста числа параметров. Для них, как пишут авторы, нет удобного способа дообучения: награда редкая, а внешние учителя ограничены. LoopOPD предлагает использовать саму модель с большим числом циклов как учителя для себя же с меньшим числом циклов. Это попытка превратить дополнительные вычисления в обучающий сигнал без внешних данных и моделей.
Кому это важно
Исследователям, которые занимаются рекуррентными и зацикленными архитектурами, дистилляцией на собственных траекториях и дообучением моделей рассуждения. Практикам, которых интересуют модели с экономным числом параметров, тоже стоит присмотреться, но пока это препринт без опубликованного кода.
Как это применить
Сейчас применить метод напрямую нельзя: код и контрольные точки моделей авторы обещают выпустить после принятия статьи. Пока можно использовать идею как ориентир: ученик, промежуточный цикл, учитель, замороженный итоговый цикл той же модели, обучение на траекториях ученика. Для D-LoopOPD учителя нужно периодически обновлять вместе с общими параметрами.
Можно ли доверять
Это препринт на arXiv, судя по тексту, ещё до принятия в журнал или на конференцию. Все утверждения о приросте исходят от самих авторов. В аннотации нет численных результатов, названий бенчмарков и размеров использованных моделей Ouro-Thinking, поэтому масштаб улучшений оценить нельзя. Заявление о переносе с математики на общее рассуждение и код также стоит проверять на полном тексте и по воспроизведённым результатам.
Риски и подводные камни
Теоретические условия в работе названы достаточными, а не необходимыми, и гарантируют лишь локальное улучшение после одного обновления. Для динамического учителя надо следить, чтобы его обновление шло вместе с общими параметрами, как задумано в D-LoopOPD. Метод проверен на моделях Ouro-Thinking с математическими данными; на других семействах зацикленных моделей и других задачах результат неизвестен.
«Рекуррентные вычисления могут служить эффективным источником обучающего сигнала для LoopLM.»
— из аннотации статьи на arXiv