Метод GapFT учит Llama-3.1-8B решать с первой попытки то, что удаётся за K
Авторы препринта на arXiv исходят из того, что при обучении с подкреплением на проверяемых наградах (RLVR) есть точный верификатор ответов. Его можно использовать и на этапе применения: сгенерировать несколько ответов и выбрать тот, что прошёл проверку. Другие системы вместо этого применяют лучевой поиск (beam search), адаптивную выборку или внешние инструменты. Авторы спрашивают, можно ли «впитать» такое поведение, которое проявляется только при поиске, прямо в модель, чтобы она отвечала с одной попытки, без поиска.
По их наблюдению, распространённые рецепты дообучения на проверенных ответах обычно не различают два типа задач: те, что модель уже решает с первой попытки, и те, что она проваливает, но решает в пределах K попыток. При фиксированном бюджете это может тратить обучающие примеры на повторение поведения, которым развёрнутая модель уже обладает.
Метод GapFT выбирает обучающие данные по результату исходной контрольной точки при одной попытке и дообучает модель на разрыве между Pass@K и Pass@1: на задачах, которые модель не решает с одного раза, но решает за K попыток. Число обучающих примеров, обработанных токенов и шагов оптимизатора приравнено к базовым вариантам, а целевая функция не меняется. Бюджет заполняется «восстановленными» неудачами. Кроме того, авторы используют точное разложение, которое позволяет отличить исправления восстановленных и пропущенных неудач от регрессий на задачах, успешно решённых с первой попытки.
Результаты для Llama-3.1-8B на логических задачах LogiQA 2.0 и ReClor: GapFT повышает Pass@1 на 14,4 и 13,9 пункта соответственно по сравнению с исходной моделью, превосходит равный по бюджету обычный RFT на проверенных ответах (дообучение с отбором проверенных ответов) при той же скорости обучения и догоняет дообучение на всём пуле проверенных данных, используя треть данных. Одиночный вывод модели после GapFT по точности равен результату исходной модели с выбором ответа верификатором при Pass@4.
Рандомизированный контрольный эксперимент, по словам авторов, объясняет выигрыш покрытием различных неудач. Их анализ связывает достижимый выигрыш с «переносимой опорой неудач» (transferable failure support). Трёхкратное (по трём seed) воспроизведение на Qwen2.5-7B сохраняет положительный выигрыш относительно обычного RFT на обеих логических задачах.
Ключевые факты
- GapFT дообучает модель только на задачах, которые она не решает с одной попытки, но решает в пределах K попыток (разрыв Pass@K и Pass@1).
- На Llama-3.1-8B Pass@1 вырос на 14,4 пункта на LogiQA 2.0 и на 13,9 пункта на ReClor по сравнению с исходной моделью.
- Метод сопоставим с дообучением на всём пуле проверенных данных, но использует треть данных.
- Одиночный вывод модели после GapFT по точности равен результату исходной модели с выбором ответа верификатором при Pass@4.
- Воспроизведение на Qwen2.5-7B (три seed) сохраняет положительный выигрыш над обычным RFT на обеих задачах.
Почему это важно
Часть улучшений качества получают за счёт поиска на этапе применения: генерируют несколько ответов и выбирают проверенный. Это дороже, чем одиночный ответ. Работа предлагает перенести пользу такого поиска внутрь самой модели, чтобы одна попытка давала результат, близкий к выбору верификатором из нескольких. По заявлению авторов, одиночный вывод после GapFT равен исходной модели с верификатором при Pass@4.
Кому это важно
Исследователям и инженерам, которые дообучают модели на проверенных ответах (RFT, RLVR) и работают с ограниченным бюджетом обучающих примеров. Также тем, кто применяет модели с одной попыткой на запрос и не может позволить себе поиск или многократную выборку при применении.
Как это применить
Идея в общих чертах такая: сначала измерить, какие задачи исходная контрольная точка решает с первой попытки, а какие проваливает, но решает в пределах K попыток, и построить обучающую выборку из вторых. Число примеров, токенов и шагов оптимизатора при этом держат равным базовому варианту, целевую функцию не меняют. Значение K, использованное при обучении, в тексте аннотации не указано. О выпуске кода или моделей в тексте также не сказано.
Можно ли доверять
Это препринт на arXiv, и все цифры взяты из аннотации; независимой проверки в тексте нет. Авторы сравнивают метод с обычным RFT при равном бюджете и приводят рандомизированный контроль и воспроизведение на второй модели (Qwen2.5-7B, три seed). Однако в аннотации даны только приросты в пунктах, без абсолютных значений Pass@1; размер выигрыша на Qwen2.5-7B и над обычным RFT в пунктах не назван.
Риски и подводные камни
Результаты относятся к двум логическим задачам (LogiQA 2.0 и ReClor) и двум моделям (Llama-3.1-8B и Qwen2.5-7B); в аннотации нет результатов для других областей, например математики или программирования. Сами авторы связывают доступный выигрыш с переносимой опорой неудач, то есть польза зависит от того, насколько восстановленные неудачи переносятся на другие задачи. Метод требует точного верификатора, чтобы определить, какие ответы верны.