FPO, метод дообучения LLM без обратного прохода: ускорение в 2.7, 3.2 раза при экономии памяти

Исследователи предложили Forward-Pass-Only MLP training (FPO), способ доменной адаптации больших языковых моделей, который обходится без обратного прохода через тело сети. В основе метода наблюдение: на поздних слоях трансформера ошибка предсказания на выходном слое достаточно точно приближает истинный градиент, косинусное сходство между ними составляет 0.47, 0.59 при проверке на шести открытых моделях. Опираясь на это, авторы вычисляют единственный сигнал ошибки на выходе и применяют его напрямую к каждому целевому слою; сигнал не передаётся между слоями, и граф автоматического дифференцирования вообще не строится. Чтобы понять, на каких слоях конкретной модели такой подход сработает, авторы предлагают двухминутную диагностику для любой модели.

По сравнению со стандартным полным дообучением FPO даёт пропускную способность в 2.7, 3.2 раза выше при снижении пикового потребления памяти на обучении примерно на 40%. На трёх открытых семействах моделей, OLMo-2-7B, Qwen3-8B и Falcon3-7B, метод улучшает перплексию внутри целевого домена и при этом держит результаты на MMLU, ARC-Challenge, HellaSwag и Winogrande в пределах шумовой погрешности случайного seed относительно базовой модели; полное дообучение такую устойчивость на посторонних задачах стабильно не обеспечивает. Альтернативный вариант, обычный SFT, локализованный на тех же целевых слоях, тоже выходит на этот режим, но требует в 2.2 раза больше времени по сравнению с FPO.

Ключевые факты

  • FPO дообучает LLM только прямым проходом, без обратного прохода через тело модели и без построения графа автодифференцирования.
  • Пропускная способность обучения выше в 2.7, 3.2 раза, а пиковая память ниже примерно на 40% относительно стандартного дообучения.
  • В основе метода, наблюдение, что на поздних слоях трансформера ошибка выходного слоя приближает истинный градиент: косинусное сходство 0.47, 0.59 на шести открытых моделях.
  • На трёх моделях (OLMo-2-7B, Qwen3-8B, Falcon3-7B) FPO улучшает перплексию внутри домена и держит MMLU, ARC-Challenge, HellaSwag и Winogrande в пределах шумовой погрешности seed.
  • Локализованный на тех же слоях обычный SFT достигает похожего режима, но работает в 2.2 раза дольше, чем FPO.

Почему это важно

Дообучение больших языковых моделей обычно требует полного обратного прохода через сеть, это дорого по памяти и по времени. FPO показывает, что для доменной адаптации может быть достаточно прямого прохода: ошибка предсказания на выходном слое хорошо приближает истинный градиент на поздних слоях трансформера (косинусное сходство 0.47, 0.59 при проверке на шести открытых моделях). Значимость подхода, принципиально иная, более дешёвая схема обучения, которая при этом не проседает по качеству на посторонних задачах: свойство, которое стандартное полное дообучение стабильно не гарантирует.

Кому это важно

Инженерам и командам, которые дообучают открытые LLM под свой домен при ограниченных ресурсах GPU, и исследователям эффективного обучения моделей. Метод проверен на трёх открытых моделях уровня 7, 8 млрд параметров, OLMo-2-7B, Qwen3-8B, Falcon3-7B, то есть ориентирован в первую очередь на тех, кто работает с открытыми весами, а не только с закрытыми API.

Как это применить

FPO вычисляет единственный сигнал ошибки на выходе модели и применяет его к каждому целевому слою по отдельности, без передачи сигнала между слоями и без построения графа автоматического дифференцирования. Авторы также предлагают двухминутную диагностику, которая для любой модели показывает, на каких поздних слоях такая адаптация вообще сработает. По сравнению со стандартным дообучением FPO даёт пропускную способность в 2.7, 3.2 раза выше при снижении пикового потребления памяти на обучении примерно на 40%. Альтернатива, обычный SFT, локализованный на тех же целевых слоях: она тоже выходит на нужный режим, но требует в 2.2 раза больше времени по сравнению с FPO.

Можно ли доверять

Заявления подкреплены измерениями на трёх открытых семействах моделей, OLMo-2-7B, Qwen3-8B, Falcon3-7B: FPO улучшает перплексию внутри целевого домена и удерживает результаты на MMLU, ARC-Challenge, HellaSwag и Winogrande в пределах шумовой погрешности разброса по случайным seed относительно базовой модели, тогда как для полного дообучения такая устойчивость не гарантирована. Конкретные числовые значения перплексии и бенчмарков в тексте не приведены, указано только направление изменения. Также не названы авторы и институты работы и не перечислены шесть моделей, использованных для проверки косинусного сходства, на которой обоснован сам метод.

Риски и подводные камни

Метод опирается на приближение, а не на точный градиент: косинусное сходство 0.47, 0.59 показывает лишь частичное совпадение с истинным градиентом, и именно поэтому нужна отдельная диагностика, на части слоёв и моделей приближение может не сработать. Понятие «в пределах шумовой погрешности seed» количественно не определено, что затрудняет независимую оценку выигрыша в качестве. Результаты получены на моделях масштаба 7, 8 млрд параметров, перенос выводов на другие масштабы в тексте не проверялся.