Дропаут слоёв экономит до 25% вычислений при обучении LLM и ускоряет вывод в 1,5 раза

Дропаут слоёв (layer dropout, он же stochastic depth), техника, которая раньше повышала точность и устойчивость трансформеров к прунингу, но по мере роста моделей и датасетов почти исчезла из практик предобучения больших языковых моделей (LLM). Часть прежних работ сообщала, что дропаут может ухудшать точность, но ни одно исследование не измеряло этот эффект всесторонне и не пыталось его смягчить.
Авторы новой работы утверждают, что дропаут слоёв, наоборот, стоит применять в современном обучении LLM, и формулируют для этого практические рекомендации и анализ масштабирования, как для самого обучения, так и для этапа после него. При правильно подобранном распределении слоёв, временном расписании применения дропаута и гиперпараметрах оптимизатора при тех же вычислительных затратах (FLOPs) дропаут слоёв даёт более низкую функцию потерь. При фиксированном числе шагов обучения модели достигают такого же или более низкого validation loss, экономя при этом до 25% FLOPs обучения.
Кроме того, дропаут слоёв на этапе обучения открывает возможности для оптимизаций на инференсе: ранний выход (early exit), пропуск промежуточных слоёв и self-speculative decoding. Вместе они дают ускорение вывода до 1,5 раза при незначительной потере точности.
Выводы проверены на более чем 2400 экспериментах с моделями от 271 млн до 8,2 млрд параметров и датасетами объёмом до 160 млрд токенов, авторы показывают, что результаты надёжно переносятся на крупномасштабные режимы обучения. Всё предобучение проводилось на системах Cerebras CS-3.
Ключевые факты
- Дропаут слоёв (stochastic depth) годами выпадал из практик предобучения LLM по мере роста моделей и датасетов, хотя раньше повышал точность и устойчивость к прунингу.
- При правильном подборе распределения слоёв, временного расписания и гиперпараметров оптимизатора дропаут слоёв при тех же вычислительных затратах (FLOPs) снижает функцию потерь.
- При фиксированном числе шагов обучения модели достигают такого же или более низкого validation loss, экономя до 25% FLOPs обучения.
- После обучения дропаут слоёв позволяет применять ранний выход, пропуск промежуточных слоёв и self-speculative decoding, ускоряя вывод до 1,5 раза почти без потери точности.
- Выводы проверены на более чем 2400 экспериментах с моделями от 271 млн до 8,2 млрд параметров и датасетами до 160 млрд токенов; всё предобучение шло на системах Cerebras CS-3.
Почему это важно
Дропаут слоёв, не новая идея: она уже показывала более быстрое обучение, более высокую точность и устойчивость к прунингу слоёв «на лету» в языковых и визуальных трансформерах. Но с ростом моделей и датасетов эта техника, особенно на уровне слоёв, практически исчезла из рецептов предобучения LLM, отчасти из-за сообщений о том, что дропаут может ухудшать точность, хотя это никто всесторонне не измерял. Новая работа впервые системно показывает, что при правильной настройке дропаут слоёв не только не вредит, а при тех же вычислительных затратах даёт более низкую функцию потерь и экономит до 25% FLOPs обучения при сопоставимом качестве.
Кому это важно
Прежде всего, командам, которые предобучают большие языковые модели с нуля и считают каждый процент вычислительного бюджета: экономия до 25% FLOPs при том же или лучшем качестве напрямую снижает стоимость обучения. Также это важно для тех, кто занимается ускорением инференса: дропаут слоёв, заложенный на этапе обучения, открывает доступ к техникам вроде раннего выхода и self-speculative decoding, которые дают до 1,5 раза более быстрый вывод.
Как это применить
Ключ, не просто «включить дропаут», а подобрать три параметра: распределение вероятности дропаута по слоям, временное расписание его применения в ходе обучения и гиперпараметры оптимизатора. При такой настройке дропаут слоёв на предобучении становится основой для последующих оптимизаций инференса, раннего выхода, пропуска промежуточных слоёв и self-speculative decoding, которые вместе дают ускорение вывода до 1,5 раза при незначительной потере точности.
Можно ли доверять
Масштаб проверки внушительный: более 2400 экспериментов, модели от 271 млн до 8,2 млрд параметров, датасеты объёмом до 160 млрд токенов, всё предобучение, на системах Cerebras CS-3. Такой охват по размерам моделей и данных, сильный аргумент за то, что результаты не случайность на одной конфигурации. При этом в доступном тексте работы не указаны ни авторский коллектив целиком, ни место публикации или дата, судить о статусе рецензирования по нему нельзя.
Риски и подводные камни
Заявленные выгоды, «до 25%» экономии FLOPs и «до 1,5 раза» ускорения инференса, это верхние границы при оптимально подобранных параметрах, а не гарантированный результат при любой конфигурации: распределение дропаута по слоям, расписание и гиперпараметры оптимизатора нужно подбирать отдельно. Работа описана только по аннотации на HuggingFace Papers, без указания полного состава авторов, организаций и издания, независимая оценка методологии по этим данным ограничена.