Dust: предобучение трансформеров без обратного распространения ошибки
Авторы Samip Dahal, Bishwas Mandal, Serdar Gülbahar и Akshay Vegesna опубликовали на qlabs.sh исследовательскую работу 2026 года о методе Dust. Это алгоритм оптимизации нулевого порядка (zeroth-order): он оценивает градиент не через обратное распространение ошибки (backprop), а по тому, как меняются потери при случайных возмущениях. Авторы заявляют, что Dust, первый метод нулевого порядка, сопоставимый с backprop при предобучении трансформерных языковых моделей.
Механика такая. К выходу каждого линейного слоя добавляется гауссов шум, причём независимо на каждом токене. Затем делается один прямой проход, и шум каждого токена «вознаграждается» по изменению потерь на этом токене. Усреднённый по выборкам шум, взвешенный наградой, это оценка ошибки на выходе слоя, а её внешнее произведение со входом слоя даёт градиент весов. Для внутренностей внимания используется вариант схемы: их оценивают через ошибку на выходе внимания по текущим и будущим токенам, а не через потери токенов напрямую. Все веса модели обучаются так, кроме 2L остаточных смешивающих скаляров (L, число слоёв, по смыслу), которые обучаются обычными эволюционными стратегиями в пространстве весов.
Ключевая идея, «виртуальная популяция». Классические эволюционные стратегии (ES), например EGGROLL, оценивают одного члена популяции за прямой проход, а для каждого нужна своя возмущённая копия весов. Dust возмущает активации, то есть возмущает не веса, а скрытые состояния, поэтому каждый токен становится отдельным членом популяции. В последовательности трансформера несколько тысяч токенов, так что один прямой проход оценивает несколько тысяч членов на последовательность вместо одного. По описанию авторов, на современном трансформере это популяция как минимум на три порядка больше, чем у ES в пространстве весов.
Заявленные результаты. При большой популяции (то есть при существенно большем объёме вычислений) Dust близко приближает backprop, а в ряде настроек даже превосходит его; авторы осторожно пишут, что это намекает на возможность превзойти backprop в режиме с избытком вычислений. Начиная с 1 млн токенов, Dust, по оценке авторов на основе экстраполяций, примерно в 10^3, 10^4 раз эффективнее трансформерной реализации EGGROLL, одного из современных методов ES. Вопреки распространённому мнению, что методы нулевого порядка не масштабируются на большие сети, авторы обнаружили, что более крупные модели эффективнее используют популяцию: модель на 243 млн параметров при большинстве размеров популяции превосходит модель в 120 раз меньше. Оценки градиента Dust лучше совпадают с оценками backprop по мере роста популяции и остаются хорошо согласованными на всех проверенных масштабах, до 1 млрд токенов.
Авторы прямо ограничивают претензии: они не пытаются сделать метод достаточно экономичным по вычислениям, чтобы заменить backprop сегодня, и не обучают новые виды сетей, которые он делает доступными (например, сети с внешней программой в цикле или трансформеры, многократно прокручиваемые по шагам, для которых backprop through time плохо работает). Это оставлено на будущее. Мотивация, идея «горького урока» Саттона: общие методы, масштабируемые вычислениями, со временем побеждают; дифференцируемость и backprop могут быть хорошим смещением при малых вычислениях, но ограничивать пространство архитектур при больших. Доступный текст оборван, поэтому разделы с экспериментами и ограничениями здесь не пересказаны.
Ключевые факты
- Dust, метод нулевого порядка: добавляет гауссов шум к выходу каждого линейного слоя независимо на каждом токене и награждает шум по изменению потерь на этом токене.
- Каждый токен, член «виртуальной популяции», поэтому один прямой проход оценивает несколько тысяч членов на последовательность; по описанию авторов, это минимум на три порядка больше, чем у ES в пространстве весов.
- Заявлено: начиная с 1 млн токенов Dust примерно в 10^3, 10^4 раз эффективнее трансформерной реализации EGGROLL, по экстраполяциям авторов.
- Крупные модели эффективнее используют популяцию: модель на 243 млн параметров при большинстве размеров популяции превосходит модель в 120 раз меньше.
- Авторы не претендуют на замену backprop сегодня: метод пока не сделан достаточно экономичным по вычислениям.
Почему это важно
Backprop, основа обучения современных нейросетей, и вокруг него выросли архитектуры, оптимизаторы и оборудование. Авторы Dust предлагают альтернативу на основе перебора и утверждают, что она сопоставима с backprop при предобучении трансформеров. Отдельно любопытно заявленное наблюдение, что чем больше модель, тем эффективнее она использует популяцию, это противоречит распространённому мнению, что методы нулевого порядка плохо масштабируются. Все эти выводы принадлежат авторам работы.
Кому это важно
В первую очередь исследователям оптимизации и обучения нейросетей: эволюционным стратегиям, методам без градиентов, поиску альтернатив backprop. Также тем, кто думает об архитектурах, которые трудно обучать обратным распространением, авторы упоминают сети с внешней программой в цикле и трансформеры, многократно прокручиваемые по шагам, но сами их пока не обучали.
Как это применить
Для практического обучения моделей метод пока не предназначен: авторы прямо пишут, что не пытаются сделать его достаточно экономичным по вычислениям, чтобы заменить backprop уже сегодня. Это основание для дальнейших исследований. Видимая часть текста не содержит сведений о цене, оборудовании или готовом коде, поэтому судить о воспроизводимости по ней нельзя.
Можно ли доверять
Это авторская исследовательская заметка с описанием метода; в доступном тексте нет упоминаний о рецензировании, независимом воспроизведении или внешних откликах. Организация авторов в видимом тексте не указана. Главное число, выигрыш в 10^3, 10^4 раз над EGGROLL, основано на экстраполяциях, а не на прямых измерениях в таком масштабе. Утверждения «сопоставим с backprop» и «в ряде настроек превосходит» в видимой части приведены без цифр (потери, перплексия, объём вычислений). Текст источника оборван, разделы с экспериментами и ограничениями в пересказ не попали.
Риски и подводные камни
Заявленное превосходство над backprop относится к режиму большой популяции, то есть к существенно большему объёму вычислений, и сами авторы формулируют вывод осторожно, «намекает». Эффективность относительно EGGROLL оценена по экстраполяции, а согласованность градиентов проверена до 1 млрд токенов. Неясно, как метод проявит себя за пределами протестированных масштабов. Вне работы остаются и новые виды сетей, ради которых затевается подход: их обучение авторы оставили на будущее.
«Мы не пытаемся сделать его достаточно эффективным по вычислениям, чтобы заменить backprop уже сегодня.»
— авторы Dust (Dahal, Mandal, Gülbahar, Vegesna)