NoRA: нормализация LoRA ускоряет дообучение нейросетей без лишних параметров

NoRA: нормализация LoRA ускоряет дообучение нейросетей без лишних параметров

LoRA (Low-Rank Adaptation, низкоранговая адаптация), распространённый способ дообучать большие модели без изменения всех их весов: к слоям добавляют две небольшие матрицы, матрицу сжатия (down-projection) и матрицу разжатия (up-projection), а обучают только их. По стандарту матрицу разжатия инициализируют нулями, поэтому на старте обучения поведение всей адаптации определяет почти исключительно матрица сжатия, чей масштаб и распределение при этом никак не регулируются.

Автор статьи Цзяле Кан (Jiale Kang) с соавторами предложил метод Normalized Low-Rank Adaptation (NoRA), нормализацию матрицы сжатия в процессе обучения. Дополнительно показано, что ту же нормализацию можно применить один раз, только при инициализации весов, и это уже улучшает обычный LoRA без необходимости нормализовать матрицу на каждом шаге обучения.

По утверждению авторов, в экспериментах на предобучении (pretraining), контролируемом дообучении (supervised finetuning) и обучении с подкреплением (reinforcement learning) NoRA стабильно ускоряет сходимость, повышает итоговое качество и стабильность обучения, а также смягчает катастрофическое забывание, потерю моделью ранее выученных навыков при дообучении на новых данных. При этом метод не требует ни дополнительных обучаемых параметров, ни дополнительных вычислений на этапе инференса (применения уже обученной модели), то есть теоретически встраивается в существующие пайплайны с LoRA без дополнительных издержек.

Конкретных цифр, насколько именно ускоряется сходимость, на сколько улучшается качество, на каких моделях, датасетах и с каким рангом адаптации ставились эксперименты, в тексте статьи не приведено; нет там и сравнения с другими улучшениями LoRA, кроме базового варианта, а также сведений о принадлежности авторов к организациям и о публикации кода.

Ключевые факты

  • LoRA дообучает модели через две матрицы; матрицу разжатия инициализируют нулём, поэтому на старте обучения всё определяет матрица сжатия.
  • NoRA нормализует матрицу сжатия во время обучения, простое дополнение к LoRA.
  • Ту же нормализацию можно применить один раз, только при инициализации, и это уже улучшает обычный LoRA.
  • По заявлению авторов, метод проверен на предобучении, дообучении и обучении с подкреплением: ускоряет сходимость, повышает качество и стабильность, снижает катастрофическое забывание.
  • Метод не добавляет ни обучаемых параметров, ни вычислений при инференсе.

Почему это важно

LoRA, один из самых массово используемых способов дообучать большие модели за разумные деньги, но динамика его обучения до сих пор изучена слабо: матрица разжатия стартует с нуля, а масштаб матрицы сжатия никак не регулируется, из-за чего результат может зависеть от случайности инициализации. NoRA закрывает конкретный пробел, регуляризацию через нормализацию, не увеличивая при этом стоимость метода.

Кому это важно

Инженерам и исследователям, которые дообучают большие языковые и другие модели методом LoRA, особенно там, где важны предсказуемая сходимость и устойчивость к катастрофическому забыванию при ограниченном бюджете на обучение.

Как это применить

NoRA описана как надстройка над стандартным LoRA: нормализация матрицы сжатия, либо один раз при инициализации весов, либо на протяжении всего обучения. По словам авторов, она не требует новых параметров или дополнительных вычислений при инференсе, то есть в теории заменяет обычный LoRA без издержек. Но в тексте статьи нет ни кода, ни выпущенных моделей, ни названий конкретных моделей и датасетов, на которых ставились эксперименты, поэтому оценить порог внедрения на практике пока нельзя.

Можно ли доверять

Материал, статья (paper), опубликованная на Hugging Face Papers. В доступном тексте нет ни принадлежности авторов к организациям, ни единой числовой оценки эффекта, ни ссылок на код или воспроизведение, все выводы о преимуществах NoRA приведены только словесно, со слов самих авторов.

Риски и подводные камни

Заявления об ускорении сходимости, росте качества и снижении забывания не подкреплены ни одной цифрой и не сопоставлены ни с чем, кроме базового LoRA, других улучшений LoRA авторы для сравнения не приводят. Без опубликованного кода, конкретных моделей и датасетов и независимой проверки судить о реальном масштабе выигрыша и применимости метода в конкретных задачах преждевременно.