Учёные вывели законы масштабирования для гиперсетей, внедряющих знания в языковые модели

Учёные вывели законы масштабирования для гиперсетей, внедряющих знания в языковые модели

Надёжно и предсказуемо добавлять в языковую модель новые факты в промышленных масштабах, до сих пор открытая проблема. Один из подходов, гиперсети: нейросети, которые не решают задачу сами, а генерируют веса для другой, целевой сети. Обычно гиперсети применяют для адаптации модели уже после обучения, «на лету», при её использовании. Нисчай Дханкхар с соавторами исследовали менее изученный сценарий, внедрение знаний прямо на этапе обучения: гиперсеть обучают на большом корпусе фактов так, чтобы она сгенерировала один фиксированный LoRA-адаптер (LoRA, способ дообучения через компактные матрицы низкого ранга, добавляемые поверх исходной модели); после того как этот адаптер вставлен в целевую модель, она начинает отвечать на вопросы по фактам из корпуса.

Главный вопрос статьи, не «работает ли это в принципе», а как способность гиперсети внедрять знания меняется с масштабом: раньше законы масштабирования для самих гиперсетей никто строго не выводил. Чтобы это стало возможно, авторы специально отделили «ёмкость» гиперсети, то, сколько фактов и как хорошо она способна внедрить, от общих способностей целевой модели, в которую вставляется адаптер: иначе было бы невозможно понять, что именно меняется при увеличении архитектуры.

Для экспериментов такого масштаба потребовался соответствующий датасет, авторы построили MegaWikiQA: десятки миллионов многошаговых вопросно-ответных примеров (ответ требует связать несколько фактов) по 39 тематическим областям, собранных на основе Wikidata5M.

На этом датасете авторы измерили, как функция потерь, точность рассуждений и обобщение за пределами обучающего распределения (OOD) меняются в зависимости от трёх архитектурных параметров: глубины гиперсети, её ширины и размера целевой модели. Первый результат: качество внедрения знаний растёт по предсказуемым степенным законам масштабирования вдоль всех трёх осей, по нескольким запускам разного размера можно математически предсказать, как поведёт себя гиперсеть большего размера, ещё до того, как её обучили.

Второй результат: с ростом масштаба гиперсети стабильно улучшают OOD-обобщение, причём быстрее, с более крутым показателем степени в законе масштабирования, чем стандартные методы того же назначения: дообучение LoRA и полное дообучение модели. Отсюда вывод авторов: гиперсети, перспективная и хорошо масштабируемая альтернатива этим методам для внедрения фактов на этапе обучения, а полученные законы масштабирования, первый эмпирически обоснованный ориентир для проектирования таких гиперсетей под задачи фактологических рассуждений в языковых моделях.

Ключевые факты

  • Гиперсеть обучают на большом корпусе фактов, чтобы она сгенерировала один фиксированный LoRA-адаптер; вставленный в целевую языковую модель, этот адаптер позволяет ей отвечать на вопросы по этому корпусу, это внедрение знаний на этапе обучения, а не привычная для гиперсетей адаптация «на лету» после обучения.
  • Для экспериментов авторы собрали новый датасет MegaWikiQA: десятки миллионов многошаговых вопросно-ответных примеров по 39 тематическим областям, построенных на основе Wikidata5M.
  • Впервые строго изучено, как функция потерь, точность рассуждений и обобщение за пределами обучающего распределения меняются в зависимости от глубины и ширины гиперсети и от размера целевой модели.
  • Качество внедрения знаний растёт по предсказуемым степенным законам масштабирования вдоль всех архитектурных осей, глубины и ширины гиперсети и размера целевой модели.
  • С ростом масштаба обобщение за пределами обучающего распределения у гиперсетей улучшается быстрее (более крутой показатель степени в законе масштабирования), чем у стандартного дообучения LoRA или полного дообучения модели, авторы называют это перспективной альтернативой этим методам.

Почему это важно

Надёжно и предсказуемо добавлять в языковую модель новые факты в промышленных масштабах, до сих пор открытая проблема: обычное дообучение и дообучение через LoRA-адаптеры плохо изучены с точки зрения масштабирования. Нисчай Дханкхар с соавторами впервые строго исследовали, как ведут себя гиперсети, сети, которые сами генерируют веса для другой сети, если использовать их не для адаптации модели «на лету» после обучения, а для внедрения фактов прямо на этапе обучения. Раньше поведение гиперсетей при масштабировании вообще не изучалось; в этой работе для них впервые выведены степенные законы масштабирования, предсказуемые математические зависимости качества от размера архитектуры, по аналогии с законами масштабирования, которые в своё время объяснили, почему рост размера самих языковых моделей стабильно улучшает их качество.

Кому это важно

Исследователям и инженерам, которые занимаются обновлением фактических знаний модели без полного переобучения, разработчикам эффективных методов дообучения вроде LoRA и их альтернатив, командам, которые проектируют инфраструктуру для генерации адаптеров под конкретные корпуса фактов, и учёным, изучающим законы масштабирования архитектур ИИ за пределами самих больших языковых моделей.

Как это применить

Схема из статьи такая: берётся большой корпус фактов, на нём обучается гиперсеть, которая на выходе выдаёт один фиксированный LoRA-адаптер; этот адаптер вставляется в целевую языковую модель, и модель начинает отвечать на вопросы по фактам из корпуса без полного дообучения себя самой. Авторы вывели степенные законы масштабирования по глубине и ширине гиперсети и по размеру целевой модели, поэтому инженеры получают ориентир для проектирования: по этим законам можно заранее прикинуть, какого размера гиперсеть даст нужное качество и обобщение, вместо того чтобы подбирать архитектуру перебором. Источник не говорит о публикации кода, обученных весов или датасета MegaWikiQA в открытом доступе, судить о готовности схемы к практическому воспроизведению можно будет только по такой публикации, если она появится.

Можно ли доверять

Работа выглядит методологически аккуратной: чтобы получить именно законы масштабирования, а не разовый результат, авторы намеренно развязали ёмкость гиперсети и возможности целевой модели, иначе было бы неясно, что именно улучшается при росте архитектуры, и построили под задачу отдельный крупный датасет MegaWikiQA: десятки миллионов многошаговых вопросно-ответных примеров по 39 тематическим областям на основе Wikidata5M, а не одну-две демонстрационные метрики. Проверяли не только точность на знакомых фактах, но и обобщение за пределами обучающего распределения, более строгий тест, чем просто заучивание корпуса. Источник не сообщает, прошла ли статья независимое рецензирование и где именно она опубликована; судя по формату страницы (huggingface.co/papers), это, вероятнее всего, препринт, и к результатам стоит относиться как к первому эмпирическому шагу, который ждёт независимого повторения другими группами, а не как к окончательно устоявшемуся факту.

Риски и подводные камни

Все выводы получены на датасете MegaWikiQA, который сами же авторы построили на основе Wikidata5M, это структурированная база фактов, и неизвестно, перенесутся ли законы масштабирования и качество обобщения на неструктурированные, «грязные» реальные корпуса знаний за пределами вопросно-ответного формата. LoRA-адаптер, который генерирует гиперсеть, фиксированный: судя по описанной схеме, чтобы обновить или добавить факты, нужно заново обучать гиперсеть и генерировать новый адаптер, а не редактировать знания «на лету». Наконец, это ранняя академическая работа, а не готовый инструмент: прежде чем полагаться на неё в реальных задачах внедрения знаний, стоит дождаться независимых воспроизведений и проверки на других семействах моделей и типах фактов, а не только на вопросах в стиле MegaWikiQA.

«В совокупности эти результаты показывают, что гиперсети, принципиально обоснованная и масштабируемая основа для адаптации моделей на этапе обучения, и задают первые эмпирически обоснованные законы масштабирования, которые можно использовать при проектировании гиперсетей для фактологических рассуждений в больших языковых моделях.»

— авторы статьи «Scaling Laws for Hypernetwork-Based Knowledge Injection in Large Language Models»