Учёные раскрыли физику мультимодального предобучения ИИ

Учёные раскрыли физику мультимодального предобучения ИИ

Junlin Han с соавторами провели систематическое эмпирическое исследование того, как устроено совместное, «мультимодальное», предобучение моделей ИИ, которые одновременно работают с текстом и изображениями. Индустрия всё активнее строит архитектуры, объединяющие модальности с нуля, но то, как модальности взаимодействуют друг с другом внутри такого обучения, до этой работы было изучено слабо. Авторы поставили контролируемые эксперименты и на синтетических, и на крупных данных из реального мира и получили четыре вывода, которые сами назвали «физикой» мультимодального предобучения.

Первый вывод, Knowledge Flow (поток знаний): авторы разобрали по отдельности, как язык, понимание изображений и генерация изображений передают знания друг другу, и показали, что это влияние асимметрично, модальности воздействуют друг на друга по-разному, а не в равной мере в обе стороны.

Второй вывод, Synergy vs. Competition (синергия против конкуренции): усиливают ли модальности друг друга или, наоборот, мешают друг другу, в основном определяется «сложностью» данных. Авторы нашли и архитектурные решения, которые способствуют синергии, например, общие слои внимания и нормализации при отдельных, специфичных для каждой модальности слоях прямого распространения (feed-forward). Эта закономерность сохраняется при разных конструкциях визуального токенизатора.

Третий вывод, Early Unification (раннее объединение): объединять модальности с самых первых шагов обучения и обучать их совместно эффективнее, чем выравнивать их позже или обучать последовательно. При позднем объединении авторы обнаружили эффект, который называют vision laziness (зрительная лень): модель начинает полагаться на языковые априорные представления (priors) вместо того, чтобы полноценно использовать визуальную информацию.

Четвёртый вывод, Recipes (рецепты): опираясь на первые три вывода, авторы вывели экономичные рецепты предобучения, которые дают сильные результаты в генерации, используя всего 5% вычислительного бюджета полноценного обучения. Эти базовые выводы затем проверили на масштабе: команда обучила несколько MoE-моделей («смесь экспертов») с 13,5 млрд параметров на 2 трлн токенов, и результаты подтвердились.

Авторы говорят, что рассчитывают дать исследователям и инженерам принципиальную основу для понимания и масштабирования мультимодального предобучения.

Ключевые факты

  • Контролируемые эксперименты и на синтетических, и на крупных реальных данных легли в основу четырёх выводов о «физике» мультимодального предобучения ИИ: поток знаний, синергия против конкуренции, раннее объединение и экономичные рецепты обучения.
  • Язык, понимание изображений и генерация изображений передают знания друг другу асимметрично: влияние одной модальности на другую отличается от обратного, а не одинаково в обе стороны.
  • Синергия или конкуренция модальностей в основном определяется «сложностью» данных; общие слои внимания и нормализации при отдельных слоях прямого распространения для каждой модальности усиливают синергию, это подтвердилось при разных визуальных токенизаторах.
  • Объединять модальности нужно с самых первых шагов обучения: позднее объединение или последовательное обучение работают хуже и вызывают эффект «зрительной лени» (vision laziness), модель полагается на языковые представления вместо визуальной информации.
  • Выведенные экономичные рецепты дают сильную генерацию при всего 5% вычислительного бюджета полноценного обучения; выводы подтвердили на масштабе, обучили несколько MoE-моделей с 13,5 млрд параметров на 2 трлн токенов.

Почему это важно

Индустрия ИИ всё активнее строит модели, которые с нуля объединяют язык и изображения в одной архитектуре. Но, как отмечают авторы, то, как модальности взаимодействуют друг с другом внутри такого обучения, когда помогают друг другу, а когда мешают, и в какой момент их лучше объединять, до этой работы было изучено слабо. Авторы впервые систематически, на контролируемых экспериментах на синтетических и крупных реальных данных, разложили этот процесс на явления, которые сами назвали «физикой» мультимодального предобучения, и получили конкретные выводы вместо общих рассуждений.

Кому это важно

В первую очередь, исследователям и инженерным командам, которые проектируют и обучают мультимодальные модели, объединяющие текст, изображения и другие данные в одной архитектуре: в лабораториях крупных ИИ-компаний и в академических группах. Работа даёт не общие советы, а конкретные архитектурные решения, например, общие слои внимания и нормализации при раздельных слоях прямого распространения для каждой модальности, и подсказку, когда объединять модальности: с самого начала обучения, а не позже. Полезна работа и тем, кто занимается MoE-архитектурами («смесь экспертов») и эффективностью обучения: предложенный рецепт обещает сильные результаты при заметно меньшем бюджете вычислений.

Как это применить

Из работы вытекают конкретные инженерные рекомендации. Объединять текстовую и визуальную модальности стоит с самых ранних шагов предобучения, а не сначала обучать языковую модель и лишь потом «пристраивать» к ней зрение, позднее выравнивание и последовательное обучение показали себя хуже. В архитектуре стоит делать общими слои внимания и нормализации, но оставлять слои прямого распространения отдельными для каждой модальности, это способствует синергии модальностей, и это подтвердилось при разных визуальных токенизаторах. Стоит учитывать и «сложность» данных: по наблюдениям авторов, именно она определяет, помогают ли модальности друг другу или конкурируют. Наконец, авторы предлагают экономичный рецепт предобучения, который даёт сильную генерацию при всего 5% вычислительного бюджета полноценного обучения, и утверждают, что эффект сохраняется не только на небольших моделях: его подтвердили на MoE-моделях с 13,5 млрд параметров, обученных на 2 трлн токенов.

Можно ли доверять

Материал, научная работа, представленная как препринт на странице статей Hugging Face. В аннотации не указаны ни полный состав авторов, ни институция, известно лишь имя первого автора, Junlin Han, из метаданных публикации. Выводы опираются на контролируемые эксперименты сразу на синтетических и на крупных реальных данных, а ключевые находки авторы дополнительно проверили не в игрушечном масштабе: обучили несколько MoE-моделей с 13,5 млрд параметров на 2 трлн токенов, это придаёт результатам вес. При этом в аннотации нет сравнения с конкретными базовыми моделями или предыдущими работами и нет абсолютных цифр вычислительных затрат, только относительная доля в 5%, так что оценить результаты в сравнении с конкурирующими подходами по одной аннотации нельзя.

Риски и подводные камни

Аннотация не упоминает публикацию кода, данных или самих обученных моделей: если авторы не выложат их отдельно, независимо повторить эксперименты или проверить рецепт на своих данных будет сложно. Не названы и конкретные бенчмарки или модели, с которыми сравнивали результаты, оценить размер выигрыша в эффективности и качестве относительно других подходов по одной аннотации нельзя. Основные выводы получены в контролируемых экспериментах, которые спроектировали сами авторы, в том числе на синтетических данных, это подходящий способ вычленить причинно-следственные связи, но не гарантия, что все закономерности, включая «зрительную лень» при позднем объединении модальностей, в точности так же проявятся в архитектурах и на данных за пределами тех, что тестировали авторы.