Учёные вывели правило масштабирования для мультимодального предобучения ИИ

Учёные вывели правило масштабирования для мультимодального предобучения ИИ

Языковые модели обучают в основном на тексте, из-за чего их восприятие физического мультимодального мира (изображения, видео и так далее) остаётся ограниченным. Альтернативный подход, «нативное» мультимодальное предобучение: модель с самого начала обучают одновременно на тексте и других модальностях, а не сначала на тексте с последующей достройкой мультимодальности сверху. Такой способ даёт более глубокую интеграцию модальностей и избегает перекосов в оптимизации, характерных для схем с поздним слиянием (late fusion). Проблема в том, что для этого подхода до сих пор не были систематически изучены законы масштабирования, то есть неизвестно, как оптимально распределять вычислительный бюджет между размером модели и количеством обучающих токенов.

Авторы (первый автор, Haoyuan Wu, с соавторами) исследовали трансформерную модель типа vision-language при фиксированном бюджете вычислений и вывели два ключевых закона. Во-первых, минимальное значение функции потерь предсказуемо зависит от объёма вычислений, а оптимальные размер модели и число токенов растут по степенному закону, это похоже на уже известные закономерности для чисто текстовых LLM. Во-вторых, и это главный новый результат: языковая и мультимодальная части обучения масштабируются по-разному. Закон распределения ресурсов для языковой части почти не зависит от того, какая доля данных в обучающей смеси мультимодальна, язык учится стабильно в любом случае. А вот закон для мультимодальной части сильно зависит от состава данных: смеси с большой долей текста становятся вычислительно эффективными только при увеличении размера модели, а не количества токенов. Иначе говоря, чем больше в обучающей смеси текста, тем выгоднее вкладывать вычислительный бюджет в более крупную модель, а не в больший объём данных.

На основе этих закономерностей авторы вывели «границу эффективности», набор конкретных формул и конфигураций (размер модели, число токенов, состав данных), которые дают наилучшее качество при заданном бюджете. Отдельно они проверили практический эффект: нативное мультимодальное предобучение даёт положительный перенос между модальностями, улучшает даже чисто текстовые задачи (в частности, пространственные рассуждения) и делает мультимодальное обучение в контексте (in-context learning) более устойчивым. Авторы называют работу эмпирической основой для предсказуемого масштабирования мультимодальных базовых моделей в будущем.

Ключевые факты

  • Исследователи изучили, как оптимально распределять фиксированный вычислительный бюджет между размером модели и числом обучающих токенов при «нативном» мультимодальном предобучении, когда модель с нуля учат сразу на тексте и других модальностях, а не достраивают мультимодальность поверх готовой текстовой модели.
  • Минимальная функция потерь предсказуемо зависит от объёма вычислений, а оптимальные размер модели и число токенов растут по степенным законам.
  • Закон распределения ресурсов для языковой части почти не зависит от доли мультимодальных данных в обучающей смеси, язык учится стабильно в любом случае.
  • Закон для мультимодальной части, наоборот, сильно зависит от состава данных: смеси с большой долей текста становятся эффективными только при увеличении размера модели, а не объёма данных.
  • Авторы вывели «границу эффективности», конкретные конфигурации размера модели, числа токенов и состава данных для заданного вычислительного бюджета.

Почему это важно

Для чисто текстовых языковых моделей законы масштабирования (сколько вычислений вкладывать в размер модели, а сколько, в данные) давно изучены и используются индустрией при планировании обучения. Для мультимодальных моделей, обучаемых с нуля на разных типах данных сразу, такой систематической карты не было, разработчики действовали во многом на ощупь. Эта работа впервые формализует, как вычислительный бюджет нужно делить между размером модели и объёмом токенов отдельно для языковой и для мультимодальной части обучения.

Кому это важно

Инженерам и исследователям, которые обучают мультимодальные базовые модели (vision-language и шире) и должны заранее планировать, сколько GPU-часов потратить на модель какого размера и с каким составом данных. Результаты полезны лабораториям, решающим, наращивать ли параметры модели или объём данных при ограниченном бюджете вычислений.

Как это применить

Выведенная «граница эффективности» даёт конкретные ориентиры: если в обучающей смеси много текста относительно других модальностей, выгоднее увеличивать размер модели, а не количество токенов, и наоборот. Это позволяет заранее (до дорогостоящего полного обучения) прикинуть конфигурацию модель/данные, которая даст наилучшее качество при имеющемся бюджете вычислений.

Можно ли доверять

Это опубликованная на Hugging Face исследовательская работа (первый автор, Haoyuan Wu, с соавторами), на момент обзора собравшая скромное внимание (18 очков, 1 комментарий). В доступном тексте нет ссылок на конкретные бенчмарки или сравнение с другими лабораториями, приведены только выводы самих авторов об общих закономерностях. Как с любой препринт-работой, выводы стоит воспринимать как результат конкретных экспериментов авторов, а не как окончательно подтверждённый индустриальный стандарт.

Риски и подводные камни

Выведенные степенные законы получены на конкретной архитектуре трансформера и конкретных наборах данных, при другой архитектуре модели или другом типе мультимодальных данных (например, видео вместо изображений) закономерности могут отличаться. Экстраполяция таких законов на существенно большие масштабы вычислений, чем те, что тестировались в работе, всегда несёт риск, реальное поведение больших моделей может отклоняться от предсказанной кривой.