Multimodal Flow: нейросеть описывает текст и картинки в одном непрерывном потоке

Multimodal Flow: нейросеть описывает текст и картинки в одном непрерывном потоке

В статье представлена Multimodal Flow, полностью непрерывная генеративная модель языка и зрения. Авторы исходят из того, что большинство единых мультимодальных моделей устроены одним из двух способов: либо и текст, и квантованные изображения представляются дискретными токенами, либо дискретное предсказание текста сочетается с непрерывной генерацией изображений. По словам авторов, первый путь создаёт «бутылочное горлышко» визуального квантования, а второй требует разных целевых функций и процедур сэмплирования для разных модальностей. Полностью непрерывное моделирование, как утверждают авторы, обходит эти компромиссы и даёт общий генеративный процесс, но для мультимодального предобучения остаётся мало изученным.

Архитектура Multimodal Flow объединяет непрерывные мультимодальные представления с общим блочно-каузальным (chunk-causal) потоковым каркасом. Текстовые блоки и изображения организуются как упорядоченные непрерывные гиперчанки (hyperchunks): при этом сохраняются порядок текстовых токенов и пространственная структура изображения. Каркас учит единое векторное поле над этими гиперчанками методом Flow Matching. Совместное внимание (joint attention) обеспечивает взаимодействие между модальностями, а отдельные для каждой модальности сети прямого распространения (feed-forward) обрабатывают текст и изображения. При обучении модель предсказывает сразу несколько целевых блоков параллельно, а при генерации выдаёт гиперчанки последовательно.

Авторы создали на этой основе модель MF-1 и предобучили её на мультимодальных данных. На масштабах 0,6B, 1,2B и 1,6B продолжение предобучения последовательно улучшает мультимодальное моделирование. Всего на 150 млрд токенов предобучения MF-1 набирает 82,8 в среднем по GenEval и DPG-Bench (генерация изображений) и 75,3 по VQAv2, MMBench и POPE (понимание изображений). Авторы пишут, что модель остаётся конкурентной по сравнению с едиными моделями, обученными на существенно большем объёме данных. Кроме того, при одинаковых данных, оптимизации и бюджете параметров Multimodal Flow, по их утверждению, превосходит репрезентативные гибридные и дискретные модели.

Из этого авторы делают вывод, что непрерывное потоковое моделирование эмбеддингов по блокам, новая полностью непрерывная парадигма единого мультимодального моделирования. Код и модель опубликованы в открытом доступе на GitHub: https://github.com/hustvl/Multimodal-Flow.

Ключевые факты

  • Multimodal Flow, полностью непрерывная генеративная модель языка и изображений: без дискретных токенов для картинок и без разных процедур для текста и изображения.
  • Текст и изображения организованы как упорядоченные непрерывные гиперчанки, над которыми каркас учит единое векторное поле методом Flow Matching; совместное внимание связывает модальности, а прямые сети у каждой модальности свои.
  • MF-1 при 150 млрд токенов предобучения набирает 82,8 по GenEval и DPG-Bench (среднее) и 75,3 по VQAv2, MMBench и POPE.
  • Авторы заявляют конкурентность с едиными моделями, обученными на существенно большем объёме данных, и превосходство над гибридными и дискретными моделями при равных данных, оптимизации и числе параметров.
  • Код и модель опубликованы на GitHub (hustvl/Multimodal-Flow).

Почему это важно

Единые мультимодальные модели обычно упираются в выбор: дискретные токены для картинок приводят к потерям при квантовании, а гибрид дискретного текста и непрерывных изображений требует разных целей обучения и способов сэмплирования. Multimodal Flow предлагает убрать этот разрыв и описывать оба типа данных одним непрерывным процессом. Авторы называют такой подход новой полностью непрерывной парадигмой; для мультимодального предобучения она, по их словам, пока мало изучена.

Кому это важно

Исследователям мультимодальных и диффузионных или потоковых моделей, которые решают, как объединить генерацию и понимание изображений в одной нейросети. Также тем, кто следит за альтернативами дискретной токенизации картинок: код и модель опубликованы, их можно изучать и воспроизводить.

Как это применить

Код и модель опубликованы авторами на GitHub: https://github.com/hustvl/Multimodal-Flow. Это позволяет проверить заявленные результаты на GenEval, DPG-Bench, VQAv2, MMBench и POPE и посмотреть, как устроены гиперчанки и потоковый каркас. Лицензия в аннотации не указана, поэтому условия использования стоит смотреть в репозитории.

Можно ли доверять

Все цифры и выводы взяты из аннотации статьи и принадлежат самим авторам; независимой проверки в тексте нет. Аннотация не называет модели, с которыми сравнивается MF-1, и не говорит, сколько токенов было у них, поэтому оценить «существенно больше данных» по ней нельзя. Не приведены ни оценки по отдельным тестам, ни величина превосходства над гибридными и дискретными базовыми моделями. Не указано и то, какому из масштабов 0,6B, 1,2B, 1,6B соответствуют итоговые оценки.

Риски и подводные камни

Заявление о «новой парадигме», оценка авторов, а не установленный факт; её подтверждение зависит от независимых воспроизведений. В аннотации не приведены ограничения подхода, а также скорость вывода, вычислительные затраты и требования к оборудованию. Средние значения 82,8 и 75,3 относятся к MF-1 при 150 млрд токенов предобучения и не разложены по тестам, так что сильные и слабые стороны модели по ним не видны.