Исследователи представили SC-CMJP, фреймворк для совместной генерации текста и изображений с автокоррекцией

Исследователи представили SC-CMJP, фреймворк для совместной генерации текста и изображений с автокоррекцией

Учёные предложили SC-CMJP (Self-Correcting Coupled Markov Jump Processes), фреймворк для masked diffusion моделей (MDM, маскированных диффузионных моделей), который генерирует текст и изображение не по очереди и не в двух независимых потоках, а как единый связанный процесс.

Авторы отмечают: человек не разделяет понимание и генерацию, учитель у доски одновременно говорит и рисует, и каждая модальность влияет на другую в реальном времени. У существующих сэмплеров для MDM так не получается: они либо декодируют текст и изображение поочерёдно (интерливинг), либо ведут два параллельных потока, которые обмениваются только историей предыдущих шагов, но не видят решений друг друга внутри текущего шага. Из-за этого, а также из-за того, что MDM в принципе не умеют «перемаскировать» уже сгенерированный фрагмент, противоречия между текстом и изображением (например, текст описывает одно, а картинка рисует другое) не обнаруживаются и не исправляются.

В SC-CMJP скорость перехода токенов одной модальности из маскированного состояния в зафиксированное зависит от уверенности модели в другой модальности, эта связь взвешивается через cross-modal attention (кросс-модальное внимание). Дополнительно введён механизм remasking: если новые данные из другой модальности начинают противоречить уже принятому решению, модель может откатить это решение обратно в маскированное состояние и переделать.

На основе SC-CMJP авторы предложили CO2Jump, не требующий дообучения (training-free) однопроходный сэмплер, который можно применить к уже существующим masked diffusion моделям без их переобучения.

Для обучения и оценки таких систем авторы создали и обещают выпустить три крупных датасета для совместной мультимодальной генерации: JEdit-1M (около 1 млн примеров редактирования изображений), JMaze-200K и JNono-200K (по 200 тыс. примеров визуальных головоломок, решение лабиринтов и нонограмм), с парными бенчмарками как внутри исходного распределения данных, так и вне его.

По заявлению авторов, CO2Jump показывает лучшее совместное качество как в понимании и редактировании изображений, так и в визуальном рассуждении (решение лабиринтов и нонограмм). Причём качество растёт монотонно с увеличением числа шагов диффузии, это, по мнению авторов, подтверждает, что выгода от связывания модальностей накапливается по ходу всей траектории генерации, а не даётся один раз.

Ключевые факты

  • SC-CMJP связывает генерацию текста и изображения так, что скорость фиксации токенов одной модальности зависит от уверенности модели в другой модальности через cross-modal attention
  • Введён механизм remasking, впервые masked diffusion модель может откатить уже принятое решение, если оно противоречит новым данным из другой модальности
  • CO2Jump, training-free однопроходный сэмплер на основе SC-CMJP, применимый к уже существующим masked diffusion моделям без дообучения
  • Вместе с фреймворком выходят три датасета: JEdit-1M (редактирование изображений), JMaze-200K и JNono-200K (визуальные головоломки, лабиринты и нонограммы)
  • Качество генерации CO2Jump растёт монотонно с числом шагов диффузии, авторы трактуют это как доказательство накопительного эффекта связывания модальностей

Почему это важно

Модели, которые совместно генерируют текст и изображения, обычно обрабатывают модальности почти независимо внутри одного шага, из-за этого возникают противоречия между текстом и картинкой, которые нечем исправить: маскированные диффузионные модели не умеют откатывать уже принятые решения. SC-CMJP закрывает именно этот разрыв: модальности буквально «видят» текущие решения друг друга и могут скорректировать себя на лету, а не только по итогам прошлого шага.

Кому это важно

В первую очередь это интересно исследователям и разработчикам мультимодальных генеративных моделей (совместная диффузия текста и изображений), командам, которые строят инструменты редактирования изображений по текстовым инструкциям, и тем, кто занимается визуальным рассуждением, задачами, где модели нужно одновременно понимать изображение и рассуждать о нём текстом (например, решение лабиринтов и нонограмм).

Как это применить

CO2Jump, training-free сэмплер, то есть его можно подключить к уже обученной masked diffusion модели без переобучения, просто заменив способ семплирования. Три выпускаемых датасета (JEdit-1M, JMaze-200K, JNono-200K) с бенчмарками внутри распределения данных и вне его дают готовую базу для обучения и проверки подобных систем совместной генерации.

Можно ли доверять

Это препринт (страница на Hugging Face Papers), сведений о рецензировании нет; в источнике указан один автор (Minh-Quan Le), полный список соавторов и институтов в предзагруженном тексте не приведён. Заявления о качестве подкреплены собственными бенчмарками на трёх новых датасетах и есть отдельная страница проекта (coupled-jump.github.io), но независимого воспроизведения результатов пока нет.

Риски и подводные камни

Оценка качества опирается в основном на новые, во многом синтетические бенчмарки (лабиринты, нонограммы, редактирование изображений по заданному датасету), неясно, насколько они отражают сложность реальных задач. Training-free подход зависит от качества базовой masked diffusion модели, к которой применяется сэмплер: SC-CMJP улучшает координацию модальностей, но не может компенсировать слабости самой базовой модели. Рост качества с числом шагов диффузии также означает рост вычислительных затрат на инференс.

«Учитель у доски говорит и рисует одновременно, каждая модальность переформирует другую.»

— из текста статьи об SC-CMJP