TILT улучшает точность diffusion-моделей в сложных запросах

TILT, предложенный авторами метод для text-to-image diffusion-моделей, который должен улучшать выполнение сложных композиционных запросов на этапе генерации, без дополнительного обучения. Его задача, сделать изображения более верными описаниям, где нужно совместить несколько объектов или признаков.

Авторы трактуют композиционные ошибки как режимы перекрытия распределений для совместного набора концепций и для отдельных концепций. На этой основе они задают награду, которая предпочитает образцы, где все концепции присутствуют одновременно. Эта награда выводится из самой базовой модели: ей не нужны внешняя разметка, отдельная модель награды или внешний контроль.

Из такой постановки получается KL-ограниченная цель с аналитически заданным наклонённым целевым распределением и обоснованными шагами управления при diffusion-семплировании. Взаимодействие распределений концепций приводит к двум стратегиям управления; их гибрид, по утверждению авторов, лучше сочетает преимущества обеих. В экспериментах на запросах T2ICompBench TILT улучшил композиционное соответствие по сравнению с прежними базовыми методами, сохранив качество изображений.

Ключевые факты

  • TILT, метод без обучения, работающий во время генерации изображения diffusion-моделью.
  • Он нацелен на сложные запросы, в которых изображение должно одновременно содержать все заданные концепции.
  • Награда строится из базовой модели и не требует внешней разметки или отдельной модели награды.
  • Авторы выводят две стратегии управления семплированием и их гибридный вариант.
  • На T2ICompBench метод улучшил композиционное соответствие, сохранив качество изображений относительно прежних базовых методов.

Почему это важно

Даже сильные text-to-image модели могут плохо выполнять запросы, где нужно совместить несколько объектов или свойств. TILT предлагает исправлять такие ошибки прямо при генерации и не требует переобучать базовую модель.

Кому это важно

Работа важна исследователям и разработчикам систем генерации изображений, которым нужно повысить точность выполнения сложных композиционных описаний без обучения отдельной модели награды.

Как это применить

Авторы предлагают использовать TILT на этапе diffusion-семплирования: метод добавляет шаги управления, ориентированные на образцы, где концепции из запроса присутствуют совместно. В статье также описаны две стратегии и гибрид между ними.

Можно ли доверять

Авторы проверили подход на запросах из T2ICompBench и сообщают об улучшении композиционного соответствия при сохранении качества изображений относительно прежних базовых методов. В предзагруженном описании нет численных результатов, поэтому их величину здесь оценить нельзя.

Риски и подводные камни

Заявленный результат относится к экспериментам на T2ICompBench и сравнению с прежними базовыми методами. Из краткого описания не следует, как TILT поведёт себя на других наборах запросов, моделях или в прикладных сценариях.

«Наша награда внутренне присуща базовой модели и не требует ни внешнего контроля, ни моделей награды.»

— Авторы статьи TILT