Исследователи обучили генераторы изображений на 3 и 6 млрд параметров новой инфраструктурой данных по навыкам

Разработка генераторов изображений обычно опирается на отдельные наборы данных под конкретные задачи, генерацию по текстовому описанию, редактирование, привязку к знаниям о конкретных объектах, которые готовят и используют по отдельности. Авторы новой работы на Hugging Face Papers (первым автором значится Синцзянь Ван, Xingjian Wang) указывают на другую проблему: дело не только в том, как собрать качественный набор данных под одну задачу, а в том, как организовать разнородные обучающие данные с учётом связей между разными способностями модели генерировать изображения. Для этого они предлагают инфраструктуру данных, ориентированную на способности модели: она сочетает подготовку обучающих сигналов под конкретный навык с учебным планом, выстроенным в том же порядке, в каком модель осваивает эти навыки.
В основе инфраструктуры, три специализированных, но связанных между собой модуля обработки данных. Один формирует обучающие сигналы, которые связывают текст с содержимым изображения. Второй отвечает за преобразование одного изображения в другое, то есть за редактирование. Третий строит связи между изображениями и знаниями, сопоставляет картинки с сущностями и фактами о них. Отдельные модули подписей согласуют данные для генерации по тексту и для редактирования между собой, и по типу задачи, и по уровню детализации.
Обучение построено как многоэтапный учебный план: на каждом этапе одновременно меняются состав задач, распределение визуальных понятий, качество данных и разрешение изображений, в порядке, который соответствует тому, как модель осваивает навыки один за другим, от простого к сложному. Цикл замыкает оценка, которая учитывает текущие способности модели: она выявляет пробелы в данных и запускает точечный поиск нужных примеров, привлечение экспертов и повторную выборку данных с упором на слабые места.
В итоге авторы собрали набор данных из 440 миллионов изображений для генерации по текстовому описанию, 120 миллионов пар для редактирования и более 27 миллионов пар «изображение, сущность». На основе этой инфраструктуры они с нуля обучили мультимодальные диффузионные модели двух размеров, на 3 и на 6 миллиардов параметров.
Модели проверили количественно на бенчмарке CPI-Bench и качественно, на разных сценариях генерации по тексту и редактирования. По словам авторов, результаты показывают широкий охват визуальных сюжетов, разнообразную прорисовку и эффективный перенос между разными способностями генерации.
Ключевые факты
- Обычные конвейеры данных готовят наборы под каждую задачу генерации изображений, по тексту, редактирование, привязку к знаниям, по отдельности, не учитывая связи между этими способностями.
- Новая инфраструктура данных сочетает три модуля, для привязки текста к изображению, для преобразования одного изображения в другое (редактирование) и для связи изображений со знаниями, и отдельные модули подписей, которые согласуют данные между задачами.
- Многоэтапный учебный план меняет состав задач, набор визуальных понятий, качество данных и разрешение изображений в порядке освоения навыков; оценка выявляет пробелы и запускает точечную доработку данных.
- Собранные наборы данных: 440 млн изображений для генерации по тексту, 120 млн пар для редактирования, более 27 млн пар «изображение, сущность».
- С нуля обучили две мультимодальные диффузионные модели, на 3 и 6 млрд параметров, и проверили их на бенчмарке CPI-Bench и на разных сценариях генерации и редактирования; результаты показали широкий охват сюжетов и эффективный перенос между способностями генерации.
Почему это важно
Большинство систем генерации изображений сегодня стремятся делать сразу несколько вещей, рисовать по текстовому описанию, редактировать готовые изображения, опираться на знания о конкретных объектах и сущностях. Но обучающие данные под эти задачи почти всегда готовят по отдельности, как для разных продуктов. Авторы работы предлагают другую рамку: раз способности модели связаны и опираются друг на друга, то и данные, и порядок обучения на них должны учитывать эту зависимость, а не собираться независимо под каждую задачу. Это смещает фокус с архитектуры самой модели на инженерию данных, менее заметный, но не менее трудоёмкий участок работы над генеративными моделями.
Кому это важно
В первую очередь, командам, которые строят универсальные генераторы изображений: одновременно генерацию по тексту, редактирование и работу со знаниями о конкретных объектах, а не узкую модель под одну задачу. Также, инженерам и исследователям, которые занимаются подготовкой и курированием обучающих данных для мультимодальных моделей: предложенный подход даёт схему, как разбить эту работу на модули и синхронизировать их через общий учебный план и оценку.
Как это применить
Работа описывает не готовый инструмент, а методологию: разделить обучающие сигналы по конкретным способностям модели, собрать под каждую свой специализированный модуль подготовки данных, а затем свести их в общий многоэтапный учебный план, который меняет состав задач и качество данных по мере роста модели, и достраивать данные точечно, там, где оценка находит пробелы. В тексте работы не сказано, публикуют ли авторы код, веса обученных моделей или сами наборы данных, поэтому напрямую воспроизвести эту инфраструктуру по одной публикации нельзя, можно взять сам принцип.
Можно ли доверять
Это исследовательская публикация на Hugging Face Papers, а не анонс продукта: у неё есть количественная оценка на бенчмарке CPI-Bench и качественная проверка на разных сценариях генерации и редактирования, а масштаб собранных данных и обучение двух моделей с нуля (3 и 6 млрд параметров) говорят о серьёзном объёме инженерной работы. На момент публикации отклик сообщества скромный, 9 голосов и 2 комментария на Hugging Face за более чем двое суток, то есть независимая оценка со стороны других исследователей пока не сложилась.
Риски и подводные камни
В аннотации не приведены конкретные числа по CPI-Bench и качественным тестам, «широкий охват», «разнообразная прорисовка» и «эффективный перенос» это словесные характеристики авторов, а не измеримые показатели, которые можно сопоставить с другими работами. Сравнения с конкретными конкурирующими системами тоже нет, оценить по тексту, насколько предложенная инфраструктура данных лучше существующих подходов, нельзя. Не раскрыты и детали по объёму вычислений, оборудованию и стоимости обучения моделей на 3 и 6 млрд параметров, поэтому по одной аннотации нельзя судить, насколько ресурсоёмко воспроизвести такую инфраструктуру.
«Результаты экспериментов демонстрируют широкий охват визуальных сюжетов, разнообразную прорисовку и эффективный перенос между разными способностями генерации.»
— авторы работы