Qwen-Image-Edit научили редактировать по нескольким референсам не хуже NanoBanana

Редактирование изображения по одному референсу ИИ-модели уже освоили хорошо, а обучение с подкреплением (RL) отлично помогает такие модели дообучать. Но когда правку нужно собрать из НЕСКОЛЬКИХ референсных изображений сразу, задача усложняется: модель должна сохранить визуальную согласованность между всеми референсами и получить цельный, гармоничный результат. Для RL здесь не было подходящей модели вознаграждения, той, что оценивает качество результата и по этой оценке дообучает модель, потому что существующие модели вознаграждения не умеют учитывать связи сразу между несколькими изображениями.
Простое решение, напрямую использовать мультимодальные большие языковые модели (MLLM) как судей, тоже не работает: если дать им рассуждать развёрнуто, они начинают галлюцинировать и придумывать несуществующие детали; если заставить выносить короткий вердикт без рассуждений, вывод получается поверхностным и ненадёжным.
Авторы предлагают решение, многомерную награду Evaluation-Verification Reward (EVR, «награда по оценке и проверке»). Она разбивает оценку правки на отдельные визуальные критерии (например, согласованность конкретных деталей, общая гармония композиции). Для каждого критерия сначала работает MLLM-оценщик: он выдвигает несколько гипотез о том, что могло пойти не так или, наоборот, получилось хорошо. Затем отдельный модуль-проверяющий сверяет каждую гипотезу с конкретным визуальным доказательством на картинке и либо принимает её, либо отклоняет. Так получается точный, детализированный сигнал вознаграждения, на котором можно надёжно обучать модель.
Вместе с масштабируемым конвейером подготовки данных этот метод позволяет дообучать RL-методом уже готовые редакторы изображений без изменения их архитектуры, то есть встраивать EVR в существующую модель, а не строить новую с нуля. Эксперименты показали ощутимый прирост качества у базовой модели Qwen-Image-Edit: после дообучения с EVR она стала сравнима по согласованности и визуальной гармонии с NanoBanana (неофициальное имя одной из фотографических моделей семейства Gemini от Google) или даже превзошла её. Конкретных числовых показателей, процентов, баллов на бенчмарках, авторы в тексте работы не приводят.
Ключевые факты
- Проблема: RL хорошо дообучает модели редактирования по одному референсу, но для редактирования по НЕСКОЛЬКИМ референсам не было модели вознаграждения, которая умеет учитывать связи между разными изображениями
- Простое использование мультимодальных LLM как судей ломается на компромиссе: развёрнутые рассуждения ведут к галлюцинациям, короткие вердикты, слишком поверхностны
- Решение EVR: для каждого визуального критерия MLLM-оценщик выдвигает гипотезы, а отдельный проверяющий модуль сверяет каждую с конкретным визуальным доказательством в изображении
- Метод работает поверх готовых редакторов без изменения архитектуры и дополнен масштабируемым конвейером подготовки данных
- После дообучения с EVR базовая модель Qwen-Image-Edit по согласованности и гармонии сравнялась с NanoBanana или превзошла её; точных цифр авторы не приводят
Почему это важно
Редактирование изображения сразу по нескольким референсам, например, «возьми лицо с одной фотографии, позу с другой, фон с третьей», одна из самых практичных, но и самых сложных задач генеративного ИИ: результат должен выглядеть цельным, а не склейкой несвязанных кусков. Обучение с подкреплением, рабочий способ доводить такие модели до ума, но ему нужен надёжный «судья», который умеет оценивать именно согласованность между несколькими изображениями. Такого судьи раньше не было: обычные модели вознаграждения на это не рассчитаны, а прямое использование языковых моделей как оценщиков давало либо галлюцинации, либо слишком грубые вердикты. EVR закрывает именно этот пробел.
Кому это важно
В первую очередь, исследовательским командам и инженерам, которые развивают модели редактирования изображений (в духе Qwen-Image-Edit или семейства Gemini/NanoBanana) и ищут способ дообучать их обучением с подкреплением. Полезно и разработчикам инструментов для дизайнеров и маркетологов, которым нужна предсказуемая многореференсная правка, коллажи, композиты, монтаж из нескольких исходников, без ручной доводки результата.
Как это применить
EVR встраивается поверх уже готового редактора изображений без изменения его архитектуры, по сути, это способ дообучить существующую модель, а не заново её построить. Авторы описывают метод вместе с масштабируемым конвейером подготовки обучающих данных, что важно для практического внедрения: без готового пайплайна данных такую награду сложно было бы применить к произвольной модели. Конкретных инструкций по внедрению, кода или датасета в тексте не упомянуто.
Можно ли доверять
Материал, препринт с площадки Hugging Face Papers, набравший 13 отметок и лишь 1 комментарий: независимого обсуждения или воспроизведения результатов пока практически нет. Все заявленные улучшения, качественные («сравнялись с NanoBanana или превзошли её»), без конкретных чисел, процентов или баллов на бенчмарках; имена авторов, аффилиации и дата публикации в тексте тоже не указаны. Это типичная ранняя публикация исследовательской работы, а не рецензированная научная статья с проверенными результатами.
Риски и подводные камни
Главный риск, качественные формулировки без цифр: «сравнялись или превзошли NanoBanana» звучит убедительно, но проверить масштаб улучшения невозможно. Сама схема «MLLM-оценщик плюс проверяющий» снижает, но не устраняет риск ошибок оценки: если проверяющий модуль тоже основан на модели, унаследованные слепые пятна могут остаться. Неясно и насколько метод переносится на модели редактирования, отличные от Qwen-Image-Edit, эксперименты в тексте описаны только применительно к ней.