LLaDA-Image: открытая модель генерации изображений поставила рекорд среди open-source на Qwen-Image-Bench

LLaDA-Image: открытая модель генерации изображений поставила рекорд среди open-source на Qwen-Image-Bench

Исследователи представили LLaDA-Image, унифицированную модель для генерации изображений, которая сочетает диффузионный трансформер (DiT) на 6 млрд параметров, обученный с нуля, с «замороженным» (неизменяемым в ходе обучения этой модели) модулем понимания текста и изображений. Этот модуль построен на основе диффузионной языковой модели LLaDA2.0-Mini.

Вместо того чтобы с самого начала обучать модель на парах «изображение, текст», авторы сначала формируют сильную базовую способность генерировать изображения: предобучение и промежуточное обучение идут только на изображениях, и лишь потом в дело идут смешанные данные. Конвейер генерации построен на 220 млн сэмплов; отдельно указано, что 98 из них, реальные изображения, но источник не поясняет, идёт ли речь о доле в процентах, штучном количестве или другой единице измерения. Для эффективной и масштабируемой оптимизации всего DiT используются нормализация без обучаемых параметров (RMSNorm) и оптимизатор Muon.

По словам авторов, получившаяся унифицированная модель генерирует изображения с высокой степенью фотореализма и точно следует детальным инструкциям по редактированию. Отдельно LLaDA-Image дистиллировали в облегчённую версию LLaDA-Image-Turbo, которая позволяет получать результат быстрее, за 2, 4 шага сэмплирования вместо развёрнутого многошагового процесса, типичного для диффузионных моделей.

На бенчмарке Qwen-Image-Bench LLaDA-Image набрала 53,53 балла на английском треке и 53,38, на китайском. По заявлению авторов, это новый рекорд среди открытых (open-source) моделей на обоих треках; сравнения с результатами закрытых моделей на этом бенчмарке источник не приводит.

Чтобы поддержать дальнейшие исследования производительных и эффективных генеративных моделей, авторы выложили в открытый доступ веса модели, код обучения и подробные рецепты, описание конкретных решений и настроек, использованных при обучении.

Ключевые факты

  • LLaDA-Image, унифицированная модель генерации изображений: диффузионный трансформер (DiT) на 6 млрд параметров, обученный с нуля, в паре с «замороженным» модулем понимания на основе диффузионной языковой модели LLaDA2.0-Mini.
  • Обучение начинается не с пар «изображение, текст», а с предобучения и промежуточного обучения только на изображениях, так авторы сначала формируют базовую способность генерировать изображения; конвейер построен на 220 млн сэмплов (98 из которых источник отдельно называет реальными изображениями, не уточняя единицу измерения).
  • Для оптимизации всего DiT применяются нормализация без обучаемых параметров (RMSNorm) и оптимизатор Muon.
  • Модель дистиллировали в облегчённую LLaDA-Image-Turbo: результат, за 2, 4 шага сэмплирования вместо обычного для диффузионных моделей многошагового процесса.
  • На бенчмарке Qwen-Image-Bench LLaDA-Image набрала 53,53 балла на английском треке и 53,38, на китайском; по словам авторов, это новый рекорд среди open-source моделей на обоих треках. Веса модели, код обучения и рецепты выложены в открытый доступ.

Почему это важно

Открытые модели генерации изображений обычно уступают закрытым по качеству, а из тех, что публикуют веса, немногие раскрывают весь путь обучения, данные, порядок стадий, конкретные технические решения. LLaDA-Image интересна именно этим сочетанием: авторы не просто выкладывают веса, а описывают полный рецепт обучения, от предобучения только на изображениях до финальной оптимизации с RMSNorm и Muon, и заявляют новый рекорд среди открытых моделей на бенчмарке Qwen-Image-Bench сразу на двух языковых треках. Если независимая проверка подтвердит эти цифры, это заметный шаг для open-source экосистемы генерации изображений, где полностью воспроизводимые рецепты обучения моделей такого масштаба, редкость.

Кому это важно

Разработчикам и исследователям, которые строят собственные модели генерации и редактирования изображений и ищут воспроизводимый рецепт обучения диффузионного трансформера такого масштаба. Командам, которым для продакшена нужна быстрая генерация, им может быть интересна дистиллированная LLaDA-Image-Turbo с результатом за 2, 4 шага сэмплирования. Исследователям мультимодальных систем, как пример связки «замороженного» модуля понимания языка и изображений с обучаемым генеративным трансформером без сквозного переобучения всей системы.

Как это применить

Авторы выложили в открытый доступ веса модели, код обучения и подробные рецепты, описание конкретных стадий обучения (сначала только изображения, затем смешанные данные) и настроек оптимизации (нормализация без обучаемых параметров, оптимизатор Muon). Это позволяет не просто скачать готовую модель, а воспроизвести или адаптировать сам процесс обучения под свои данные и вычислительные ресурсы. Для сценариев, где важна скорость отклика, есть дистиллированный вариант LLaDA-Image-Turbo, он генерирует изображение всего за 2, 4 шага сэмплирования вместо развёрнутого многошагового процесса, типичного для диффузионных моделей.

Можно ли доверять

Заявленные цифры, собственные измерения авторов на признанном бенчмарке Qwen-Image-Bench, без независимого стороннего подтверждения. Рекорд заявлен именно среди открытых (open-source) моделей на обоих языковых треках бенчмарка, сравнения с результатами закрытых моделей источник не приводит, поэтому судить об абсолютном месте LLaDA-Image среди генераторов изображений в целом по этому тексту нельзя. Источник не называет ни авторов по именам, ни организацию за работой, материал описан только от коллективного «мы», что затрудняет проверку репутации команды. При этом авторы выкладывают веса, код обучения и рецепты в открытый доступ, а это оставляет возможность для внешней проверки заявленных результатов.

Риски и подводные камни

Число «98» в описании конвейера («220 млн сэмплов, 98 из которых, реальные изображения») в тексте не пояснено: не указано, доля это в процентах, штучное количество или другая единица, поэтому судить о реальной пропорции синтетических и настоящих изображений в обучающих данных по этому описанию нельзя. Заявление о рекорде ограничено сравнением с другими открытыми моделями и не говорит о месте LLaDA-Image относительно лучших закрытых генераторов изображений. Все технические результаты и оценки, собственные измерения и формулировки авторов работы; независимой сторонней оценки или воспроизведения результата в тексте нет.