Не длина промпта, а его структура определяет качество ИИ-генерации изображений

Учёные изучили, как параметры текстового условия (промпта) влияют на обучение диффузионных моделей генерации изображений, тему, которую почти не измеряли, потому что итоговая (сошедшаяся) диффузионная потеря не уменьшается просто от роста числа токенов в промпте: длиннее промпт не значит лучше модель. Неожиданный вывод авторов: потеря масштабируется не с длиной текста, а с количеством структурированного языка в промпте, то есть с тем, насколько информативно и организованно описана картинка, а не с числом слов.
Чтобы измерить эту структурированность численно, авторы предложили две дополняющие друг друга метрики: GPG, white-box метрика правдоподобия (оценивается изнутри модели) и ED, black-box метрика атрибутов (оценивается по внешним признакам промпта, без доступа к модели). В контролируемых прогонах обучения сошедшаяся диффузионная потеря убывала почти линейно с ростом GPG и по степенному закону, с ростом ED. Иными словами, обе метрики надёжно предсказывают, насколько хорошо модель обучится на заданном наборе промптов.
Опираясь на эти находки, авторы улучшили систему по двум направлениям. Во-первых, качество генерации по заданному промпту (в терминах авторов, diffusability): для этого они конструировали структурированные промпты с семантическими и геометрическими аннотациями, извлечёнными прямо из изображений, вместо обычных свободных подписей. Во-вторых, качество превращения обычного пользовательского запроса в такой структурированный промпт (promptability): для этого отдельно обучили модель-«промптер», через контролируемое дообучение (SFT), холодный старт и дистилляцию на политике с отбором ответов верификатором (verifier-gated on-policy distillation, когда отдельная модель-проверяющий отсеивает неудачные варианты промптов перед дальнейшим обучением).
По заявлению авторов, итоговая система превосходит все протестированные открытые (open-weight) модели почти по всем композиционным, логическим и связанным со знаниями о мире тестам (бенчмаркам), а по большинству оценок не уступает или превосходит сильнейшие закрытые (closed-weight) модели, но не по всем. Конкретных названий моделей, бенчмарков, численных результатов, имён авторов (кроме первого, Zilong Chen) и организаций в доступном тексте не приведено.
Ключевые факты
- Итоговая диффузионная потеря не зависит от числа токенов в промпте, но чётко масштабируется с количеством структурированного языка в нём.
- Авторы ввели две метрики структурированности промпта: GPG (white-box, по правдоподобию модели) и ED (black-box, по атрибутам текста); потеря убывает почти линейно с GPG и по степенному закону с ED.
- Диффузируемость (diffusability) улучшили структурированными промптами с семантическими и геометрическими аннотациями, извлечёнными из изображений.
- Отдельно обучили модель-«промптер» (promptability) через SFT, холодный старт и дистилляцию на политике с отбором верификатором.
- Итоговая система обходит все проверенные открытые модели почти по всем композиционным, логическим и знаниевым тестам и не уступает сильнейшим закрытым моделям на большинстве оценок.
Почему это важно
Работа даёт разработчикам диффузионных моделей измеримые рычаги вместо интуиции: показывает, что вкладываться нужно не в удлинение текстовых описаний при обучении, а в их структурированность, и предлагает две конкретные метрики (GPG и ED), по которым можно заранее оценить, насколько хорошо модель обучится на конкретном наборе промптов.
Кому это важно
Команды, разрабатывающие модели генерации изображений и видео по тексту (text-to-image, text-to-video); специалисты по подготовке обучающих подписей (captions) для таких моделей; разработчики инструментов промпт-инжиниринга и систем оценки генеративных моделей.
Как это применить
В источнике нет цены или лицензии, применима методика: при обучении диффузионных моделей использовать структурированные промпты с семантическими и геометрическими аннотациями вместо свободных описаний; для инференса, обучать отдельную модель-«промптер», переводящую обычный запрос пользователя в такой структурированный промпт, через SFT, холодный старт и дистилляцию с отбором верификатором.
Можно ли доверять
Источник, карточка препринта на HuggingFace Papers, доступен только текст аннотации: без имён соавторов (кроме первого), организаций, названий сравниваемых моделей и бенчмарков и без конкретных числовых результатов. Заявления о превосходстве («почти по всем тестам», «на большинстве оценок»), формулировки самих авторов, независимой проверки в доступном тексте нет.
Риски и подводные камни
Результаты, самоотчёт авторов без независимого воспроизведения; методология метрик GPG и ED раскрыта лишь на уровне определения («white-box метрика правдоподобия», «black-box метрика атрибутов»), без деталей расчёта; формулировки «почти по всем» и «на большинстве» прямо указывают на неназванные исключения.