Google Research представила Diffusion Controller: «демпфер руля» для генерации картинок

29 сентября 2026 года программные инженеры Google Research Чи-вэй Сюй (Chih-wei Hsu) и Мунгён Рю (Moonkyung Ryu) представили Diffusion Controller, фреймворк для управления генерацией изображений по тексту. Он опирается на идею «демпфера руля»: к исходной предобученной модели подключается лёгкая сеть, а сама модель остаётся полностью замороженной и не затрагивается.\n\nПроблема, которую решают авторы: современные модели (в блоге названы Nano Banana, Stable Diffusion и Flux) трудно точно направлять. Пример из текста, запрос «ящерица в солнцезащитных очках»: модель может нарисовать реалистичную ящерицу без очков, а если принудительно добавить очки, можно исказить морду и испортить качество. Существующие подходы, по описанию авторов, разрознены: с одной стороны, приёмы на этапе генерации вроде classifier-free guidance (управления без классификатора), с другой, тяжёлое дообучение через адаптеры типа LoRA, взвешенные по награде регрессии или градиенты политики. Единого математического языка для них не было, из-за чего инженерам часто приходится действовать наугад, балансируя между соответствием запросу и качеством картинки.\n\nDiffusion Controller рассматривает весь процесс шумоподавления (когда модель начинает со случайного шума и постепенно превращает его в чёткое изображение) как непрерывную задачу управления. Сеть-«демпфер» на ходу корректирует траекторию генерации: смещает стандартное поведение модели в сторону заданной цели (например, стиля или соответствия контексту), а штрафной «ограничитель» не даёт этим смещениям испортить качество. В примере с ящерицей очки появляются, но чешуя и пропорции не искажаются. Из управленческой постановки авторы вывели два эффективных метода дообучения, опирающихся только на итоговую оценку награды (сами методы в тексте блога не раскрыты).\n\nВажный практический момент: обычно для изменения поведения модели нужен «белый ящик», доступ к её весам, а лучшие модели часто закрыты (в тексте, «чёрные» или «серые» ящики). Управляющая сеть, по заявлению авторов, наблюдает за изображением по мере очистки от шума и добавляет небольшие поправки, поэтому позволяет настраивать даже закрытые модели, не трогая их код.\n\nОценка: на базе Stable Diffusion v1.4 проверены три режима дообучения, supervised fine-tuning (SFT), reward-weighted loss (RWL) и PPO. Качество измеряли стандартной метрикой Human Preference Score (HPS-v2). Реализованы четыре сетевые архитектуры (в тексте не описаны). Авторы сообщают, что лёгкая надстройка превзошла отраслевой стандарт по соответствию человеческим предпочтениям, а полностью «разблокированная» версия (дообученная с доступом к весам) достигла 90% побед над базовой моделью. В режимах SFT и RWL «серый ящик» Diffusion Controller обошёл LoRA, по описанию авторов, передовой параметрически эффективный подход для «белого ящика», по доле побед по метрике HPS-v2, при этом задействовав заметно меньше внутренних слоёв модели. В экспертных оценках людей Diffusion Controller, по их словам, показал лучшее субъективное качество и соответствие запросу на сложных промптах с несколькими атрибутами.\n\nЕщё одна особенность: единственный параметр силы управления на этапе инференса позволяет во время работы усиливать или ослаблять ограничения и плавно менять соответствие запросу без потери стабильности базовой модели и без искажений, типичных для прежних методов guidance.\n\nСледующие шаги, названные авторами: инструменты персонализации, механизмы безопасности для снижения риска вредного контента и адаптация «демпфера» к следующему поколению видеомоделей.
Ключевые факты
- Google Research (авторы блога, Чи-вэй Сюй и Мунгён Рю) представила Diffusion Controller: лёгкую сеть-«демпфер руля», которая подключается к замороженной базовой модели и улучшает соответствие изображения запросу.
- Процесс шумоподавления трактуется как непрерывная задача управления; штрафной ограничитель удерживает качество картинки и стабильность базовой модели.
- По заявлению авторов, подход применим и к закрытым моделям с ограниченным доступом; эксперименты проведены на Stable Diffusion v1.4 в трёх режимах дообучения: SFT, RWL и PPO.
- Полностью разблокированная версия набрала 90% побед над базовой моделью; в режимах SFT и RWL «серый ящик» обошёл LoRA по метрике HPS-v2, задействуя заметно меньше слоёв.
- Единый параметр силы управления на этапе инференса позволяет регулировать жёсткость ограничений на лету; планы, персонализация, безопасность и видеомодели.
Почему это важно
Управлять генерацией изображений точно, например, чтобы ящерица действительно оказалась в очках и при этом не выглядела искажённой, пока остаётся сложной задачей. Авторы утверждают, что приёмы управления на этапе генерации и дообучение до сих пор существовали как разрозненные исправления без общей математической основы. Diffusion Controller предлагает единую постановку, управление непрерывным процессом шумоподавления, и при этом претендует на работу с закрытыми моделями, где доступ к весам недоступен.
Кому это важно
Прежде всего исследователям и инженерам, которые дообучают или настраивают диффузионные модели, а также командам, работающим с закрытыми моделями и не имеющими доступа к их весам. Направления, которые авторы называют следующими (персонализация, безопасность генерации, видеомодели), могут быть интересны и разработчикам творческих инструментов. О конкретных продуктах Google в тексте блога речи нет.
Как это применить
Пока это исследовательское описание: в тексте блога не названы статья, код или релиз моделей, поэтому воспроизвести результаты по одному лишь посту нельзя. Из практических деталей известно только, что сеть подключается к замороженной модели, а на этапе инференса одним параметром силы управления можно плавно усиливать или ослаблять ограничения. Четыре реализованные архитектуры и два метода дообучения в тексте не раскрыты.
Можно ли доверять
Источник, блог самой Google Research, все результаты подаются со слов авторов. Заявления о превосходстве над «отраслевым стандартом» и LoRA не подкреплены в тексте числовыми значениями HPS-v2 и конкретными сравнениями; неясно, какая именно базовая модель стоит за «90% побед». Сообщения о том, что подход работает на закрытых моделях, опираются на эксперименты с открытой Stable Diffusion v1.4 в режиме «серого ящика»; проверки на реальных закрытых моделях в тексте не описаны. Метрика в тексте записана и как HPS-v2, и как HPPS-v2.
Риски и подводные камни
Результаты получены на относительно старой базе Stable Diffusion v1.4; перенос на более современные и закрытые модели в тексте не показан. Не приведены затраты вычислений, число параметров и число задействованных слоёв. Заявленные меры безопасности против вредного контента и адаптация к видеомоделям, пока лишь планы, а не результаты.