WithEveryone: фреймворк генерирует групповые фото с точным сохранением лиц до 10 человек

Чем больше людей нужно разместить на одной сгенерированной картинке, тем хуже нейросети справляются с сохранением их лиц: модель должна не только удержать внешность каждого человека, но и правильно привязать каждую ссылку-референс к конкретной персоне и месту в кадре, а при обучении, научиться сопоставлять несколько зашумлённых предсказанных лиц друг с другом. Авторы предлагают WithEveryone, унифицированный фреймворк, который генерирует групповые изображения с сохранением идентичности сразу для десяти референсных личностей.
Каждая выбранная личность подаётся в модель как отдельный адресуемый токен. Сначала система предсказывает структурированный план «личность-расположение» (кто где на кадре стоит), а затем превращает этот план в визуальное условие для самой генерации изображения. Два ключевых компонента метода: Layout-Grounded ID Loss, функция потерь, которая использует размеченные области лиц, чтобы напрямую указывать модели на нужную личность, вместо нестабильного сопоставления лиц по эмбеддингам; и ID Representation Forcing, дополнительное обучение, которое заранее строит представление каждой личности ещё до синтеза самого изображения.
На тестовом бенчмарке с непересекающимися личностями (identity-disjoint benchmark) WithEveryone показал наивысшее сходство лиц в целевом контексте среди сравниваемых подходов: показатель сходства вырос с 0,462 у GPT-Image-2 до 0,499, а доля артефактов «копипаста» лиц (когда лицо просто механически переносится с референса) упала с 0,169 до 0,055. Кроме того, фреймворк покрывает 97,3% запрошенных личностей при частоте дублей (когда одна и та же личность случайно появляется дважды) всего 2,8%. Авторы делают вывод: явное «заземление» личности через план расположения позволяет масштабировать сохранение идентичности на большие группы людей, не полагаясь на прямое копирование лиц с референсных изображений.
Ключевые факты
- WithEveryone генерирует групповые изображения с сохранением лиц одновременно для десяти референсных личностей
- Каждая личность вводится как отдельный токен; модель сперва строит план размещения людей в кадре, который затем становится визуальным условием для генерации
- Layout-Grounded ID Loss опирается на размеченные области лиц вместо нестабильного сопоставления по эмбеддингам; ID Representation Forcing заранее строит представление каждой личности до синтеза изображения
- На тестовом бенчмарке сходство лиц выросло с 0,462 (у GPT-Image-2) до 0,499, а доля артефактов «копипаста» лиц упала с 0,169 до 0,055
- Фреймворк покрывает 97,3% запрошенных личностей при частоте дублей 2,8%
Почему это важно
Сохранение внешности сразу нескольких людей на одной сгенерированной картинке, известное слабое место моделей генерации изображений: чем больше персон в кадре, тем чаще модель путает, кому какое лицо принадлежит, или просто механически копирует референсное лицо вместо того, чтобы органично вписать его в сцену. WithEveryone решает это явным «планированием», модель сначала размечает, кто где будет стоять, и только потом рисует изображение по этому плану, что и даёт измеримый прирост точности на группах до десяти человек.
Кому это важно
Работа адресована исследователям и инженерам, которые развивают генеративные модели изображений с сохранением идентичности, а также командам, которые строят на таких моделях продукты, групповые фото, коллективные аватары, рекламные и маркетинговые изображения с несколькими узнаваемыми людьми в кадре.
Как это применить
В тексте описан именно метод и результаты замеров на бенчмарке, ни дата публикации, ни код, ни доступность обученной модели не упомянуты. Поэтому практическое применение пока зависит от того, воспроизведут ли метод другие команды или он будет интегрирован в существующие генеративные пайплайны; готового инструмента для конечного пользователя из текста не следует.
Можно ли доверять
Материал опубликован как препринт на HuggingFace Papers, а заявленные улучшения (по сходству лиц, доле артефактов, покрытию и дублям), это результаты авторского замера на одном бенчмарке с одной базовой моделью для сравнения (GPT-Image-2), без независимой проверки. В самой аннотации не раскрыта методика измерения показателей «сходство лиц», «артефакты копипаста» и «частота дублей», а имя автора и институция в тексте аннотации не указаны.
Риски и подводные камни
Цифры приведены без описания методологии измерения и без сравнения с другими современными подходами, кроме GPT-Image-2, неясно, насколько преимущество WithEveryone сохранится на более широком наборе конкурентов. Отсутствие кода или обученной модели делает результаты пока непроверяемыми независимо.