PANORAMA: VLM с привязкой описания изображения к пикселям

PANORAMA: VLM с привязкой описания изображения к пикселям

Модели, которые понимают изображение (VLM), уже умеют писать связные и подробные подписи к картинкам, но надёжно привязать каждое слово подписи к конкретным пикселям на изображении, задача, с которой существующие методы справляются плохо: они либо дают неполное описание, либо ошибаются в границах масок. Авторы работы формулируют для этого отдельную задачу, panoptic grounded captioning (паноптическое описание с пиксельной привязкой): модель должна описать не только объекты переднего плана, но и фоновые области, и для каждой фразы описания указать, каким именно пикселям изображения она соответствует.

Для этой задачи авторы делают три вещи. Во-первых, они собирают PanoCaps, бенчмарк с ручной разметкой, построенный на основе существующих датасетов паноптической сегментации: в нём подробные подписи почти полностью покрывают изображение по пикселям, а текст связан с объектами на уровне отдельных сущностей; бенчмарк пригоден и для обучения, и для проверки моделей. К нему прилагаются протокол сопоставления фраз с масками и обобщённая метрика Panoptic Quality (gPQ), которая одновременно оценивает и качество текста, и совпадение масок.

Во-вторых, авторы предлагают саму модель, PANORAMA. Привязка фразы к изображению устроена как выбор из пула масок-кандидатов: предобученный сегментатор получает на вход представления фраз с учётом контекста и на их основе генерирует набор возможных масок, а модель обучается выбирать среди них те, что соответствуют каждой фразе. Этот механизм обучается совместно с генерацией самой подписи, и благодаря этому одна фраза может ссылаться как на один объект, так и сразу на несколько.

В-третьих, по заявлению авторов, PANORAMA показывает лучший общий результат по привязке на PanoCaps и не уступает специализированным моделям (либо превосходит их) в нескольких других задачах пиксельной привязки, выдавая точную посегментную разметку при сохранении подписей, согласованных с масками. Конкретных числовых показателей и результатов сравнения в тексте работы не приведено. Код, данные и модели выложены в открытый доступ на странице проекта.

Ключевые факты

  • Новая задача, panoptic grounded captioning: модель должна описать и объекты, и фон изображения, привязав каждую фразу к пиксельным маскам
  • Бенчмарк PanoCaps: ручная разметка на основе датасетов паноптической сегментации, почти полное покрытие изображения по пикселям и связь текста с сущностями
  • Новая метрика gPQ (обобщённая Panoptic Quality) одновременно оценивает и текст, и совпадение масок
  • Модель PANORAMA выбирает нужные маски из пула кандидатов, сгенерированного сегментатором по представлениям фраз, и обучается совместно с генерацией подписи
  • По данным авторов, PANORAMA лидирует на PanoCaps и не уступает специализированным моделям на других задачах; код, данные и модели открыты

Почему это важно

Подробные подписи к изображениям и точная пиксельная сегментация до сих пор развивались как разные задачи: модели, которые бегло описывают картинку, плохо привязывают слова к конкретным пикселям, а модели сегментации не умеют формулировать связный текст. Авторы соединяют обе задачи в одну, panoptic grounded captioning, и предлагают для неё общий бенчмарк, метрику и модель, что даёт исследователям единый способ сравнивать разные подходы, а не оценивать текст и маски порознь.

Кому это важно

В первую очередь, исследователям и инженерам в области компьютерного зрения и мультимодальных моделей, которые работают над связкой текста и изображения. Авторы отдельно отмечают, что такое понимание изображения, и по содержанию полное, и привязанное к конкретным местам на картинке, нужно системам, которые должны действовать в реальном мире, то есть разработчикам робототехники и подобных прикладных систем.

Как это применить

Код, данные и модели PANORAMA выложены в открытый доступ на странице проекта (di.ens.fr/willow/research/panorama). Это позволяет воспроизвести обучение и оценку, использовать PanoCaps и метрику gPQ как стандартный бенчмарк для собственных моделей паноптического описания и grounding-задач, а также использовать саму модель PANORAMA как компонент для получения одновременно подписи и пиксельных масок объектов на изображении.

Можно ли доверять

Это самостоятельная научная работа, и все приведённые оценки, заявления самих авторов, а не сторонняя проверка: утверждения о лидерстве PANORAMA на PanoCaps и о том, что модель не уступает специализированным решениям, взяты из текста работы без независимого воспроизведения. При этом методология описана подробно, отдельный бенчмарк с ручной разметкой, отдельная метрика для совместной оценки текста и масок, а код, данные и модели открыты, что позволяет любому желающему проверить результаты самостоятельно.

Риски и подводные камни

В тексте работы не приведено ни одного конкретного числового показателя, ни значений gPQ, ни размеров бенчмарка PanoCaps, ни цифр сравнения со специализированными моделями, поэтому оценить реальный размер преимущества PANORAMA по самой аннотации нельзя. Бенчмарк и метрика для оценки предложены теми же авторами, что и модель, поэтому сравнение проводится по правилам, которые они сами и задали. Как модель поведёт себя на изображениях и сценах, сильно отличающихся от PanoCaps, из текста не следует.

«Современные модели, понимающие изображение и текст (VLM), уже умеют создавать беглые и подробные подписи к картинкам, но надёжно привязать их к конкретным пикселям изображения по-прежнему сложно.»

— авторы работы