MPIE-Bench: бенчмарк уличил ИИ-редакторы в анатомических ошибках при монтаже нескольких людей

Модели генерации и персонализированного редактирования изображений уже уверенно справляются со сценами с одним человеком в кадре. Но как только в кадре оказываются несколько названных людей, выполняющих совместное действие с физическим контактом, объятие, переноска на руках, борьба, модели часто ошибаются: конечности сливаются друг с другом, появляются лишние руки и ноги, тела проникают одно в другое. Существующие способы оценки эти геометрические и анатомические проблемы почти не улавливают: чек-листы, где судьёй выступает модель класса VLM (vision-language model, модель, понимающая и изображение, и текст), по параметру «взаимодействие» выставляют почти максимальные оценки, хотя человеку ошибки видны сразу.
Авторы во главе с Цзяцзя Линь представили MPIE-Bench, бенчмарк из 2500 примеров для редактирования, собранных на основе видео, который охватывает 405 сцен, 14 категорий взаимодействий (объятия, переноска, борьба и другие) и четыре уровня плотности контакта, от C0 до C3.
Вместе с бенчмарком предложена метрика MPIE-Eval с двумя новыми осями оценки, которые считают геометрию контакта на основе готовой публичной модели реконструкции 3D-моделей тел нескольких людей. Ось Anatomy (анатомия) проверяет, объясняется ли каждая похожая на человека масса на изображении полным набором реконструированных тел, то есть нет ли лишних или недостающих частей. Ось Interaction (взаимодействие) проверяет, соответствуют ли степень взаимного проникновения тел и расстояние между их поверхностями тому контакту, который требовала инструкция редактирования.
На выборке из десяти моделей редактирования лучший результат по оси Anatomy составил 0,65, по оси Interaction, 0,72 (у двух разных моделей), то есть ни одна модель не показала высокий результат сразу по обеим осям. При этом те же самые изображения при оценке чек-листами с ИИ-судьёй (VLM) получили оценки выше 0,95, автоматический ИИ-судья массово завышает качество там, где анатомия и физика тел явно нарушены.
Авторы проверили новую метрику отдельным исследованием с пятью независимыми оценщиками-людьми: обе новые оси коррелируют с оценками людей заметно точнее, чем судья на основе VLM в режиме без дообучения на задаче. Ранжирование моделей по метрике осталось устойчивым при отключении (абляции) любого веса или порога в формуле расчёта.
Ключевые факты
- MPIE-Bench: 2500 примеров редактирования, 405 сцен, 14 категорий взаимодействий, 4 уровня плотности контакта (C0, C3)
- Метрика MPIE-Eval считает геометрию контакта по 3D-реконструкции тел: ось Anatomy (нет лишних или недостающих частей тела) и ось Interaction (проникновение и дистанция между телами соответствуют инструкции)
- Из 10 протестированных моделей редактирования лучший результат, 0,65 по Anatomy и 0,72 по Interaction; ни одна модель не сильна сразу по обеим осям
- Чек-листы с ИИ-судьёй (VLM) на тех же изображениях ставят оценку выше 0,95, то есть массово не замечают анатомические ошибки, которые видны человеку
- Пятеро независимых оценщиков-людей подтвердили, что новые оси точнее отражают человеческое суждение, чем VLM-судья; ранжирование устойчиво к изменению весов и порогов
Почему это важно
ИИ-редакторы изображений уже неплохо справляются с одним человеком в кадре, но массово используются и для сцен с несколькими людьми, совместные фото, реклама, монтаж для соцсетей. MPIE-Bench впервые системно измеряет именно эту слепую зону: анатомическую достоверность контактных поз вроде объятий, переноски и борьбы. Работа также показывает, что стандартный способ автоматической проверки качества, оценка через ИИ-судью (VLM), в таких сценах даёт ложно высокие оценки, то есть индустрии нужен более надёжный способ измерения.
Кому это важно
Разработчикам моделей генерации и редактирования изображений, командам, которые встраивают такие модели в продукты, фоторедакторы, рекламные и соцсетевые инструменты, и исследователям, которые строят автоматические метрики качества для генеративных моделей.
Как это применить
MPIE-Bench можно использовать как готовый набор тестовых сцен (2500 примеров, 14 категорий взаимодействий, 4 уровня плотности контакта) для проверки собственной модели редактирования перед релизом. Метрика MPIE-Eval с осями Anatomy и Interaction считается автоматически на основе публичной модели 3D-реконструкции тел и может заменить или дополнить проверку через ИИ-судью там, где в кадре несколько взаимодействующих людей.
Можно ли доверять
Да, с оговоркой на масштаб проверки. Авторы подтвердили метрику отдельным исследованием с пятью независимыми оценщиками-людьми, обе оси точнее совпадают с их суждением, чем оценка VLM-судьи, а ранжирование моделей остаётся стабильным при изменении весов и порогов метрики. Это говорит о методической аккуратности, но сама работа, новый бенчмарк, ещё не прошедший широкую проверку сообществом.
Риски и подводные камни
Главный риск, обратный: команды, которые доверяют оценке через ИИ-судью, рискуют считать свою модель почти безупречной (оценка выше 0,95), хотя по факту она регулярно ошибается в анатомии контактных сцен (максимум 0,65, 0,72 по новым осям). Кроме того, сама метрика MPIE-Eval зависит от качества внешней модели реконструкции тел нескольких людей, если эта модель ошибается, её ошибки могут переноситься и в итоговую оценку.