Учёные объяснили, почему еда на ИИ-картинках выглядит отвратительно

Учёные объяснили, почему еда на ИИ-картинках выглядит отвратительно

Рестораны и бренды еды всё чаще генерируют рекламные фото нейросетями, и результат регулярно пугает: креветки-пончики, сэндвичи-реубены «из бездны», червеобразная лапша, мороженое, похожее на мозг или бетон, бургеры без внятной формы. The Verge спросил у нескольких учёных, почему так происходит. Первая причина, сам принцип работы диффузионных моделей. Они начинают с чистого шума и постепенно убирают его, сначала восстанавливая грубую структуру объекта и лишь потом добавляя детали текстуры. Крис Расселл, профессор ИИ и государственной политики Оксфордского университета и специалист по компьютерному зрению, объясняет: если модель ошиблась на этапе крупной структуры, поверх неё всё равно ляжет яркая текстура, «это та же самая ошибка, что и когда у человека на изображении рисуют шесть пальцев вместо пяти», говорит Расселл. Это, по его словам, может объяснять и креветок-пончиков. Вторая причина, тонкие, непрерывные, обрывающиеся структуры вроде лапши, нитей и усиков в принципе плохо даются диффузионным моделям, говорит Джованбаттиста Калифано, бихевиорист из Неаполитанского университета имени Фридриха II, изучающий реакции людей на ИИ-изображения. Модель не знает, где такой структуре следует остановиться и к чему прикрепиться, из-за чего «спагеттиобразные» артефакты расползаются туда, где им не место анатомически или кулинарно. По той же причине повторяющиеся текстуры вроде пузырьков и семечек часто выходят за разумные границы, отсюда обилие дыр, которые могут вызывать трипофобию. Третья причина глубже: ИИ в принципе не знает, что такое сэндвич, лапша или буррито. Модель усвоила статистически, как эти вещи обычно выглядят, но не понимает, почему они так выглядят и как должны себя вести физически. «ИИ-генерация изображений воспроизводит внешний вид без должного знания о мире», говорит Роланд Майер, профессор цифровых культур и искусств Цюрихского университета в Швейцарии. Из-за этого текстуры, нормальные в архитектурном контексте, например, бетон, могут переползти на еду: отсюда мороженое, похожее на потрескавшийся бетон, и бургеры, будто сложенные из камней. «Эти текстуры могут выглядеть совершенно нормально в архитектурном контексте, поясняет Майкл Кук, старший преподаватель компьютерных наук Королевского колледжа Лондона., Но становятся неправильными, когда мы представляем это съедобной едой». Свою роль играют и данные, на которых обучают модели. По словам Кука, о составе обучающих выборок известно немного, поэтому неясно, какие ассоциации модель успела усвоить. Фуд-фотография сама по себе сильно стилизована, резкие контрасты, насыщенные цвета, глянцевый свет, и модели, по мнению Майера, копируют эти поверхностные приёмы, не понимая профессиональной логики за ними: «ИИ-генерация изображений прекрасно имитирует внешний вид фотографии, но не её профессиональные эстетические приёмы, говорит Майер., Именно это в итоге делает их такими тревожными». Есть и эффект интернет-контента: обычных, «скучных» фотографий, например красного яблока, в сети немного, кому интересно выкладывать скучное яблоко, отмечает Саймон Колтон, профессор вычислительного творчества, игр и искусственного интеллекта Университета Королевы Марии в Лондоне. Зато странные изображения расходятся по соцсетям и становятся мемами, и модель усваивает именно этот перекошенный набор ассоциаций. Кук добавляет, что ИИ-системы всё чаще обучают уже на ИИ-сгенерированном контенте, включая популярные видео с людьми, прыгающими в кучи еды, а исследования, по словам издания, указывают, что обучение моделей на выдаче других моделей может приводить к «коллапсу модели»: визуальной деградации и нарастающей однообразности изображений. Добавляют проблем и сами промпты, как пользовательские, так и системные инструкции компаний: они бывают расплывчатыми («просто сэндвич») или содержат формулировки вроде «будь точным», которые имеют смысл для текста, но не для генерации картинки. Изображения низкого разрешения при этом часто растягивают до большего размера, из-за чего любые дефекты становятся заметнее. И наконец, реакция самого человека. Учёные считают, что отвращение как эмоция сформировалось эволюционно, чтобы защищать людей от паразитов, патогенов и токсинов, поэтому люди особенно чувствительны именно к «неправильности» еды. Калифано отмечает, что из-за этого «зловещая долина» для еды переживается ещё острее, чем для похожих-на-людей изображений: странная лапшеобразная текстура напоминает червей или паразитов, скопления дыр, заражение, а неестественные цвета, порчу продукта.

Ключевые факты

  • Диффузионные модели сначала восстанавливают грубую структуру объекта из шума и только потом, детали текстуры; ошибка на первом этапе (как и «шесть пальцев» у людей) остаётся под слоем текстуры
  • Тонкие непрерывные структуры, лапша, нити, усики, и повторяющиеся текстуры вроде пузырьков и семечек особенно плохо даются диффузионным моделям, отсюда «спагеттиобразные» артефакты и дыры
  • Модель знает статистически, как выглядит еда, но не понимает, что это такое и как она устроена физически, поэтому архитектурные текстуры вроде бетона переползают на мороженое и бургеры
  • Обучение моделей на ИИ-сгенерированном контенте, по данным издания, связывают с «коллапсом модели», визуальной деградацией и растущим однообразием изображений
  • Отвращение к неправильной еде, эволюционная защита от паразитов и порчи продуктов, поэтому люди особенно остро реагируют именно на ИИ-еду, острее, чем на похожих-на-людей артефакты

Почему это важно

Материал, не про конкретный продукт, а про системную техническую причину: диффузионные модели восстанавливают изображение от грубой структуры к деталям, плохо справляются с тонкими непрерывными формами вроде лапши и не обладают пониманием физического мира. Это объясняет устойчивый и узнаваемый визуальный паттерн ИИ-еды, не случайность конкретного генератора, а системное ограничение самого подхода.

Кому это важно

Брендам, ресторанам и маркетологам, которые используют ИИ-генерацию для рекламных фото еды, им полезно знать, где именно модель обычно ломается. Разработчикам и исследователям генеративных моделей, это конкретный разбор известного класса ошибок диффузионных моделей. Читателям, которые просто хотят понять, почему ИИ-еда в интернете выглядит именно так.

Как это применить

Перед публикацией ИИ-сгенерированного изображения еды стоит внимательно проверять именно уязвимые места: тонкие вытянутые элементы (лапшу, нити), повторяющиеся текстуры (пузырьки, семечки, дырчатые поверхности) и общую физическую правдоподобность формы, а не только цвет и композицию. Расплывчатые промпты и инструкции вроде «будь точным» для изображений не работают так, как для текста, конкретика в описании объекта снижает риск.

Можно ли доверять

Материал опирается на пять названных академических экспертов из разных университетов (Оксфорд, Неаполь, Цюрих, Королевский колледж Лондона, Университет Королевы Марии) с указанием их должностей и специализации, их слова приведены как прямые цитаты. Слабое место, упоминание «коллапса модели» со ссылкой на «исследования» без указания конкретной работы: это утверждение статьи, а не строго процитированный результат.

Риски и подводные камни

Публикация неудачных ИИ-изображений еды может вредить восприятию бренда, материал прямо описывает эффект отвращения, который они вызывают. Отдельный риск для самой индустрии, самоусиливающийся цикл: если модели всё активнее обучают на ИИ-сгенерированном контенте, тенденция к визуальной деградации («коллапс модели») может закрепляться. В статье не назван ни один конкретный генератор изображений, выводы общие, для конкретных моделей и версий детали могут отличаться.

«Диффузионные модели крайне слабы в генерации тонких, непрерывных, обрывающихся структур»

— Джованбаттиста Калифано, бихевиорист, Неаполитанский университет имени Фридриха II