Gemini 31 раз переписал абзац Чандлера, и скатился в хоррор

Автор блога (представляется человеком из области безопасности, пишет от первого лица; имя, дата публикации и точная версия модели в тексте не указаны) исследовал, как ведут себя генеративные модели, если раз за разом заставлять их доедать собственный вывод. По его словам, такая рекурсивная самоподача, «основной механизм агентных циклов» (agent loops), а шире, заметная тема в спорах вокруг ИИ: скептики видят в ней риск «коллапса модели», оптимисты, механизм быстрого самоусиления.
Первый эксперимент, с видео. Автор попросил модель для генерации изображений и видео Nano Banana 2 сделать фейковый киноплакат, а затем раз за разом просил её внести одну и ту же локальную правку, изменить заголовок на плакате. По словам автора, это типичная беда ИИ-редакторов изображений и видео: попыток даётся немного, и через ограниченное число правок накопленные ошибки редактирования обрушивают результат в чистый хаос.
Второй, куда детальнее описанный эксперимент, с текстовой моделью Gemini (от Google). Автор взял абзац из романа Рэймонда Чандлера (название романа в тексте не указано), описание слишком большой комнаты и миссис Риган на шезлонге, и попросил Gemini «смело переписать» его, «улучшив тон, ясность и слог». Дальше на каждом шаге модели показывали только её собственный предыдущий ответ и тот же самый запрос на переписывание, без оригинала Чандлера и без истории более ранних версий.
Уже в первой итерации Gemini свернула к вычурным метафорам: комната стала «громадной, вознёсшейся гробницей выбеленной роскоши», занавески «жадно скопились на ковре», а воздух «был густым от угрозы дождя». К восьмой итерации, по описанию автора, метафоры стали «по-настоящему странными»: нависающие зеркала «превратили резкий блик в оружие», ноги миссис Риган были «созданы для разрушения», а её рот источал «ненасытную жажду уничтожения». К двенадцатой, «неизведанная территория»: ковры «душат комнату стерильным, неумолимым богатством», гроза готова «разбить стекло от пола до потолка», а сама миссис Риган, «чистая, беззастенчивая злоба». После шестнадцатой роскошь уже не просто заполняла комнату, а «уничтожала» её; удушающий белый ковёр «поглощал пространство», погружая его в ослепляющее, мучительное сияние; ноги героини «резали воздух, как стилеты», а её обсидиановые глаза «горели одним лишь желанием, уничтожать».
Примерно к двадцатой итерации вывод модели стабилизировался и дальше крутился вокруг небольшого набора синонимов: интерьер «лишает», «выскребает» или «искореняет» следы человеческого тепла, миссис Риган, то «чистый яд», то «сгущённый яд», а её цель, «разобрать», «разорвать», «уничтожить» или «содрать шкуру» с героя. На 31-й итерации переписывание окончательно осело в устойчивом варианте, который автор приводит целиком: «Комната превратила свою роскошь в оружие, стерев всякий след человеческого тепла. Слепящий, клинически холодный свет обжигал безупречный шёлк, отточенный, как лезвие, хром и безукоризненный ковёр. За стеклом бушевала иссиня-багровая гроза; внутри свинцовый хрусталь и зеркала разбивали блик на острые осколки. Я замер перед миссис Риган, ядом, обёрнутым в высокую моду. Откинувшись на низком шезлонге, она держала ноги, укрытые тончайшей тканью, которые резали пространство, как обсидиановые клинки. Безжалостная и удушающая, она была живым зеркалом чудовищного портрета в холле. Каждый острый изгиб её челюсти и каждый застывший взгляд обещали одно: она собиралась меня уничтожить». Автор иронично резюмирует: кто бы знал, что у Рэймонда Чандлера был такой талант к хоррору.
Объяснение автора такому расхождению между текстом и изображением: у изображений на каждом шаге конвейера копится шум, поэтому редактирование картинок и видео быстро срывается в хаос. У текста кодирование без потерь, а добавляемая на каждый токен энтропия мала, поэтому простые, точно поставленные задачи (например, «замени одно слово») модель почти всегда решает без побочных повреждений остального текста. Но открытые, не жёстко заданные просьбы переписать текст, другое дело: большинство таких запросов не расходятся до бесконечности, система «немного побуксует» и осядет в устойчивом результате, однако этот результат может оказаться очень далёк от исходного.
Автор связывает интерес к этой рекурсии с более широкими спорами вокруг ИИ, «коллапсом модели», которым пугают скептики, и быстрым самоусилением, которого ждут оптимисты, но сам эксперимент с абзацем Чандлера не претендует на то, чтобы что-то из этого доказать: это иллюстрация того, как ведёт себя рекурсивное самопоедание вывода на практике, а не измерение коллапса модели.
В постскриптуме автор отмечает: из-за процитированных фрагментов, сгенерированных ИИ (в тексте они помечены отдельным значком), сам пост не пройдёт проверку детектором Pangram, но весь текст, кроме этих отмеченных цитат, написан человеком.
Ключевые факты
- Автор 31 раз подряд прогнал один и тот же запрос «смело переписать» через Gemini, каждый раз показывая модели только её последний ответ, без оригинала Чандлера и без истории версий.
- Уже в 1-й итерации текст уходит в вычурные метафоры («гробница выбеленной роскоши»); к 8-й они «по-настоящему странные», к 12-й, «неизведанная территория», после 16-й, откровенно хоррорные («уничтожала», «как стилеты», «жажда уничтожения»).
- Примерно с 20-й итерации вывод стабилизируется и крутится вокруг узкого набора синонимов («чистый яд», «содрать шкуру»); финальный устойчивый вариант зафиксирован на 31-й итерации.
- Параллельный опыт с видео-моделью Nano Banana 2, повторные локальные правки заголовка на фейковом киноплакате, показал ту же беду: после ограниченного числа правок накопленные ошибки редактирования обрушивают изображение в хаос.
- Автор увязывает интерес к теме с фоновым спором про «коллапс модели» у скептиков ИИ и быстрое самоусиление у оптимистов, но прямо не заявляет, что сам эксперимент это доказывает.
Почему это важно
Рекурсивная самоподача вывода, когда модель на каждом шаге видит только свой предыдущий ответ и ту же инструкцию, это, по словам автора, «основной механизм агентных циклов»: именно так работают цепочки, где ИИ через несколько проходов сам себе «улучшает» черновик, критикует и переписывает собственный ответ. Эксперимент даёт наглядный, воспроизводимый пример того, что происходит с открытой, не жёстко заданной инструкцией переписывания в такой петле: текст не расходится до бесконечности, но и не остаётся на месте, он через десятки итераций эскалирует по тону, а затем оседает в точке, которая может быть совсем не похожа на исходную.
Кому это важно
Разработчикам агентных систем и промпт-цепочек, где модель многократно правит собственный вывод без сверки с оригиналом. Тем, кто использует ИИ-редакторы изображений и видео с последовательными правками (Nano Banana 2 и похожие инструменты), им пригодится представление о том, как быстро копятся ошибки редактирования. Участникам спора о «коллапсе модели» и темпах самоусиления ИИ, как источник конкретного, хотя и небольшого, кейса для иллюстрации, а не как доказательство.
Как это применить
Если инструкция на каждом шаге открытая («улучши», «перепиши»), закладывай, что итоговый результат после многих проходов может стабилизироваться, но при этом сильно уйти по тону и смыслу от исходного текста, сверяй промежуточные версии с оригиналом, а не только финальную. Для итеративного редактирования изображений и видео закладывай малое число правок за проход и проверяй результат заранее, а не постфактум, когда накопленные ошибки уже обрушили его в хаос.
Можно ли доверять
Это личное неформальное эссе одного автора (пишет от первого лица, представляется человеком из области безопасности; имя, дата и точная версия модели Gemini в тексте не указаны), а не рецензируемое исследование. Методология простая и прозрачно описана: на каждом шаге модели передавали только её предыдущий ответ и один и тот же запрос на переписывание. Но это один прогон на одном абзаце и одной паре моделей, обобщать результат на другие модели, версии или тексты нельзя, и сам автор не заявляет, что эксперимент измеряет «коллапс модели»: это лишь иллюстрация к фоновой дискуссии, а не её доказательство.
Риски и подводные камни
Выводы нельзя переносить на другие модели или другой промпт: иная формулировка запроса или другая версия Gemini может стабилизироваться иначе или не стабилизироваться вовсе. Устойчивый итог, не синоним безопасного или приемлемого итога: в этом случае он оказался куда более зловещим по тону, чем исходный текст Чандлера. Главный практический риск, для автоматизированных агентных цепочек, где промежуточные версии никто не читает: дрифт тона и смысла может накопиться незаметно за много проходов, если в цепочке нет проверки на расхождение с оригиналом.
«Кто бы знал, что у Рэймонда Чандлера был такой талант к хоррору.»
— автор поста