Эксперимент: ИИ-лаборатории не подгоняют модели под тест «пеликан на велосипеде»

Много лет подряд разработчик и автор блога Саймон Уиллисон тестирует каждую новую крупную модель одним и тем же промптом: «Сгенерируй SVG-изображение пеликана, едущего на велосипеде». Из шутки этот тест превратился в один из самых известных неформальных бенчмарков в мире ИИ, результаты Уиллисона часто набирают больше всего голосов в обсуждениях новых релизов на Hacker News. Из-за такой известности возник вопрос: раз на кону миллиарды долларов инвестиций и удачный результат в этом тесте помогает убеждать пользователей, не «подгоняют» ли лаборатории свои модели именно под эту картинку, практика, которую в комьюнити называют «пеликанмаксингом» (по аналогии с общим термином «бенчмаксинг», то есть оптимизацией модели под конкретный тест вместо реального улучшения качества).

Чтобы это проверить, разработчик Дилан Кастильо (dylancastillo.co) провёл собственный эксперимент. Он построил сетку из 8 животных (пеликан, фламинго, цапля, выдра, енот, антилопа, кит, кошка) и 6 транспортных средств (велосипед, моноцикл, скейтборд, самокат, самолёт, лодка), итого 48 комбинаций-промптов, повторяющих формулировку Уиллисона с заменой животного и транспорта. Каждую комбинацию он сгенерировал по 3 раза при температуре 1.0 на семи топовых моделях через OpenRouter: GPT-5.6 Terra, Claude Sonnet 5, Gemini 3.5 Flash, Grok 4.5, Qwen3.7-Max, GLM-5.2 и DeepSeek V4 Pro. Итого получилось 1008 SVG-изображений (лишь 11 из них потребовали повторной генерации из-за невалидного SVG).

Каждое изображение прогонялось через конвейер из трёх этапов: рендер SVG в PNG; оценка моделью-судьёй GPT-5.6 Luna по шкале 1, 5 сразу по трём критериям, узнаваемость животного, узнаваемость транспорта и связность сцены (итоговый «судейский балл», среднее по трём оценкам); и извлечение признаков моделью Gemini 3.1 Flash-Lite, которая фиксировала, какое животное и транспорт распознаны, куда повёрнут персонаж и какие ещё элементы есть на сцене. Статистический анализ данных Кастильо делал с помощью Claude Fable 5.

Результаты не подтвердили гипотезу о подгонке. По среднему баллу за качество рисунка пеликан занял лишь 6-е место из 8 животных, уступив кошке, киту, еноту, цапле и антилопе. Велосипед оказался предпоследним из 6 видов транспорта, почти сравнявшись по худшему результату с самолётом (у самолёта модели чаще путали задание, на 25 из 168 изображений детектор вообще не нашёл транспортного средства, вероятно, из-за слова «plane», которое модели иногда понимали буквально как «плоскость»). Комбинация «пеликан на велосипеде» с учётом обеих оценок заняла 42-е место из 48 возможных пар, то есть оказалась в нижней части рейтинга, а не в верхней, как ожидалось бы при целевой подгонке.

Чтобы учесть, что часть комбинаций объективно сложнее рисовать, чем другие, Кастильо построил регрессию с фиксированными эффектами по всем 1008 изображениям (переменные: лаборатория, взаимодействие «животное × транспорт», плюс отдельные поправки на пеликана, велосипед и именно ячейку «пеликан-велосипед» для каждой лаборатории). После этой поправки на сложность ни у одной из семи лабораторий не нашлось статистически значимого «буста» именно под пеликана: диапазон эффекта, от −0,11 до +0,14 судейского балла, ни один результат не значим (минимальное p-значение, 0,25). По велосипеду один результат формально прошёл порог значимости, у Gemini 3.5 Flash буст +0,27 при p=0,022, но при поправке на множественные сравнения (порог Бонферрони по 21 тесту ≈ 0,002) этот результат уже не проходит. Ни у одной лаборатории не нашлось значимого эффекта именно для сочетания «пеликан + велосипед» сверх отдельных эффектов по животному и транспорту; ближе всего к сигналу подошла модель GLM-5.2 (+0,35 балла), но и там p=0,12, недостаточно для значимости.

Отдельно Кастильо проверил гипотезу о «заученной» композиции: все 21 изображение пеликана на велосипеде (по три от каждой из семи лабораторий) смотрят вправо, единственная комбинация в сетке с полным единодушием. Но это не выглядит аномалией: вправо смотрят 60% вообще всех 1008 изображений, а ещё три пары «животное-транспорт» (антилопа и пеликан на самокате, 20 из 21, цапля на велосипеде, 19 из 21) почти так же единодушны. Анализ повторяющихся элементов сцены тоже не выявил у пеликана на велосипеде ничего особенного: у других пар совпадения даже сильнее, у фламинго на лодке солнце присутствует на всех картинках, у выдры на самолёте в 38% случаев рисуют шарф, у кошки на велосипеде в 38% случаев, корзинку.

Вывод автора: явных доказательств «пеликанмаксинга» нет ни у одной из проверенных лабораторий. Сам Кастильо честно перечисляет ограничения эксперимента: оценки ставила только одна модель-судья (притом из той же линейки, что и одна из тестируемых, GPT-5.6 Terra), бюджет эксперимента составил около $80 в API-кредитах, что ограничило выборку тремя образцами на ячейку. Главное ограничение метода, он не способен обнаружить так называемый «SVG-максинг»: если лаборатория в принципе целенаправленно улучшает генерацию SVG (по словам автора, так открыто делают в Google/DeepMind), это поднимает результаты сразу по всей сетке и неотличимо от общего высокого качества модели. По мнению автора, именно общий «SVG-максинг», а не точечная подгонка под конкретный мем, более правдоподобное объяснение того, почему некоторые лаборатории стабильно рисуют лучше.

Ключевые факты

  • Дилан Кастильо сгенерировал 1008 SVG-изображений на сетке 8 животных × 6 видов транспорта (48 комбинаций, по 3 образца) на семи моделях: GPT-5.6 Terra, Claude Sonnet 5, Gemini 3.5 Flash, Grok 4.5, Qwen3.7-Max, GLM-5.2, DeepSeek V4 Pro.
  • Судья GPT-5.6 Luna оценивал рисунки по шкале 1, 5; пеликан занял только 6-е место из 8 животных по качеству, велосипед, предпоследнее из 6 видов транспорта, а комбинация «пеликан на велосипеде», 42-е место из 48.
  • Регрессия с поправкой на сложность и на множественные сравнения (порог Бонферрони) не выявила статистически значимого эффекта подгонки именно под пеликана-на-велосипеде ни у одной из семи лабораторий.
  • Все 21 изображение пеликана на велосипеде смотрят вправо, но это не аномалия: вправо смотрят 60% всех 1008 изображений, у других пар «животное-транспорт» единодушие тоже почти полное.
  • Автор считает более вероятным объяснением общий «SVG-максинг», целенаправленное улучшение генерации SVG в целом (например, в Google/DeepMind), которое поднимает результаты по всей сетке и не поддаётся обнаружению этим методом.

Почему это важно

Тест «нарисуй пеликана на велосипеде» Саймона Уиллисона за несколько лет стал одним из самых узнаваемых неформальных бенчмарков в мире ИИ: результаты по нему часто становятся самыми обсуждаемыми комментариями на Hacker News при анонсе новых моделей. Раз лаборатории тратят миллиарды на обучение и заинтересованы производить хорошее впечатление, возникло подозрение, что кто-то из них мог целенаправленно натренировать модель именно на эту картинку. Эксперимент Кастильо, первая известная попытка проверить это подозрение статистически, а не на глазок по одной картинке.

Кому это важно

Материал полезен всем, кто следит за релизами больших языковых моделей и опирается на неформальные бенчмарки при выборе модели, а также исследователям, изучающим проблему подгонки моделей под конкретные публичные тесты (benchmark contamination / overfitting). Методология эксперимента интересна и инженерам, которые сами строят автоматизированные пайплайны оценки качества генерации через LLM-судью.

Как это применить

Ключевой практический вывод, не судить о возможностях модели по одному яркому примеру: нужно смотреть на целую сетку похожих задач, как это сделал Кастильо (8 животных × 6 видов транспорта). Сам подход, построить сетку близких промптов, оценить их LLM-судьёй и разложить результат регрессией с фиксированными эффектами, чтобы отделить «сложность задачи» от «специфической подгонки», воспроизводим и для проверки других похожих подозрений в подгонке под конкретный публичный тест. Весь код и данные эксперимента выложены автором в открытый репозиторий.

Можно ли доверять

Методология прозрачна: автор публикует код, данные и делает поправку на множественные сравнения (порог Бонферрони), что снижает риск ложноположительных выводов. Но это независимое исследование одного автора, не рецензируемая научная работа, а сам автор честно перечисляет ограничения: оценки ставила только одна модель-судья (GPT-5.6 Luna), которая при этом из той же линейки, что и одна из тестируемых моделей (GPT-5.6 Terra); бюджет эксперимента, около $80, что ограничило выборку тремя образцами на комбинацию.

Риски и подводные камни

Главный риск, переоценить общность вывода: эксперимент опровергает точечную подгонку именно под «пеликана на велосипеде», но признаёт, что не способен обнаружить более общий «SVG-максинг», целенаправленное улучшение генерации SVG в целом, которое, по словам автора, некоторые лаборатории (например, Google/DeepMind) делают открыто. Небольшая выборка (3 образца на комбинацию, бюджет $80) и единственный судья также означают, что мелкий эффект подгонки мог остаться незамеченным, доверительные интервалы в исследовании достаточно широкие.

«Простите, ненавистники с Hacker News, но нет весомых доказательств, что ИИ-лаборатории занимаются «пеликанмаксингом». Или, по крайней мере, они не делают этого откровенно.»

— Дилан Кастильо, автор эксперимента