Claude Opus 5 нарисовала лягушку с габсбургской челюстью

Сайт frogs.vaguespac.es, личный бенчмарк одного автора: он прогоняет через разные ИИ-модели один и тот же запрос «нарисуй SVG лягушки с габсбургской челюстью» (историческая отсылка к характерной выступающей нижней челюсти династии Габсбургов, следствию близкородственных браков) и публикует для каждой модели сгенерированный код SVG вместе с коротким вердиктом: остаётся ли модель в комментариях к своему же коду при нейтральных структурных подписях или соскальзывает в художественную интерпретацию.

Первой в перехваченном тексте страницы разобрана модель anthropic/claude-opus-5 (Anthropic). Вердикт: комментарии в её SVG-коде в основном структурные подписи, но встречается и художественность, Claude Opus 5 подписала фрагмент кода «ГАБСБУРГСКАЯ ЧЕЛЮСТЬ: массивная выступающая нижняя челюсть», описала верхнюю губу как «утопленную, спрятанную за челюстью», а нижние зубы, как «выступающие» над верхней губой. По оценке автора бенчмарка, это уже не простая подпись детали, а анатомическая интерпретация.

В перехваченном тексте есть ещё два разбора моделей, но их названия и разработчики не попали в сохранённый фрагмент страницы. У второй модели комментарии тоже в основном структурные, но добавлена гиперболизация («ОГРОМНАЯ выступающая габсбургская челюсть», «нижние зубы выпирают над верхней губой») и намёк на настроение и царственную осанку через подпись «томные величавые веки». У третьей модели комментарии тоже преимущественно структурные, с акцентом на выраженность деформации («массивная удлинённая выступающая нижняя челюсть», «нижний прикус: западающая верхняя губа, выступающая нижняя губа»), но без каких-либо намёков на настроение или царственность, за исключением самой подписи «ГАБСБУРГСКАЯ ЧЕЛЮСТЬ» как таковой.

Общее число моделей в бенчмарке, методика и итоговый рейтинг в захваченном тексте не приведены. Обсуждение на Hacker News за первые 9 часов набрало 123 балла и 58 комментариев.

Ключевые факты

  • Личный бенчмарк на сайте frogs.vaguespac.es прогоняет один и тот же запрос, нарисовать SVG-лягушку с «габсбургской челюстью», через разные ИИ-модели и проверяет их код на художественную отсебятину.
  • Модель anthropic/claude-opus-5 (Anthropic) в комментариях к своему SVG-коду в основном придерживалась структурных подписей, но написала «массивная выступающая нижняя челюсть» и описала губы и зубы с элементами анатомической интерпретации.
  • Ещё две модели в тексте разобраны без указания названия: одна добавила намёк на царственную осанку («томные величавые веки»), другая ограничилась акцентом на выраженности деформации без упоминаний настроения.
  • Полный список моделей, методика оценки и итоговый рейтинг бенчмарка в сохранённом тексте страницы не приведены.
  • Пост на Hacker News за 9 часов набрал 123 балла и 58 комментариев.

Почему это важно

Формально безобидный тест на рисование лягушки на деле проверяет более общее свойство языковых моделей: держатся ли они нейтрального, инструктивного тона там, где просили именно его, или соскальзывают в оценочные, художественные формулировки даже внутри технических артефактов вроде комментариев к коду. Для Claude Opus 5 автор бенчмарка фиксирует именно это, часть подписей в SVG-коде выходит за рамки простого описания детали.

Кому это важно

Разработчикам, которые используют языковые модели для генерации SVG-графики и другого кода с комментариями, им может быть важно, что модель способна незаметно добавлять оценочные формулировки там, где просили нейтральное описание. Также интересно исследователям поведения моделей и авторам собственных нестандартных бенчмарков вне стандартных бенчмарк-наборов.

Как это применить

Полный список моделей, сгенерированный код и вердикты можно посмотреть на самом сайте frogs.vaguespac.es, в перехваченном тексте страницы приведены только фрагменты для трёх моделей. Идею теста, один и тот же нестандартный визуальный запрос через разные модели с проверкой тона комментариев, можно повторить для собственной оценки поведения моделей на нетипичных задачах.

Можно ли доверять

Источник, личный сайт одного автора, а не рецензируемое исследование: методика отбора моделей, критерии вердикта и итоговый рейтинг в захваченном тексте не раскрыты. Захваченный фрагмент обрывается на середине кода третьей модели, поэтому неизвестно, сколько моделей протестировано всего и как выглядит финальный список.

Риски и подводные камни

Названия второй и третьей моделей в сохранённом тексте отсутствуют, так что их результаты нельзя сопоставить с конкретным разработчиком без захода на сам сайт. Оценка «структурно или художественно», субъективное суждение автора бенчмарка, а не формальная метрика, поэтому выводы стоит воспринимать как личное наблюдение, а не как проверенный бенчмарк-результат.

«ГАБСБУРГСКАЯ ЧЕЛЮСТЬ: массивная выступающая нижняя челюсть»

— комментарий Claude Opus 5 в собственном коде SVG