Claude Opus 5 нарисовала лягушку с габсбургской челюстью
Сайт frogs.vaguespac.es, личный бенчмарк одного автора: он прогоняет через разные ИИ-модели один и тот же запрос «нарисуй SVG лягушки с габсбургской челюстью» (историческая отсылка к характерной выступающей нижней челюсти династии Габсбургов, следствию близкородственных браков) и публикует для каждой модели сгенерированный код SVG вместе с коротким вердиктом: остаётся ли модель в комментариях к своему же коду при нейтральных структурных подписях или соскальзывает в художественную интерпретацию.
Первой в перехваченном тексте страницы разобрана модель anthropic/claude-opus-5 (Anthropic). Вердикт: комментарии в её SVG-коде в основном структурные подписи, но встречается и художественность, Claude Opus 5 подписала фрагмент кода «ГАБСБУРГСКАЯ ЧЕЛЮСТЬ: массивная выступающая нижняя челюсть», описала верхнюю губу как «утопленную, спрятанную за челюстью», а нижние зубы, как «выступающие» над верхней губой. По оценке автора бенчмарка, это уже не простая подпись детали, а анатомическая интерпретация.
В перехваченном тексте есть ещё два разбора моделей, но их названия и разработчики не попали в сохранённый фрагмент страницы. У второй модели комментарии тоже в основном структурные, но добавлена гиперболизация («ОГРОМНАЯ выступающая габсбургская челюсть», «нижние зубы выпирают над верхней губой») и намёк на настроение и царственную осанку через подпись «томные величавые веки». У третьей модели комментарии тоже преимущественно структурные, с акцентом на выраженность деформации («массивная удлинённая выступающая нижняя челюсть», «нижний прикус: западающая верхняя губа, выступающая нижняя губа»), но без каких-либо намёков на настроение или царственность, за исключением самой подписи «ГАБСБУРГСКАЯ ЧЕЛЮСТЬ» как таковой.
Общее число моделей в бенчмарке, методика и итоговый рейтинг в захваченном тексте не приведены. Обсуждение на Hacker News за первые 9 часов набрало 123 балла и 58 комментариев.
Ключевые факты
- Личный бенчмарк на сайте frogs.vaguespac.es прогоняет один и тот же запрос, нарисовать SVG-лягушку с «габсбургской челюстью», через разные ИИ-модели и проверяет их код на художественную отсебятину.
- Модель anthropic/claude-opus-5 (Anthropic) в комментариях к своему SVG-коду в основном придерживалась структурных подписей, но написала «массивная выступающая нижняя челюсть» и описала губы и зубы с элементами анатомической интерпретации.
- Ещё две модели в тексте разобраны без указания названия: одна добавила намёк на царственную осанку («томные величавые веки»), другая ограничилась акцентом на выраженности деформации без упоминаний настроения.
- Полный список моделей, методика оценки и итоговый рейтинг бенчмарка в сохранённом тексте страницы не приведены.
- Пост на Hacker News за 9 часов набрал 123 балла и 58 комментариев.
Почему это важно
Формально безобидный тест на рисование лягушки на деле проверяет более общее свойство языковых моделей: держатся ли они нейтрального, инструктивного тона там, где просили именно его, или соскальзывают в оценочные, художественные формулировки даже внутри технических артефактов вроде комментариев к коду. Для Claude Opus 5 автор бенчмарка фиксирует именно это, часть подписей в SVG-коде выходит за рамки простого описания детали.
Кому это важно
Разработчикам, которые используют языковые модели для генерации SVG-графики и другого кода с комментариями, им может быть важно, что модель способна незаметно добавлять оценочные формулировки там, где просили нейтральное описание. Также интересно исследователям поведения моделей и авторам собственных нестандартных бенчмарков вне стандартных бенчмарк-наборов.
Как это применить
Полный список моделей, сгенерированный код и вердикты можно посмотреть на самом сайте frogs.vaguespac.es, в перехваченном тексте страницы приведены только фрагменты для трёх моделей. Идею теста, один и тот же нестандартный визуальный запрос через разные модели с проверкой тона комментариев, можно повторить для собственной оценки поведения моделей на нетипичных задачах.
Можно ли доверять
Источник, личный сайт одного автора, а не рецензируемое исследование: методика отбора моделей, критерии вердикта и итоговый рейтинг в захваченном тексте не раскрыты. Захваченный фрагмент обрывается на середине кода третьей модели, поэтому неизвестно, сколько моделей протестировано всего и как выглядит финальный список.
Риски и подводные камни
Названия второй и третьей моделей в сохранённом тексте отсутствуют, так что их результаты нельзя сопоставить с конкретным разработчиком без захода на сам сайт. Оценка «структурно или художественно», субъективное суждение автора бенчмарка, а не формальная метрика, поэтому выводы стоит воспринимать как личное наблюдение, а не как проверенный бенчмарк-результат.
«ГАБСБУРГСКАЯ ЧЕЛЮСТЬ: массивная выступающая нижняя челюсть»
— комментарий Claude Opus 5 в собственном коде SVG