GPT-5.6 обошла Claude, Gemini и Grok в тесте рисования цветными карандашами

GPT-5.6 обошла Claude, Gemini и Grok в тесте рисования цветными карандашами

Команда TryAI построила «арену рисования»: модель получает чистый холст и набор инструментов цветных карандашей (выбор цвета, толщины и нажима, пакетное нанесение штрихов, растушёвка, ластик) и должна либо воспроизвести заданное изображение, либо нарисовать что-то по текстовому описанию. Перед каждым решением модель может вызвать view_canvas и посмотреть на текущий результат, чтобы понять, что доработать.

В тесте участвовали четыре модели: GPT-5.6 Sol, Claude Fable 5, Grok 4.5 и Gemini 3.6 Flash. Каждая рисовала два эталонных объекта с объективной оценкой, «Мону Лизу» Леонардо да Винчи и «Звёздную ночь» Ван Гога, плюс пять свободных сюжетов по текстовым описаниям (лицо пожилого рыбака, закат над океаном, роза в вазе, спящая кошка на подоконнике, уютная комната с камином). Итого 28 рисунков. Для эталонных объектов сходство с оригиналом считали автоматически по метрике SSIM (структурное сходство, от 0 до 1, больше, ближе к цели) и RMSE (среднеквадратичная ошибка, от 0 до 255, меньше, ближе к цели); изображения масштабировали до 256×256 перед сравнением.

Модели пользовались одним и тем же набором инструментов совершенно по-разному. GPT-5.6 Sol ни разу не вызвала отдельные команды выбора цвета/толщины/нажима, задавала эти параметры прямо внутри команды рисования, поэтому её действия почти целиком состояли из штрихов, растушёвки и просмотра холста. Grok 4.5 поступила противоположно: 65% из её 1349 вызовов инструментов пришлось на настройку цвета/кисти/нажима, из-за чего в среднем ей понадобилось 99 шагов на один рисунок. Claude Fable 5 активно растушёвывала (123 вызова) и постоянно пересматривала свою работу, «Мону Лизу» она проверила 27 раз, но, по данным авторов, сходство с оригиналом переставало расти уже примерно после пятой проверки. Gemini 3.6 Flash оказалась самой одержимой самопроверкой моделью: почти треть всех её вызовов, это просмотр холста, около 23 раз на рисунок.

По стоимости разброс оказался огромным. Семь рисунков Claude Fable 5 обошлись примерно в 160 долларов, это примерно в 20 раз дороже, чем у GPT-5.6 Sol (7,74 доллара), Grok 4.5 (9,21 доллара) и Gemini 3.6 Flash (12,87 доллара). При этом Grok 4.5 израсходовала больше всего токенов (34 млн), но осталась дешёвой, потому что около 98% токенов пришлось на кешированные чтения по сниженной ставке, а собственные тарифы Grok, самые низкие среди четырёх моделей.

Авторы отдельно проверили, действительно ли повторные проверки улучшают рисунок. Оказалось, что качество выходит на плато довольно быстро: у Claude Fable 5 сходство с «Моной Лизой» практически переставало расти уже после пятой из 27 проверок. А во всех восьми прогонах на эталонных изображениях итоговый результат оказался хуже пикового значения, достигнутого в середине работы, модели, продолжая редактировать, ухудшали уже готовый рисунок. У GPT-5.6 Sol пик SSIM на «Моне Лизе» составил 0,352, а финальный результат, 0,325; на «Звёздной ночи» пик 0,179, финал 0,130. У Gemini 3.6 Flash, самое частое самопросматривание (около 23 раз на рисунок) и самый высокий пик во всём тесте (0,449 на «Моне Лизе»), который к концу просел до 0,337.

По субъективной оценке авторов, GPT-5.6 Sol стала явным лидером, её «Звёздная ночь» и роза понравились авторам больше всего в тесте, хотя рисовала она штрих за штрихом на чистом холсте. Grok 4.5, по их словам, «оказалась откровенно слабой»: почти не выдавала пригодных результатов, несмотря на самое активное использование инструментов. Gemini 3.6 Flash показала лучший результат, чем Grok, при небольшом росте стоимости, но сравнивать облегчённую Flash-версию с флагманскими моделями авторы считают не вполне справедливым. Claude Fable 5 заняла второе место по субъективному качеству, но проиграла по деньгам и времени, авторы называют её худшим соотношением цены и результата среди всех участников теста.

Ключевые факты

  • GPT-5.6 Sol, Claude Fable 5, Grok 4.5 и Gemini 3.6 Flash рисовали цветными карандашами на виртуальном холсте: 2 эталонных изображения («Мона Лиза», «Звёздная ночь») со счётом по SSIM/RMSE плюс 5 свободных сюжетов, 28 рисунков всего
  • Claude Fable 5 обошлась примерно в 160 долларов за семь рисунков, почти в 20 раз дороже GPT-5.6 Sol (7,74 доллара), Grok 4.5 (9,21 доллара) и Gemini 3.6 Flash (12,87 доллара)
  • Модели по-разному использовали одинаковый набор инструментов: Grok 4.5 тратила 65% вызовов на настройку цвета и кисти (99 шагов на рисунок в среднем), Gemini 3.6 Flash, почти треть вызовов на самопросмотр холста (около 23 раза на рисунок)
  • Во всех восьми прогонах на эталонных изображениях итоговое сходство с оригиналом оказалось ниже пикового значения, достигнутого в середине работы, дальнейшее редактирование ухудшало уже готовый рисунок
  • По субъективной оценке авторов теста GPT-5.6 Sol выиграла по качеству результата, а Claude Fable 5 заняла второе место, но при кратно более высокой стоимости и времени работы

Почему это важно

Обычные бенчмарки сравнивают модели по числовым метрикам на фиксированных задачах, а здесь, открытая, слабо специфицированная задача, где нет единственно верного решения. По словам авторов, именно такие тесты лучше показывают разрыв между флагманскими и более дешёвыми моделями: часть открытых моделей вообще не справилась с задачей и просто оставляла холст пустым. Тест также наглядно показывает, во что на практике выливается разница в стоимости между моделями при работе с инструментами: Claude Fable 5 не просто дороже, она тратит значительно больше шагов и времени на тот же результат.

Кому это важно

Тем, кто выбирает модель для агентных задач с активным использованием инструментов (создание изображений, автоматизация UI, любые циклы «действие, проверка результата, правка»), а не только для чата. Разработчикам, которые оценивают, оправдывает ли более высокая цена модели прирост качества на конкретной задаче. Исследователям агентных циклов самопроверки, тест показывает, что многократные повторные проверки не гарантируют улучшения итогового результата.

Как это применить

Если бюджет ограничен, а нужен близкий по качеству результат, по данным этого теста GPT-5.6 Sol дала лучшее соотношение цены и результата среди сравнённых моделей. Тест также показывает практическую ловушку: не стоит давать модели неограниченное число самопроверок в цикле «сделал, проверил, поправил», после нескольких итераций результат может ухудшаться, а не улучшаться, так что стоит ограничивать число проверочных шагов. Инструментарий теста выложен в открытом доступе на GitHub (canvas-arena), его можно направить на своё изображение или текстовый запрос и повторить эксперимент самостоятельно.

Можно ли доверять

Источник, блог TryAI.dev, который сам описывает такие тесты не как объективную проверку возможностей моделей, а как наглядный и по-своему развлекательный эксперимент с открытой задачей. Методология подробно описана (метрики SSIM/RMSE, число прогонов, версия инструментов у всех моделей одинаковая), а инструментарий открыт для проверки третьими лицами. При этом выборка небольшая, по 7 рисунков на модель, и результат может отличаться при повторе с другими изображениями или промптами; сами авторы прямо указывают, что автоматическая метрика SSIM не всегда совпадает с тем, что человеку кажется более качественным рисунком (у Gemini 3.6 Flash был самый высокий SSIM-счёт, но, по мнению авторов, визуально её работы не выглядели ближе всего к оригиналу).

Риски и подводные камни

Главный риск, переносить вывод узкого теста («кто лучше рисует цветными карандашами») на общие выводы о качестве моделей в целом: сами авторы подчёркивают, что это не тест на общие способности моделей. Оценка «GPT-5.6 Sol выиграла» частично субъективна, она основана на личном мнении авторов о визуальном качестве, а не только на объективной метрике SSIM, по которой лидировала Gemini 3.6 Flash. Оценки стоимости, по словам авторов, «примерные». Названия и версии моделей (GPT-5.6 Sol, Claude Fable 5, Grok 4.5, Gemini 3.6 Flash) актуальны на момент публикации и быстро устаревают по мере выхода новых версий.

«Grok 4.5 в этом тесте оказалась откровенно слабой. Она почти не выдавала пригодных результатов, и, несмотря на её активнейшее использование инструментов, я бы пока не доверял ей надёжно понимать или оценивать визуальный результат.»

— команда TryAI, авторы теста