GPT-5.6 сделала скачок в компьютерном зрении, но проигрывает Gemini 3.5 Flash по цене

GPT-5.6 сделала скачок в компьютерном зрении, но проигрывает Gemini 3.5 Flash по цене

На прошлой неделе OpenAI представила линейку GPT-5.6 из трёх моделей, Sol, Terra и Luna. На презентации компания сделала упор на работу с компьютером: агентов, которые управляют приложениями на рабочем столе, и детальную 3D-визуализацию, обе задачи требуют развитого визуального понимания. Компания Roboflow, разработчик инструментов компьютерного зрения, прогнала все три модели через собственный VLM-бенчмарк (пока не выпущенный публично), который проверяет детекцию объектов, подсчёт, распознавание текста (OCR) и извлечение данных из изображений. Для сравнения в бенчмарк добавили Claude Fable 5 и Gemini 3.5 Flash.

Главный вывод: Sol, самая сильная модель по зрению из всех, что выпускала OpenAI, а Terra и Luna хоть и слабее Sol, но тоже заметно прибавили относительно GPT-5.5.

Детекция объектов показала самый резкий скачок: GPT-5.5 набрала 13,8 mAP@50, тогда как Sol, 46,2 mAP@50, Terra, 44,7, а Luna, 43,3. Так детекция перешла из слабого места в практически применимую функцию. Sol хорошо справилась и с разметкой структуры документов (заголовки, абзацы, таблицы, изображения, подписи), и с плотными сценами, где много похожих объектов расположены близко друг к другу. Для лучших результатов детекции модели GPT-5.6 нужно просить возвращать абсолютные координаты XYXY в пикселях изображения, в отличие от Gemini 3.5 Flash, которая лучше работает с координатами YXYX, нормализованными в диапазон 0, 1000; использование не того формата координат снижает точность детекции GPT-5.6 примерно на 15 пунктов mAP. В части случаев Sol возвращала рамки в произвольных местах изображения, почти не пересекающихся с реальными объектами. Roboflow показала эти примеры OpenAI, и там подтвердили: Sol становится менее стабильной на изображениях размером примерно 2000×2000 пикселей и крупнее, особенно при низком уровне рассуждений; повышение уровня рассуждений улучшает стабильность, но увеличивает расход токенов, задержку и стоимость. Практический обходной путь, уменьшать или обрезать крупные изображения перед отправкой в API OpenAI.

В подсчёте объектов вся линейка GPT-5.6 тоже прибавила: Sol набрала 73,0% против 64,9% у GPT-5.5, Terra и Luna показали 67,6% и 66,2% соответственно, самая дешёвая модель линейки, Luna, всё равно обошла прежний показатель OpenAI. Sol справилась со счётом сильно перекрывающихся металлических скоб и с подсчётом отверстий от пуль только в выбранных зачётных зонах мишени, показав понимание не только того, что считать, но и где применяется правило. А вот блистеры с таблетками оказались намного сложнее: повторяющаяся раскладка, блики и небольшие визуальные различия между пустыми и заполненными ячейками усложнили задачу. На примере с необычными конфетами Sol дала неверный подсчёт, в Roboflow не смогли определить, ошиблась ли модель в счёте или неверно поняла, что именно нужно считать.

В OCR результат остался близким к GPT-5.5: у Sol средняя оценка схожести 90,7% против 91,2% у GPT-5.5, у Terra и Luna, 88,8% и 88,4%. Разрыв оказался больше в извлечении текста: Sol набрала 82,5% против 87,6% у GPT-5.5, Luna и Terra, 81,4% и 79,4%. Sol хорошо справилась с рукописными заметками, с текстом на изогнутой поверхности изношенной шины и со счётом в хоккейной трансляции, извлечённым в нужном формате. При этом не справилась с чтением мелкой, вертикальной, низкоконтрастной даты истечения срока годности на блистере с бликами.

Рост качества зрения обошёлся дороже: расход токенов у всей линейки GPT-5.6 вырос, и на больших объёмах это прямо увеличивает стоимость обработки. Sol в среднем тратила на изображение около 10 секунд, Terra, около 6, Luna, чуть больше 5. По стоимости Sol обошлась примерно в 2,5 цента за изображение, это вторая по дороговизне модель в бенчмарке после Claude Fable 5; Terra, около 1 цента, Luna, меньше 0,5 цента. Gemini 3.5 Flash, при стоимости 0,8 цента за изображение, оказалась намного дешевле Sol и при этом продолжает лидировать в детекции и подсчёте, по мнению Roboflow, это делает её сильным выбором для задач с большим объёмом изображений. Luna, по оценке Roboflow, даёт лучший баланс скорости и качества в линейке: по скорости она близка к Gemini 3.5 Flash и при этом превосходит GPT-5.5 в детекции и подсчёте.

Вывод авторов: с GPT-5.6 OpenAI заметно приблизилась к лидирующим VLM. Детекция перестала быть слабым местом, подсчёт улучшился по всей линейке. Но пределы остаются: для детекции и подсчёта на больших объёмах Gemini 3.5 Flash по-прежнему практичнее, особенно по цене. У Sol ещё есть недостатки, по стоимости, задержке и нестабильности детекции в отдельных случаях, но прогресс, по оценке авторов, трудно игнорировать. Для агентов, понимания экрана, обработки документов и визуальных рассуждений OpenAI, как пишут авторы, стала намного более сильным вариантом, чем раньше.

Ключевые факты

  • Детекция объектов: GPT-5.5, 13,8 mAP@50, Sol (GPT-5.6), 46,2, Terra, 44,7, Luna, 43,3.
  • Подсчёт объектов: Sol, 73,0% против 64,9% у GPT-5.5; Terra, 67,6%, Luna, 66,2%.
  • OCR почти не изменился (Sol 90,7% против 91,2% у GPT-5.5), но извлечение текста просело сильнее: Sol, 82,5% против 87,6%.
  • Sol стоит около 2,5 цента за изображение и тратит ~10 секунд на обработку; Gemini 3.5 Flash дешевле (0,8 цента) и всё ещё точнее в детекции и подсчёте.
  • Неверный формат координат срезает точность детекции GPT-5.6 примерно на 15 пунктов mAP; OpenAI подтвердила нестабильность Sol на изображениях от 2000×2000 пикселей.

Почему это важно

OpenAI построила презентацию GPT-5.6 вокруг агентов, управляющих компьютером, и детальной 3D-визуализации, обе задачи упираются в качество зрения модели. Независимый бенчмарк Roboflow впервые показывает конкретные цифры: детекция объектов у GPT-5.6 Sol выросла с 13,8 до 46,2 mAP@50, это переход из слабого места в рабочую функцию, а не маркетинговое заявление самой OpenAI.

Кому это важно

Разработчикам ИИ-агентов, которые управляют интерфейсами и распознают элементы экрана; командам, строящим конвейеры обработки документов (OCR, извлечение данных, разметка макета страницы); всем, кто выбирает между моделями OpenAI, Google (Gemini 3.5 Flash) и Anthropic (Claude Fable 5) для задач компьютерного зрения и сравнивает их по цене и точности.

Как это применить

Для лучшей детекции запрашивайте у моделей GPT-5.6 абсолютные координаты XYXY в пикселях, а не нормализованный формат, иначе точность падает примерно на 15 пунктов mAP. Крупные изображения (от 2000×2000 пикселей) стоит уменьшать или обрезать перед отправкой в API, иначе Sol может вести себя нестабильно, особенно при низком уровне рассуждений; более высокий уровень рассуждений повышает стабильность, но увеличивает стоимость и задержку. Для задач с большим объёмом изображений и жёстким бюджетом Luna даёт лучший баланс скорости и качества внутри линейки, а Gemini 3.5 Flash остаётся более дешёвым и точным вариантом для детекции и подсчёта.

Можно ли доверять

Источник, Roboflow, компания, специализирующаяся на инструментах компьютерного зрения, а не маркетинговый материал OpenAI: цифры получены на собственном (пока не выпущенном публично) бенчмарке компании. OpenAI подтвердила описанную Roboflow нестабильность детекции на крупных изображениях после того, как ей показали конкретные примеры, это увеличивает доверие к выводам. Ограничение: методология самого бенчмарка (состав датасета, формула подсчёта баллов) в посте не раскрыта, Roboflow обещает опубликовать его позже.

Риски и подводные камни

Рост точности зрения GPT-5.6 идёт вместе с ростом расхода токенов, что на больших объёмах прямо увеличивает стоимость. Sol остаётся нестабильной на крупных изображениях и иногда возвращает рамки детекции, вообще не совпадающие с объектами. Часть простых на вид задач всё ещё проваливается, например, чтение мелкой даты истечения срока годности на блистере. И даже с учётом всего прогресса Gemini 3.5 Flash остаётся дешевле и точнее в детекции и подсчёте объектов на больших объёмах.

«Sol, явно лучшая модель по зрению из всех, что выпускала OpenAI.»

— Roboflow (блог компании)