OpenAI утроила результат GPT-5.6 на ARC-AGI-3 двумя настройками API
GPT-5.6 Sol умеет решать сложные задачи вроде гипотезы о двойном накрытии циклов и проходит игру Pokémon FireRed, но на бенчмарке ARC-AGI-3 (агент учится и рассуждает в незнакомых 2D-играх без инструкций) модель набрала всего 7,8%, а GPT-5.5, 0,4%. OpenAI решила разобраться, дело ли в самих играх или в чём-то ещё.
Выяснилось, что виновата не модель, а обвязка (harness) официального теста ARC-AGI-3: она специально сделана максимально простой, без инструментов и специфичных для модели настроек, чтобы честнее сравнивать разные модели между собой. Но у такой простоты оказалась цена: после каждого хода все приватные рассуждения модели стирались, и GPT-5.6 Sol приходилось заново разбираться в правилах игры на каждом шаге, видя лишь список прошлых ходов без мыслей, которые к ним привели. Кроме того, обвязка использовала скользящее усечение (rolling truncation): когда история диалога превышала 175 000 символов, самые старые сообщения просто отбрасывались, и модель теряла память не только о своих рассуждениях, но и о прошлых действиях.
OpenAI реализовала тот же тест через собственный Responses API, так же, как модель работает в продакшене в ChatGPT и Codex, и включила две настройки. Первая, сохранение рассуждений (retained reasoning), сохраняет приватные мысли модели между ходами: для GPT-5.6 достаточно передавать ID предыдущего ответа, и рассуждения автоматически переносятся из хода в ход. Вторая, уплотнение контекста (compaction), заменяет скользящее усечение более умным механизмом, который лучше сохраняет то, что модель уже успела узнать об игре за долгий прогон.
Результат: на официальной обвязке GPT-5.6 Sol набирал 13,3% по метрике RHAE (Relative Human Action Efficiency, сравнение с результатом человека-тестировщика; средний человек, по оценке OpenAI, набирает около 48%) на открытом наборе задач. С включёнными сохранением рассуждений и уплотнением контекста счёт вырос до 38,3%, примерно втрое, а расход токенов вывода упал в 6 раз, поскольку модели больше не нужно было каждый раз заново обдумывать игру с нуля.
Вывод OpenAI: бенчмарки редко измеряют модель саму по себе, они заодно измеряют менее заметные решения об API-настройках, устройстве обвязки и промптинге. Разработчикам, которые хотят получить от моделей OpenAI максимум, компания рекомендует использовать Responses API вместо устаревшего Chat Completions API, включать сохранение рассуждений и уплотнение контекста; тем, кто сравнивает модели между собой, полагаться на тесты с теми же настройками, которые ближе всего к реальному использованию в ChatGPT и Codex.
Ключевые факты
- На официальной обвязке ARC-AGI-3 GPT-5.6 Sol набирал всего 7,8% (по другому измерению, 13,3% на открытом наборе задач), а GPT-5.5, 0,4%
- Причина, не модель, а настройки: обвязка стирала приватные рассуждения после каждого хода и обрезала историю скользящим усечением при превышении 175 000 символов
- Через Responses API OpenAI включила сохранение рассуждений (retained reasoning) и уплотнение контекста (compaction), счёт на открытом наборе вырос с 13,3% до 38,3%, то есть примерно втрое
- Расход токенов вывода упал в 6 раз, потому что модели не приходилось заново разбираться в игре на каждом шаге
- Средний результат человека-тестировщика по метрике RHAE, около 48%; OpenAI советует разработчикам использовать Responses API, сохранение рассуждений и уплотнение контекста
Почему это важно
История показывает, что низкий результат модели на бенчмарке не всегда говорит о её реальных возможностях: часто дело в том, как устроена обвязка (harness), которая подаёт модели данные и хранит историю диалога. GPT-5.6 Sol способен решать сложные математические задачи и проходить игры, но простая тестовая обвязка ARC-AGI-3 стирала его рассуждения после каждого хода, и модель выглядела почти беспомощной, хотя проблема была не в ней.
Кому это важно
Разработчикам, которые строят агентов на базе моделей OpenAI и оценивают их по публичным бенчмаркам, а также всем, кто сравнивает модели между собой по таким тестам: результат сильно зависит от API-настроек и конструкции обвязки, а не только от самой модели.
Как это применить
OpenAI рекомендует использовать Responses API вместо устаревшего Chat Completions API, включать сохранение рассуждений (retained reasoning), передавать ID предыдущего ответа, чтобы модель помнила свои прошлые мысли, и уплотнение контекста (compaction) вместо скользящего усечения истории. Это подойдёт всем, кто строит долгоживущих агентов, где важна память о прошлых шагах.
Можно ли доверять
Это данные и выводы самой OpenAI по её же модели и её собственной реализации теста через Responses API, а не независимая проверка сторонней организацией. Числа (7,8%, 13,3%, 38,3%, снижение расхода токенов вывода в 6 раз) взяты из официального поста OpenAI и сопровождаются описанием методики (метрика RHAE, оценка человеческого базового уровня по логам тестирования на Hugging Face).
Риски и подводные камни
Сравнение бенчмарков между лабораториями остаётся ненадёжным: если каждая компания использует собственные настройки API и обвязку, результаты разных моделей на одном и том же тесте становятся менее сопоставимыми напрямую. OpenAI прямо признаёт, что это уже не первый случай, когда низкий счёт объяснялся не моделью, а генерической обвязкой, которая отбрасывала сообщения с рассуждениями.
«Бенчмарки редко измеряют модели ИИ сами по себе. Они заодно измеряют менее заметные решения об API-настройках, устройстве тестовой обвязки и промптинге.»
— OpenAI