OpenAI выпустила гид: как удешевить ИИ-агентов на GPT-5.6
OpenAI опубликовала в своём блоге «гид для разработчиков» по модели GPT-5.6: как стартапы за счёт более осмысленного выбора модели и новых возможностей Responses API строят ИИ-агентов быстрее, дешевле и без потери качества. Материал написан от лица компании, местоимением «мы»; имя конкретного автора не указано.
Семейство GPT-5.6 состоит из флагманской модели Sol и более лёгких моделей Luna и Terra. Раньше для длинных многошаговых агентных задач почти всегда приходилось брать флагманскую модель с максимальным уровнем рассуждений, младшие модели заметно хуже справлялись с длинным контекстом и вызовом инструментов. С GPT-5.6 это изменилось: при увеличенном времени на рассуждения Luna и Terra часто (не всегда, оговаривает OpenAI) показывают результат на уровне GPT-5.4 и GPT-5.5, но стоят заметно меньше. Пример из гида, тест BrowseComp, который проверяет способность модели искать малоизвестные факты в интернете: три месяца назад GPT-5.5 в режиме рассуждений Extra High набрала 84,36% ценой прогона в $33,27; на старте GPT-5.6 Luna в том же режиме Extra High показала почти тот же результат, 84,04%, но прогон обошёлся уже в $1,33, то есть примерно в 25 раз дешевле при практически той же точности. С тех пор OpenAI снизила цену ещё раз, но новую цифру в гиде не называет. Отдельно отмечено: на тесте Agents' Last Exam GPT-5.6 Sol с «низким» уровнем рассуждений обошёл GPT-5.5 с «высоким» уровнем при одинаковой настройке окружения (харнесса), конкретных числовых оценок для этого сравнения гид не приводит.
Младшие модели особенно подходят для высоконагруженных сценариев, задач, чувствительных к задержке, и повторяющихся шагов внутри агентных пайплайнов. Гипотетический пример из гида (не реальный клиентский кейс, а иллюстрация «если вы…»): юридический стартап, который распознаёт рукописные заметки перед более глубоким агентным анализом, может отдать саму расшифровку модели Terra или Luna вместо флагманской модели и заметно сэкономить.
Отдельно OpenAI обучила GPT-5.6 работать с тремя новыми архитектурными механизмами Responses API. Первый, повторное использование уже проделанной работы: рассуждения модели можно сохранять между обращениями, а длинные диалоги сжимать через встроенное сжатие (native compaction), чтобы модель не теряла связность и не восстанавливала контекст заново на длинных задачах. Второй, параллельное разложение задачи через встроенную мультиагентную оркестрацию: главный агент делит сложную задачу между несколькими субагентами, они работают параллельно и передают результат обратно для финального синтеза; это тот же механизм, что лежит в основе настройки «ultra» в ChatGPT. Модель сама неплохо чувствует, сколько субагентов нужно и когда их порождать, но, по словам OpenAI, это поведение легко направлять явными инструкциями, иначе есть риск тратить токены без выигрыша в качестве. Третий механизм, перенос детерминированной работы в код через программный вызов инструментов (Programmatic Tool Calling): модель пишет JavaScript-код, который сам оркеструет вызовы инструментов, выполняет независимые запросы параллельно и обрабатывает результаты вне окна контекста, вместо того чтобы прогонять каждый промежуточный результат через рассуждения. Условный пример из гида: агент, который получает, скажем, 100 документов, фильтрует их по дате и находит нужные транзакции, не должен «продумывать» каждый промежуточный шаг вручную.
Насколько заметен совместный эффект этих механизмов, показывает тест ARC-AGI-3: со стандартной настройкой окружения GPT-5.6 Sol набрала 13,3%. После включения сохранения рассуждений и сжатия, без каких-либо изменений в самой модели, результат вырос до 38,3%, то есть почти втрое, а число токенов на выходе при этом сократилось примерно в 6 раз. Сама OpenAI формулирует это так: «Никаких изменений в модели, а результат почти втрое выше».
Ещё одно изменение касается кеширования: для всего семейства моделей минимальное время жизни кеша подсказок увеличили до 30 минут, а точки разбиения кеша теперь можно задавать детерминированно внутри окна контекста модели. По словам OpenAI, это заметно повышает попадание запросов в кеш (точная цифра не приводится); в сочетании с правильно подобранным параметром prompt_cache_key это также повышает шанс, что запрос попадёт на тот же инференс-движок, что уже обслуживал похожий запрос, и снижает задержку ответа.
Главный вывод гида: сценарии, которые раньше требовали флагманской модели на каждом шаге, теперь можно закрывать сопоставимым или лучшим результатом за долю прежней стоимости, за счёт более мелких моделей, настройки уровня рассуждений и перечисленных архитектурных приёмов.
Ключевые факты
- GPT-5.6, это семейство моделей: флагманская Sol и более лёгкие и дешёвые Luna и Terra; при увеличенном времени на рассуждения младшие модели часто (не всегда) показывают результат на уровне GPT-5.4 и GPT-5.5, но стоят заметно меньше.
- На тесте BrowseComp GPT-5.5 (Extra High) три месяца назад набрала 84,36% ценой прогона $33,27; GPT-5.6 Luna (Extra High) на старте показала почти тот же результат, 84,04%, но за $1,33, то есть примерно в 25 раз дешевле; позже OpenAI снизила цену ещё раз, новую цифру не назвав.
- В Responses API появились три механизма для агентов: сохранение рассуждений между обращениями и сжатие длинных диалогов (compaction), встроенная мультиагентная оркестрация (тот же принцип лежит в основе настройки «ultra» в ChatGPT) и программный вызов инструментов, где модель сама пишет JavaScript-код и обрабатывает результаты вне окна контекста.
- На тесте ARC-AGI-3 включение сохранения рассуждений и сжатия подняло результат Sol с 13,3% до 38,3% (почти втрое) и одновременно сократило число токенов на выходе примерно в 6 раз, без изменения самой модели.
- Для всего семейства моделей минимальное время жизни кеша подсказок увеличили до 30 минут, а точки разбиения кеша теперь можно задавать детерминированно внутри контекста, это заметно повышает попадание в кеш, хотя точных цифр улучшения OpenAI не приводит.
Почему это важно
OpenAI показывает новый уровень цены и качества для ИИ-агентов: почти тот же результат, что топ-модель показывала три месяца назад, теперь стоит в разы дешевле, на тесте BrowseComp прогон подешевел примерно в 25 раз (с $33,27 до $1,33) при почти той же точности (84,36% против 84,04%). Отдельно показано, что включение новых настроек Responses API, без изменения самой модели, почти утраивает качество на сложном тесте ARC-AGI-3 (с 13,3% до 38,3%) и одновременно сокращает расход токенов на выходе примерно в 6 раз. Это меняет экономику агентных продуктов: дорогая флагманская модель с максимальным уровнем рассуждений больше не обязательный выбор по умолчанию для длинных агентных сценариев.
Кому это важно
Гид адресован разработчикам и стартапам, которые строят или планируют строить ИИ-агентов на API OpenAI, особенно тем, у кого высоконагруженные, чувствительные к задержке или повторяющиеся шаги внутри агентных пайплайнов. Он важен командам, уже работающим с Responses API и стремящимся снизить счета за токены без потери качества, а также тем, кто проектирует мультиагентные сценарии с несколькими субагентами под управлением главного агента.
Как это применить
OpenAI даёт несколько конкретных рекомендаций для разработчиков агентов. Не брать по умолчанию самую мощную модель (Sol) с максимальным уровнем рассуждений, для многих задач младшие Luna и Terra с увеличенным временем на рассуждения показывают близкий результат заметно дешевле. Для длинных многошаговых сценариев включать сохранение рассуждений между обращениями и встроенное сжатие диалога (compaction), чтобы модель не теряла связность и не восстанавливала контекст заново. Для распараллеливаемых задач подключать встроенную мультиагентную оркестрацию в Responses API и явно задавать инструкцией, когда и сколько субагентов порождать, иначе есть риск лишних затрат токенов без прироста качества. Детерминированную и повторяющуюся работу, фильтрацию, агрегацию, обработку результатов инструментов, переносить в программный вызов инструментов (Programmatic Tool Calling): модель сама пишет JavaScript-код, который выполняется вне окна контекста. И настраивать параметр prompt_cache_key вместе с расширенным минимальным временем жизни кеша подсказок (30 минут) и детерминированными точками разбиения кеша, это поднимает попадание в кеш и снижает задержку ответа.
Можно ли доверять
Источник, официальный блог OpenAI (openai.com), первоисточник без посредников, поэтому фактическая точность цитируемых чисел высокая. Но это одновременно обучающий и маркетинговый материал самого разработчика модели: все бенчмарки (BrowseComp, ARC-AGI-3, Agents' Last Exam), собственные тесты OpenAI, независимая проверка третьей стороной в тексте не упомянута. Пример с юридическим стартапом, который якобы использует Terra или Luna для расшифровки рукописных заметок, гипотетическая иллюстрация «если вы…», а не реальный кейс клиента; то же самое верно для примера со «100 документами» в разделе про программный вызов инструментов, это условная иллюстрация механики, а не измеренный результат. Конкретный автор текста не назван: гид написан от лица компании, местоимением «мы». В разделе про выбор модели на странице стоит интерактивный блок с пометкой «1 из 3» (похоже на карусель графиков), в сохранённый текст попала только эта пометка, данные второй и третьей панелей не сохранились, так что часть иллюстративных цифр в этом разделе могла остаться за кадром.
Риски и подводные камни
Все цифры, собственные бенчмарки поставщика модели: они показывают, что достижимо при аккуратной настройке, но не гарантируют такой же выигрыш на произвольной задаче. Формулировка про Luna и Terra, что они «часто», а не всегда, показывают результат на уровне GPT-5.4 и GPT-5.5, прямо оставляет исключения, и единственный количественный пример (BrowseComp) сравнивает Luna только с GPT-5.5, но не с GPT-5.4. После цифры в $1,33 OpenAI сообщает о дальнейшем снижении цены, но не называет новое значение, актуальную стоимость нужно проверять отдельно. Мультиагентные сценарии сами по себе увеличивают расход токенов: гид прямо предупреждает, что поведение модели нужно направлять инструкциями, иначе возможны лишние траты без прироста качества. Программный вызов инструментов означает, что модель сама пишет и выполняет JavaScript-код для оркестрации, это новая поверхность для ошибок и требует доверия к сгенерированному коду.
«Никаких изменений в модели, а результат почти втрое выше.»
— OpenAI, гид по GPT-5.6