OpenAI улучшила кэширование промптов для GPT-6: дешевле и быстрее
22 сентября 2026 года OpenAI объявила об улучшенной системе кэширования промптов для семейства моделей GPT-6. Скидка до 90% на кэшированные входные токены у OpenAI существовала и раньше, это общая функция кэширования промптов, а не специфика именно GPT-6. Новость в другом: с релизом GPT-6 попадание в кэш стало выше по умолчанию, а скидку теперь дают за совпадающие общие префиксы промпта, повторно использованные в течение 30-минутного окна.
Вместе с этим OpenAI выпустила три новых инструмента для разработчиков. Дашборд кэширования промптов показывает, какая доля входных данных приложения обслуживается из кэша, отслеживает процент попаданий во времени и сравнивает объём кэшированных и некэшированных токенов. Инструмент диагностики промахов кэша сравнивает текущий запрос с недавним ответом, чтобы найти, что именно, модель, набор инструментов, настройки или сам ввод, помешало переиспользовать кэш, и оценивает число затронутых токенов. Явные точки кэширования (cache breakpoints) позволяют разработчику самому выбирать, какие префиксы промпта кэшировать; подробности даёт обновлённое руководство по кэшированию промптов.
Отдельно OpenAI добавила для моделей GPT-6 возможность менять уровень рассуждений («reasoning effort») между запросами, не разрушая кэш: достаточно добавить параметр configuration_update, оставив уровень рассуждений самого запроса без изменений, так можно поднять усилие модели для сложной задачи или снизить для рутинного шага, сохранив переиспользуемый контекст. Компания также советует держать стабильными определения, схемы и порядок инструментов агента (использовать allowed_tools или tool_choice: none вместо удаления определений) и добавлять новые сообщения разработчика в конец контекста, а не переписывать старые, это тоже сохраняет кэш. Ещё одна рекомендация, прогревать кэш заранее (prewarming): загружать в него общие инструкции, определения инструментов или справочные материалы при старте приложения, ещё до первого запроса пользователя, чтобы перенести обработку за пределы времени ожидания.
Эффект OpenAI подтверждает цитатами клиентов с именами, должностями и цифрами. Марио Родригес, директор по продукту, рассказал, что кэширование промптов критически важно для того, чтобы GitHub Copilot работал быстро и эффективно в большом масштабе: за последние несколько месяцев доля токенов промпта, которым требовалась повторная обработка, при миллиардах запросов к моделям OpenAI сократилась более чем на 50% относительно прежней базовой линии. Ариан Ханифи, технический директор, сообщил, что дашборд и диагностика кэша подняли процент попаданий на несколько процентных пунктов и снизили расходы на 20%; по его словам, теперь приходят оповещения при неожиданном срыве кэша, а для поиска причины используются агенты Codex. Бин Фань, руководитель агентской команды, говоря о долгоживущих агентах вроде Manus, сообщил, что процент попаданий в кэш моделей OpenAI вырос примерно с 85% до стабильно выше 90% меньше чем за неделю совместной работы с инженерами OpenAI. Юджин Миханьтев, инженер по ИИ, рассказал, что после перехода его сессионных агентов на явные точки кэширования процент попаданий на его оценочных наборах вырос с 83% до 91% менее чем за неделю; число операций записи в кэш при этом сократилось примерно на две трети, а расходы на инференс снизились на 36%.
Ключевые факты
- OpenAI обновила кэширование промптов для GPT-6: попадание в кэш выше по умолчанию, скидка действует на совпадающие префиксы, повторно использованные в течение 30-минутного окна
- Новые инструменты для разработчиков: дашборд кэширования промптов, инструмент диагностики промахов кэша и явные точки кэширования (cache breakpoints)
- На моделях GPT-6 можно менять уровень рассуждений между запросами без разрушения кэша, через параметр configuration_update
- GitHub Copilot (Марио Родригес, директор по продукту): доля токенов, требующих повторной обработки, упала более чем на 50%; Ариан Ханифи, технический директор: экономия 20% после внедрения дашборда и диагностики
- Bin Fan (агенты вроде Manus): попадание в кэш выросло с ~85% до стабильно выше 90% за неделю; Юджин Миханьтев: с 83% до 91%, записи в кэш сократились на две трети, расходы на инференс, на 36%
Почему это важно
GPT-6 рассчитана на долгоживущих агентов, которые часами работают над задачей, от рефакторинга кода до подготовки документов, и на каждом шаге посылают запрос, повторяющий большую часть инструкций и контекста предыдущего. Чем выше доля такого контекста, которую удаётся взять из кэша, а не пересчитывать заново, тем ниже задержка ответа и счёт за токены. OpenAI подняла процент попаданий в кэш по умолчанию и расширила окно, в течение которого совпадающий префикс промпта ещё даёт скидку, до 30 минут, а также дала разработчикам инструменты, чтобы управлять этим самостоятельно и видеть, где кэш ломается.
Кому это важно
В первую очередь, командам, которые строят долгоживущих ИИ-агентов и продукты на базе API OpenAI с большими повторяющимися промптами: ассистентам вроде GitHub Copilot, агентным платформам вроде Manus, инструментам с многошаговыми сессиями. Именно такие клиенты в материале приводят собственные цифры экономии, это не абстрактная оптимизация, а параметр, который напрямую входит в счёт за инференс.
Как это применить
Разработчику доступны: Prompt Caching Dashboard, смотреть долю запросов, обслуженных из кэша, и динамику попаданий; инструмент диагностики промахов кэша, сравнивать запрос с недавним ответом и находить, что именно (модель, инструменты, настройки, ввод) сорвало переиспользование кэша; явные точки кэширования (cache breakpoints), самому решать, какие префиксы промпта кэшировать, по инструкции из обновлённого руководства. Чтобы не терять кэш при изменении набора инструментов агента, стоит держать их определения, схемы и порядок стабильными, использовать allowed_tools или tool_choice: none вместо удаления инструментов и добавлять новые инструкции в конец контекста, а не переписывать прежние. Для снижения задержки можно заранее прогревать кэш общими инструкциями и справочными материалами при старте приложения. На GPT-6 отдельно можно менять уровень рассуждений между запросами параметром configuration_update, не разрушая накопленный кэш.
Можно ли доверять
Это официальный пост OpenAI на openai.com от 22 сентября 2026 года с указанными числами и именованными цитатами клиентов, Марио Родригес (директор по продукту), Ариан Ханифи (технический директор), Бин Фань (руководитель агентской команды) и Юджин Миханьтев (инженер по ИИ). В тексте не указано, в каких компаниях они работают: рядом с цитатами показаны логотипы Strawberry Browser, Manus и Wordsmith, но напрямую с именами говорящих они не сопоставлены. Общий рост попадания в кэш «по умолчанию» источник не подкрепляет конкретной цифрой прежнего показателя, приведены только цифры отдельных клиентов, и это самостоятельно отобранные OpenAI примеры успеха, а не независимое измерение.
Риски и подводные камни
Приведённые проценты, маркетинговые кейсы клиентов, а не усреднённая по всем пользователям статистика: они показывают, что улучшение возможно, но не гарантируют такой же результат каждому. Скидка на кэш привязана к 30-минутному окну повторного использования, у агентов с долгими паузами между запросами кэш успевает истечь, и выгода пропадает. Переиспользование кэша чувствительно к мелочам: изменение набора инструментов, их порядка или схемы обнуляет накопленный кэш, так что часть советов в материале, это в первую очередь предупреждение о том, как легко его сломать по неосторожности.
«За последние несколько месяцев мы сократили более чем на 50% долю токенов промпта, которым требовалась повторная обработка, при миллиардах запросов к моделям OpenAI, относительно нашей прежней базовой линии.»
— Марио Родригес, директор по продукту