OpenAI выпустила GPT-6 Sol и Luna: цены на API ниже на 50%

OpenAI выпустила GPT-6 Sol и Luna: цены на API ниже на 50%

OpenAI выпустила две новые модели линейки GPT-6, Sol и Luna, дополняющие представленную ранее в этом же месяце флагманскую GPT-6 Astra. Astra остаётся, по словам компании, лучшей моделью OpenAI по всем направлениям, а Sol и Luna обучены теми же методами и переносят её наработки, в профессиональных задачах, точности фактов, кодинге, работе с компьютером и согласованности (alignment), в более быстрые и дешёвые модели. Цены на использование API для Sol и Luna снижены на 50% по сравнению с промо-тарифами GPT-5.6.

На тесте бизнес-процессов AutomationBench GPT-6 Sol в режиме xhigh effort обходит Claude Opus 5 в режиме max effort, при этом стоимость выполнения задачи у Sol составляет всего 9% от стоимости Opus 5. GPT-6 Luna в режиме high effort улучшает результат предшественницы (GPT-5.6 Luna) на 5,4 процентного пункта при стоимости задачи на 58% ниже. Sol также превосходит Claude Fable 5.1 при заметно меньшей стоимости и обходит даже GPT-6 Astra в режиме low effort, без указания конкретных цифр для этого сравнения. На тесте Agents' Last Exam, оценивающем агентов на сложных профессиональных задачах, Sol в режиме max effort набирает 56,4%, выше лучшего результата Claude Opus 5 в этом тесте, при стоимости задачи на 60% ниже.

По внутренней оценке точности фактов OpenAI, построенной на обезличенных реальных диалогах, где пользователи отмечали ошибки моделей, Sol допускает примерно вдвое меньше ошибок, чем его предшественник GPT-5.6 Sol, приближаясь по надёжности к Astra при заметно меньшей стоимости. Luna тоже заметно прогрессирует: на повышенных уровнях effort она сравнивается по точности с GPT-5.6 Sol при примерно сотой доле его стоимости.

Внутри OpenAI использование кодинг-агентов резко выросло: по ценам API медианный исследователь тратит более $600 в день на токены, а исследователи в 90-м процентиле, более $7000. На тесте FrontierCode, который проверяет, готовы ли изменения кодинг-агента к слиянию в реальный код, Sol существенно превосходит GPT-5.6 Sol и по результату сравнивается с Claude Fable 5.1 в режиме xhigh при заметно меньшей стоимости. На DeepSWE v1.1 Sol в режиме max effort набирает 68,8%, это в пределах 1,1 процентного пункта от лучшего результата Claude Fable 5 (69,9% в режиме xhigh), но примерно на 80% дешевле за задачу. Luna в режиме max effort набирает 66,6%, что сопоставимо с Claude Opus 5 и Fable 5 в режиме medium effort; при этом Luna обходится на 93% дешевле за задачу, чем Opus 5, и на 96% дешевле, чем Fable 5.

Astra остаётся лучшей моделью OpenAI для работы с компьютером, но Sol и Luna эффективнее по цене, чем их предшественники. На OSWorld 2.0 offline Sol в режиме xhigh effort набирает 60,5%, почти как Claude Opus 5 в режиме medium effort (60,3%), но примерно на 80% дешевле за задачу; Luna в режиме max effort превосходит GPT-5.6 Sol в режиме medium effort при десятой доле его стоимости. OpenAI также улучшила кэширование промптов для GPT-6: скидка на чтение кэшированных входных токенов достигает 90%, добавлены дашборд мониторинга кэша, диагностика упущенных возможностей кэширования и явные точки разбиения промпта. По данным GitHub, эти улучшения за последние несколько месяцев сократили долю токенов промпта, требующих обработки заново, более чем на 50% в миллиардах запросов к моделям OpenAI, ускорив работу Copilot.

GPT-6 Sol и Luna уже доступны в ChatGPT Work и Codex для пользователей тарифов Plus, Pro, Business, Enterprise и Edu; пользователи Free и Go получают доступ к Luna в десктоп-приложении. В обычном Chat моделей пока нет. В API они доступны под идентификаторами gpt-6-sol и gpt-6-luna. OpenAI уточняет: оценки конкурирующих моделей взяты из открытых публикаций, а не получены независимо, приведённые тесты сознательно проверяют сложные ситуации, а не типичную частоту ошибок в обычном использовании, а там, где не было данных по Claude Fable 5.1, для сравнения подставлялись результаты Claude Fable 5.

Ключевые факты

  • OpenAI выпустила GPT-6 Sol и Luna, более дешёвые и быстрые модели линейки GPT-6, дополняющие флагманскую Astra
  • Цены на API для Sol и Luna снижены на 50% по сравнению с промо-тарифами GPT-5.6
  • На AutomationBench Sol обходит Claude Opus 5 при 9% его стоимости за задачу; на Agents' Last Exam Sol набирает 56,4% при цене на 60% ниже лучшего результата Opus 5
  • Sol допускает примерно вдвое меньше ошибок по внутренней оценке точности фактов OpenAI, чем GPT-5.6 Sol; Luna при повышенном effort сравнивается по точности с GPT-5.6 Sol при сотой доле его цены
  • Улучшено кэширование промптов (скидка до 90% на чтение кэша); модели доступны в ChatGPT Work, Codex и API под именами gpt-6-sol и gpt-6-luna

Почему это важно

OpenAI выстраивает линейку GPT-6 по трём уровням цена/качество: Astra, топовая модель, Sol и Luna, более быстрые и дешёвые варианты вместо одной модели на все случаи. Это продолжение конкуренции с Anthropic не только по качеству, но и по цене выполнения задачи: OpenAI напрямую сравнивает стоимость выполнения задач своими моделями со стоимостью Claude Opus 5 и Claude Fable 5/5.1 на нескольких тестах (AutomationBench, Agents' Last Exam, DeepSWE v1.1, OSWorld 2.0 offline) и заявляет о выигрыше по цене при сравнимом или более высоком качестве.

Кому это важно

Разработчикам и командам, которые строят агентов и кодинг-инструменты на API OpenAI, включая Codex, им становятся доступны более дешёвые модели с большим запасом на итерации. Пользователям ChatGPT Work и Codex на тарифах Plus, Pro, Business, Enterprise и Edu, а также пользователям Free и Go, которым Luna доступна в десктоп-приложении. Компаниям, которые сравнивают стоимость владения между OpenAI и Anthropic для агентных и кодинг-задач.

Как это применить

В API модели уже доступны под идентификаторами gpt-6-sol и gpt-6-luna, цены на них на 50% ниже прежних промо-тарифов GPT-5.6. Для агентов и кодинг-задач с длинным контекстом стоит настроить кэширование промптов: OpenAI подняла cache-hit-rate по умолчанию и даёт скидку до 90% на чтение кэшированных входных токенов, а в Prompt Caching Dashboard видно, какая доля входа кэшируется. Уровень effort и набор доступных инструментов теперь можно менять, не сбрасывая кэш, а явные точки разбиения промпта позволяют управлять тем, какие префиксы кэшируются.

Можно ли доверять

Все цифры в материале, из собственных бенчмарков и заявлений OpenAI; оценки конкурентов, по признанию самой компании, взяты из открытых публикаций, а не получены независимо, а часть сравнений с Claude Fable 5.1 подменена результатами Claude Fable 5 там, где данных по 5.1 не было. Компания прямо оговаривает, что представленные тесты специально проверяют сложные ситуации и не отражают частоту ошибок в типичном использовании. Точных цен в долларах за миллион токенов, даты релиза и технических параметров моделей (число параметров, размер контекстного окна) в материале нет, только относительное снижение цены и относительные результаты тестов.

Риски и подводные камни

Материал, самопрезентация OpenAI без независимой проверки и без комментариев Anthropic, чьи модели используются как ориентир для сравнения. Часть заявлений сформулирована без конкретных цифр («Sol также превосходит Claude Fable 5.1 при заметно меньшей стоимости, и даже обходит GPT-6 Astra в режиме low effort», ни процента, ни названия теста). Поскольку абсолютные цены в долларах не названы, оценить реальную выгоду от снижения на 50% без прежних тарифов GPT-5.6 под рукой не получится. Модели пока не появились в обычном Chat, а раскатка в ChatGPT идёт постепенно в течение дня, так что фактическая доступность может отличаться от заявленной.