OpenAI снизила цену GPT-5.6 Luna на 80%, модель сама оптимизировала инференс
OpenAI объявила о резком снижении цен на две свои модели: GPT-5.6 Terra подешевела на 20%, а GPT-5.6 Luna, сразу на 80%. Новая цена Luna, 0,20 доллара за миллион входных токенов и 1,20 доллара за миллион выходных.
По словам OpenAI, снижение стало возможным благодаря модели GPT-5.6 Sol. Её использовали для оптимизации балансировки нагрузки, а также для оптимизации самого инференса: в статье «How GPT-5.6 fuses frontier intelligence with frontier efficiency» («Как GPT-5.6 сочетает передовой интеллект с передовой эффективностью») OpenAI описывает, как GPT-5.6 Sol оптимизировала прямой проход модели, вычисления, которые превращают входные данные в предсказание следующего токена. Даже когда отдельные операции быстрые, лишние перемещения данных в памяти, синхронизация и неэффективное расположение данных оставляют видеокарты простаивающими; GPT-5.6 Sol находила работу, которую можно было заранее просчитать, исключить или распараллелить. С помощью Codex модель самостоятельно переписала и оптимизировала производственные вычислительные ядра, код, который выполняет математические операции, лежащие в основе модели. Это получилось в том числе потому, что GPT-5.6 обучали писать и улучшать ядра на Triton и Gluon, открытых языках программирования для видеокарт, которые поддерживает OpenAI. В сумме эти усилия снизили итоговую стоимость обслуживания запросов на 20%.
Падение цены Luna меняет расстановку сил среди недорогих моделей. При 0,20 доллара за миллион входных токенов и 1,20 доллара за выходные Luna теперь дешевле, чем Gemini 3.1 Flash-Lite от Google (0,025 доллара за вход и 1,50 доллара за выход, по данным источника). Самая дешёвая модель Anthropic, Claude Haiku 4.5, стоит 1 доллар за вход и 5 долларов за выход, Luna теперь впятеро дешевле по входным токенам, хотя раньше цены совпадали.
Саймон Уиллисон, автор блога, на котором вышла эта заметка, привёл личный пример: его демонстрационный сайт agent.datasette.io раньше работал на Gemini 3.1 Flash-Lite, и он переключил его на Luna.
Ключевые факты
- OpenAI снизила цену GPT-5.6 Terra на 20%, а GPT-5.6 Luna, на 80%
- Новая цена Luna: 0,20 доллара за миллион входных токенов и 1,20 доллара за миллион выходных
- Экономию обеспечила модель GPT-5.6 Sol: она оптимизировала балансировку нагрузки и прямой проход модели, а с помощью Codex переписала производственные вычислительные ядра на Triton и Gluon, что снизило стоимость обслуживания на 20%
- Luna стала дешевле Gemini 3.1 Flash-Lite от Google и впятеро дешевле по входным токенам, чем самая дешёвая модель Anthropic, Claude Haiku 4.5
- Саймон Уиллисон переключил свой демо-проект agent.datasette.io с Gemini 3.1 Flash-Lite на Luna
Почему это важно
Ценовая конкуренция среди недорогих моделей резко обострилась. GPT-5.6 Luna от OpenAI подешевела на 80% и обошла по цене как Gemini 3.1 Flash-Lite от Google, так и Claude Haiku 4.5 от Anthropic, двух главных конкурентов в сегменте дешёвых моделей для массовых задач. Важен и способ, которым добилась экономии OpenAI: не только за счёт железа или масштаба, а благодаря тому, что одна модель (GPT-5.6 Sol) сама оптимизировала работу другой, переписывала вычислительные ядра и находила, какие операции можно исключить или распараллелить.
Кому это важно
Разработчикам, которые строят ИИ-агентов и продукты с большим объёмом обращений к модели, где цена за токен определяет экономику всего сервиса, например, демонстрационные и продакшн-приложения вроде agent.datasette.io. Также это важно конкурентам OpenAI, Google и Anthropic, чьи дешёвые модели (Gemini 3.1 Flash-Lite и Claude Haiku 4.5) только что стали дороже, чем Luna, по входным токенам.
Как это применить
Разработчикам, использующим дешёвые модели для высокообъёмных задач, стоит пересчитать экономику своих сервисов с учётом новой цены Luna, 0,20 доллара за миллион входных токенов и 1,20 доллара за миллион выходных, и сравнить её с текущими вариантами (Gemini 3.1 Flash-Lite, Claude Haiku 4.5). Как показывает пример из заметки, для проектов, где раньше выбирали самую дешёвую модель конкурента, переход на Luna может дать прямую экономию без потери функциональности, если задача укладывается в её возможности.
Можно ли доверять
Материал написан Саймоном Уиллисоном, известным разработчиком и автором авторитетного блога об ИИ-инструментах, и опирается на собственный технический пост OpenAI об оптимизации GPT-5.6. Это вторичный источник: цифры и цитаты приведены со ссылкой на первоисточник, а личный пример переключения демо-сайта на Luna Уиллисон описывает от первого лица.
Риски и подводные камни
Заметка не раскрывает, как снижение стоимости обслуживания сказалось на скорости ответа или качестве вывода модели, приведена только итоговая экономия в 20% на серверной стороне. Также стоит учитывать, что заявленные цены конкурентов (Gemini 3.1 Flash-Lite, Claude Haiku 4.5) даны по состоянию на момент публикации и могут измениться в ответ на шаг OpenAI.
«С помощью Codex модель GPT-5.6 Sol самостоятельно переписала и оптимизировала наши производственные вычислительные ядра, код, который выполняет математические операции, лежащие в основе модели.»
— OpenAI, из статьи «How GPT-5.6 fuses frontier intelligence with frontier efficiency»