OpenAI запустила Ultrafast, сверхбыстрый режим GPT-5.6 Sol

OpenAI представила Ultrafast, новый сервисный тариф, который запускается первым в OpenAI API и ускоряет обработку запросов флагманской моделью GPT-5.6 Sol до 14 раз по сравнению со стандартной обработкой. Режим работает на чипах партнёра Cerebras и выдаёт до 750 токенов на выходе в секунду.
До сих пор реальная скорость обычно означала выбор модели попроще или поменьше, приходилось жертвовать интеллектом ради отклика. Ultrafast, по словам компании, снимает этот компромисс: продукт получает полную мощность самой умной модели OpenAI без задержки, характерной для сложных запросов.
OpenAI перечисляет сценарии, где такая скорость особенно ценна: реагирование на инциденты и обеспечение отказоустойчивости (разбор логов приложения, недавних изменений кода и отчётов инженеров, чтобы найти причину сбоя и помочь подготовить исправление, пока авария ещё продолжается); финансовые исследования и безопасность (анализ рыночных сигналов, оценка транзакций и выявление подозрительной активности по мере того, как ситуация меняется); поддержка клиентов и голосовые сервисы (решение сложных вопросов клиента в реальном времени, без пауз в разговоре, даже если ответ требует нескольких шагов или систем); коммерция (ответы на вопросы о товаре, проверка наличия, персональные рекомендации и решение проблем на этапе оформления заказа, пока покупатель ещё не передумал); и живые исследования (эксперимент, который раньше запускали на ночь и проверяли утром, превращается в интерактивную рабочую сессию с проверкой идеи, разбором результата и новым прогоном без разрыва процесса).
Сейчас OpenAI тестирует Ultrafast с первой группой клиентов из областей разработки, коммерции, финансовых исследований, поддержки и других задач, требующих взаимодействия в реальном времени. Компания называет цель этого этапа, понять, где ускорение на порядок даёт наибольшую пользу и как меняются продукты, когда модель успевает за темпом человека.
Внутри самой OpenAI группа разработчиков уже проверяет GPT-5.6 Sol в режиме Ultrafast на двух направлениях. Первое, реагирование на инциденты: когда срабатывает алерт, инженерам нужно собрать точную картину, пока система и данные ещё меняются; команда использует Ultrafast, чтобы быстро прочитать логи, разобрать трассировки, свести переписку, определить следующие проверки и помочь подготовить или проверить исправление, при этом ответственность за суждение и решение о развёртывании остаётся за инженерами. Второе, исследования: команда применяет Ultrafast для быстрого поиска по источникам знаний, запросов к данным и сведения, упорядочивания и обобщения информации из подключённых инструментов; обычный рабочий процесс, при котором эксперимент запускают на ночь и смотрят результат утром, благодаря Ultrafast сжимается настолько, что за рабочий день можно провести несколько таких итераций вместо одной.
Ultrafast, очередной шаг в партнёрстве OpenAI с Cerebras по внедрению инференса со сверхнизкой задержкой на платформе OpenAI. Сегодня GPT-5.6 Sol в режиме Ultrafast доступен в ограниченном превью только избранной группе клиентов; OpenAI обещает расширять доступ по мере роста вычислительных мощностей и предлагает записаться на уведомление об этом.
Ключевые факты
- OpenAI запускает Ultrafast, новый тарифный уровень OpenAI API, который ускоряет модель GPT-5.6 Sol до 14 раз по сравнению со стандартной обработкой.
- Режим работает на чипах партнёра Cerebras и выдаёт до 750 токенов на выходе в секунду.
- Раньше скорость реального времени требовала брать модель попроще или поменьше; Ultrafast обещает полный интеллект флагманской модели без этой жертвы.
- Внутри OpenAI команда уже применяет Ultrafast для реагирования на инциденты (быстрый разбор логов и трассировок) и для исследований, цикл экспериментов, который раньше занимал ночь, теперь можно повторять несколько раз за рабочий день.
- Доступ пока ограничен закрытым превью для избранной группы клиентов; OpenAI обещает расширять его по мере роста мощностей.
Почему это важно
Раньше выбор был жёстким: либо берёшь модель помощнее и миришься с задержкой, либо жертвуешь интеллектом ради скорости и берёшь модель попроще. OpenAI показывает, что для GPT-5.6 Sol этот компромисс больше не обязателен, тариф Ultrafast сохраняет полный интеллект флагманской модели, но ускоряет её работу до 14 раз по сравнению со стандартным режимом. Это открывает дорогу сценариям, где сложные модели раньше не успевали за временем, от разбора аварии на сервере до консультации покупателя, который ещё не ушёл со страницы оформления заказа.
Кому это важно
Прежде всего командам, чья работа завязана на реальном времени: инженерам реагирования на инциденты, которым нужно быстро разобрать логи и изменения кода, пока авария ещё продолжается; финансовым аналитикам и службам безопасности, отслеживающим рыночные сигналы и подозрительные транзакции по мере их появления; службам поддержки и голосовым сервисам, которым нужно решать сложные вопросы клиента без пауз в разговоре; интернет-магазинам, которым важно ответить на вопрос покупателя и подобрать рекомендацию, пока он ещё не передумал; исследовательским командам, которым удобнее проверять гипотезы в интерактивном режиме, а не ждать результатов эксперимента, запущенного на ночь.
Как это применить
Ultrafast запускается первым в OpenAI API, но доступ пока закрытый: сейчас режим тестирует ограниченная группа клиентов из областей разработки, коммерции, финансовых исследований и поддержки. OpenAI собирает записи на рассылку с уведомлением о расширении доступа по мере роста вычислительных мощностей. Внутри самой компании команда уже применяет Ultrafast в двух сценариях: реагирование на инциденты (быстрый разбор логов, трассировок и переписки, подготовка и проверка исправления, решение о применении фикса при этом всё равно принимает инженер) и исследования (быстрый поиск по источникам знаний, запросы к данным и обобщение информации, что позволяет за рабочий день повторить эксперимент несколько раз вместо одного ночного прогона).
Можно ли доверять
Это официальный анонс самой OpenAI, а не пересказ третьих лиц, и заявленные цифры, до 14 раз быстрее и до 750 токенов в секунду, приведены как максимальные показатели ('до'), а не гарантированная норма для любой задачи. При этом в материале нет ни точной даты запуска (только 'сегодня'), ни цены, ни имени конкретного сотрудника или клиента, подтверждающего результаты, ни сроков перехода из превью в открытый доступ. Список сценариев применения основан на внутреннем опыте OpenAI и первой группы клиентов, независимой проверки этих цифр на момент публикации нет.
Риски и подводные камни
Пока это узкое закрытое превью, а не общедоступный тариф, когда и на каких условиях Ultrafast станет доступен всем клиентам API и сколько это будет стоить, не сказано. OpenAI прямо оговаривает: даже при ускоренном разборе инцидентов ответственность за диагноз и решение о развёртывании исправления остаётся за инженером, то есть Ultrafast ускоряет подготовку данных, а не заменяет человеческую проверку. Заявленные 14-кратное ускорение и 750 токенов в секунду, это максимум ('до'), реальная скорость на конкретной задаче может оказаться ниже.