OpenAI выпустила GPT-Live, голосовой ИИ, который слушает и говорит одновременно

OpenAI выпустила GPT-Live, голосовой ИИ, который слушает и говорит одновременно

Инженеры OpenAI Джастин Уберти и Захан Малкани рассказали, как за шесть месяцев компания построила GPT-Live, третье поколение своей голосовой системы, которая теперь лежит в основе ChatGPT Voice. Главное отличие: из аудиопотока убрали отдельную модель-детектор пауз (turn detector), которая раньше решала, когда пользователь закончил говорить. Такой детектор ошибался в обе стороны, либо перебивал человека, либо заставлял ждать ответа, а сама голосовая модель могла взяться за работу только после его решения. Ранние каскадные системы (распознавание речи → текстовая модель → синтез речи) добавляли задержку на каждом шаге и теряли интонацию и темп речи.

GPT-Live работает по-другому: голосовая модель full-duplex, то есть слушает и говорит одновременно, без промежуточного детектора. Когда разговору требуется более глубокое рассуждение или обращение к инструментам, GPT-Live незаметно для пользователя делегирует эту часть старшим моделям, например GPT-5.5, не прерывая поток беседы. Именно на этой основе построены новые возможности ChatGPT Voice, включая недавно запущенную функцию управления компьютером пользователя и координации его агентов в десктоп-приложении ChatGPT.

Чтобы добиться такой отзывчивости, команда переписала медиа-часть и логику инференса с Python (asyncio) на Go, это заметно улучшило плавность доставки аудиокадров: 95-й процентиль задержки новой системы сравнялся с 50-м процентилем старой. Транспортом служит WebRTC, устойчивый к потере пакетов и колебаниям сети; поверх него OpenAI разработала собственный протокол WARP (WebRTC Abridged Roundtrip Protocol), который сокращает число сетевых обменов на старте разговора с шести до одного.

Отдельная проблема, долгие сессии: контекст разговора постоянно растёт, а инстансы модели поднимаются и опускаются по нагрузке. Решение, «бесшовная» передача: система заранее поднимает и прогревает резервный инстанс модели, загружает в него текущий контекст, какое-то время прогоняет инференс параллельно на старом и новом инстансах и переключается на новый, когда тот полностью готов. Тот же механизм используется для сжатия разросшегося контекста, когда он приближается к лимиту модели, операция проходит в фоне, на резервном инстансе, так что переключение происходит без единого перерыва в разговоре.

Для самого делегирования к старшим моделям OpenAI заранее, ещё до начала диалога, создаёт для них инференс-сессию и загружает в неё начальный контекст разговора, чтобы к моменту первого обращения промпт был уже полностью обработан. Эта сессия держится открытой на весь разговор с постоянной привязкой запросов к одному и тому же воркеру и кэшированием промпта, а параметры вроде уровня рассуждений, лимитов вывода и схем инструментов подстроены под минимальную задержку.

Ключевые факты

  • GPT-Live, третье поколение голосовой системы OpenAI, на ней теперь работает ChatGPT Voice
  • Из аудиопотока убрали отдельную модель-детектор пауз: голосовая модель full-duplex слушает и говорит одновременно
  • При необходимости GPT-Live незаметно делегирует сложные рассуждения и инструменты старшим моделям вроде GPT-5.5, не прерывая разговор
  • Медиа-часть и инференс переписали с Python (asyncio) на Go: 95-й процентиль задержки новой системы сравнялся с 50-м процентилем старой
  • Собственный протокол WARP поверх WebRTC сократил число сетевых обменов на старте разговора с шести до одного

Почему это важно

GPT-Live решает базовую проблему голосовых ассистентов, естественную передачу слова между собеседниками. Раньше эта задача упиралась в отдельную вспомогательную модель, которая либо обрывала пользователя, либо тормозила с ответом, и лишь после её решения включалась основная голосовая модель. Убрав это узкое место и сделав голосовую модель full-duplex, OpenAI одновременно сохранила доступ к более мощным моделям для сложных задач, GPT-Live решает, когда достаточно быстрого ответа, а когда стоит незаметно для пользователя подключить GPT-5.5.

Кому это важно

В первую очередь, пользователям ChatGPT Voice, которые получают более естественный и быстрый голосовой диалог, включая новую функцию управления компьютером и координации агентов в десктоп-приложении. Также это важно для инженеров, которые строят голосовые интерфейсы и системы реального времени: пост описывает конкретные архитектурные решения, от разделения медиапотока и бизнес-логики до протокола WARP, применимые за пределами одного продукта.

Как это применить

В источнике нет отдельного API или тарифа для GPT-Live, речь идёт об инфраструктуре, на которой уже работает продукт ChatGPT Voice, включая функцию управления компьютером и агентами в десктоп-приложении. Для инженерных команд, строящих похожие системы, применимы описанные приёмы: перенос медиа-логики на более предсказуемый в задержках язык (в данном случае, Go), разделение живого медиапотока и фоновой бизнес-логики через асинхронную границу, и «бесшовная» передача между инстансами модели для долгих сессий и сжатия контекста.

Можно ли доверять

Источник, официальный инженерный блог OpenAI с указанием конкретных авторов, Джастина Уберти и Захана Малкани, с детальным описанием архитектурных решений. Это первичный отчёт компании о собственной разработке, поэтому цифры и оценки (например, сравнение процентилей задержки) не проверены независимой стороной и приведены в пересказе так, как заявлены источником.

Риски и подводные камни

В посте не указаны абсолютные значения задержки, только относительное сравнение процентилей (95-й процентиль новой системы против 50-го процентиля старой), поэтому оценить реальные миллисекунды нельзя. Не названа точная дата запуска GPT-Live или публикации поста. Часть текста об улучшениях протокола WARP в исходном материале обрывается на полуслове, поэтому подробности сверх сокращения числа обменов с шести до одного в пересказе не отражены.