OpenAI GPT-Live: full-duplex voice, WARP protocol, async delegation to GPT-5.5

GPT-Live — третья голосовая система OpenAI. Full-duplex модель слушает и говорит одновременно, протокол WARP сокращает WebRTC-рукопожатия с 6 до 1, делегация к GPT-5.5 работает асинхронно.

Источник: OpenAI Engineering


A man on the phone with a chain of six identical suited figures, bypassed by an amber audio tube.

Шесть рукопожатий до голоса

Когда вы нажимаете кнопку голосового вызова в ChatGPT, начинается то, что инженеры OpenAI называют startup sequence. До GPT-Live это означало шесть сетевых рукопожатий: ICE, DTLS, SCTP, DCEP, сигнализация, плюс ожидание ответа сервера. Шесть round-trip. Шесть маленьких пауз, которые никто по отдельности не замечает, но вместе они складываются в то самое ощущение «ну давай, начинай уже».

Теперь — одно.

OpenAI опубликовала инженерный пост о GPT-Live, своей третьей голосовой системе. Название звучит как название операционки, но это про другое: про то, как заставить ИИ говорить и слушать одновременно, а не ждать очереди.

Что произошло

GPT-Live — full-duplex voice model. Она слушает и говорит в одно и то же время. Нет turn detector — крошечной модели-посредника, которая раньше гадала: пользователь закончил или просто задумался? Угадал рано — обрезал. Угадал поздно — заставил ждать.

Вместо этого голосовая модель держит непрерывный медиа-цикл: аудио течёт туда-сюда без разрывов. Когда нужен серьёзный ответ — reasoning или работа с инструментами — система асинхронно делегирует запрос к GPT-5.5. Пока тот думает, голосовая модель поддерживает разговор.

Три изменения в одном пакете: модель, инфраструктура и транспорт.

Протокол, у которого даже имя есть

OpenAI проанализировала стек WebRTC и обнаружила, что каждый протокол в нём содержит собственный механизм anti-DoS — даже когда в контексте полного стека он не нужен. DTLS, SCTP, ICE — каждый делал свою проверку, каждый добавлял задержку.

Результат — WARP, WebRTC Abridged Roundtrip Protocol. Обратная совместимость сохранена, но handshake сокращён с шести round-trip до одного:

  • DTLS 1.3 handshake вместо более медленного предшественника
  • SCTP handshake предсогласован (SNAP)
  • data channels предсогласованы без DCEP
  • DTLS-рукопожатие «оседлало» ICE (SPED)

WARP — набор открытых спецификаций. OpenAI работает с сообществом WebRTC через IETF TSVWG. Поддержка уже добавлена в libwebrtc и Pion.

Отдельно — Instant Connect. Параметры SDP согласовываются заранее, без резервирования серверных ресурсов. Если параметры валидны — сервер материализует сессию по первому UDP-пакету. Если нет — клиент незаметно откатывается на стандартный сигнальный поток. Без дополнительной задержки.

Go вместо Python

Медиа-фронтенд и логика вывода переписаны на Go. Предыдущая реализация использовала Python asyncio. Результат: p95 нового по задержке равен p50 старого. То есть даже «медленные» запросы новой системы работают так же, как «средние» старой.

Это не косметика. В realtime-системе каждая миллисекунда в p95 — это то, что слышит пользователь.

Контекст, который не рвётся

Длинный голосовой вызов растёт в размере. Когда контекст превышает лимит модели, его нужно компактифицировать. Обычная компактификация инвалидирует KV-cache, требует нового префилла и создаёт задержку.

OpenAI обрабатывает это как управляемый переход: пока оригинальная инстанция модели продолжает разговор, система компактирует контекст, подготавливает замену и переключается без прерывания медиа. То же самое при миграции между инстанциями модели — warm-запуск параллельно, префилл, cut-over.

Shadow-тестирование на реальных пользователях

Перед запуском OpenAI провела silent test: часть сессий ChatGPT Voice маршрутизировалась параллельно — и в старую Advanced Voice Mode, и в GPT-Live в read-only режиме. Пользователи старой системы не замечали разницы.

Выяснилось три вещи:

Ёмкость — это не только GPU. Голосовые сессии держат соединение и шлют фреймы непрерывно. CPU-side stream handlers, очереди, сетевые пути — всё это масштабируется вместе с инференсом. Один вспомогательный компонент насытился раньше, чем предсказывали нагрузочные тесты.

География стала фактором первого порядка. Маршрутизация сессии в далёкий дата-центр добавляет задержку в нескольких точках. OpenAI начала валидировать модельные rollout вместе с региональной ёмкостью.

Проблемы длинных сессий не ловятся короткими тестами. Memory pressure, reconnects, race conditions в shutdown handshake — всё это проявляется только при реалистичных жизненных циклах.

Что это значит

GPT-Live — не просто «стало быстрее». Это архитектурный сдвиг от turn-based voice к continuous media loop. Голосовая модель больше не ждёт очереди. Она держит линию, а тяжёлую работу скидывает асинхронно.

API GPT-Live ещё не вышел, но архитектура уже становится платформой для realtime-взаимодействия — не только голос, но и агентная координация через десктопное приложение ChatGPT.

Человеческий разговор работает именно так: мы слушаем и говорим одновременно, а когда не знаем ответа — берём паузу, но не вешаем трубку. OpenAI наконец сделала то же самое.

Краткий ответ

OpenAI выпустила GPT-Live — third-generation voice system с full-duplex моделью. Turn detector удалён из аудио-пути: модель слушает и говорит одновременно. Протокол WARP сокращает WebRTC handshake с 6 до 1 round-trip. Асинхронная делегация к GPT-5.5 позволяет модели «думать», не прерывая разговор. Система проходит shadow-тестирование на реальном трафике ChatGPT Voice.

← Все новости