OpenAI раскрыла архитектуру голосовой системы GPT-Live

OpenAI описала низколатентную архитектуру GPT-Live — полнодуплексной голосовой системы, способной одновременно слушать пользователя и отвечать. Для непрерывной обработки аудио компания внедрила потоковый инференс с сохранением состояния, отделила медиатрафик от вызова инструментов и сократила запуск WebRTC-сессии с шести сетевых раундов до одного.

OpenAI рассказала, как за шесть месяцев построила инфраструктуру GPT-Live — голосовой системы третьего поколения для ChatGPT. В отличие от прежней архитектуры, она не использует отдельную модель для определения конца реплики: полнодуплексная голосовая модель непрерывно получает аудио и может слушать одновременно с воспроизведением ответа.

Аудиотрафик передается по выделенному быстрому контуру, тогда как обращение к инструментам, прикладной логике и более мощным моделям выполняется асинхронно. Например, GPT-Live может передать задачу GPT-5.5 для поиска или углубленного рассуждения, продолжая поддерживать разговор. Медиашлюз и логику инференса OpenAI переписала с Python asyncio на Go.

Для длительных разговоров разработан механизм переноса сессии между экземплярами модели без прерывания аудиопотока. Он также используется при сжатии разросшегося контекста: система параллельно подготавливает новый экземпляр модели с обновленным контекстом, после чего незаметно переключает на него сессию.

Чтобы ускорить установку соединения, OpenAI разработала набор обратно совместимых расширений WebRTC под названием WARP. Он сокращает запуск передачи медиа и данных с шести сетевых раундов до одного; поддержка уже добавлена в libwebrtc и библиотеку Pion, а спецификации продвигаются через рабочую группу IETF. Архитектура применяется в ChatGPT Voice и должна стать основой будущего API GPT-Live.

Источник: openai.com

Связь с редакцией