Ключевые факты
OpenAI радикально переработала голосовую архитектуру ChatGPT, обеспечив непрерывный звук без разрывов. Новая система GPT-Live позволяет ChatGPT одновременно говорить и слушать. Старт голосовой сессии сократился с шести сетевых обменов до одного. Аудио обрабатывается по выделенному «быстрому контуру», в то время как рассуждения и вызовы инструментов идут асинхронно. OpenAI опубликовала подробный технический разбор новой архитектуры.
OpenAI полностью перестроила голосовую инфраструктуру ChatGPT и представила новую архитектуру GPT-Live, которая поддерживает непрерывный поток аудио, чтобы сложные рассуждения и использование инструментов больше не «рвали» разговор на паузы.
Компания раскрыла детали изменений в серии постов 3 августа и в отдельном блоге, где описала перестройку всей цепочки — от клиента до модели. По её данным, запуск голосовой сессии удалось сократить с шести сетевых «кругов» до одного запроса.
Как устроен GPT-Live
GPT-Live направляет аудиопоток по выделенному, ускоренному контуру, отделённому от логики рассуждений и вызовов инструментов. Глубокие вычисления выполняются асинхронно — в фоновом режиме, не останавливая передачу голоса.
В результате голосовая сессия запускается заметно быстрее и остаётся «живой», без привычных для пользователей пауз в те моменты, когда ChatGPT разбирается с более сложными запросами.
В одном из постов OpenAI отмечает, что новая архитектура решает проблему именно стартового момента сессии: диалог с первой реплики ощущается более естественным. Перестройка устраняет структурное ограничение прежнего стека, при котором любой шаг рассуждений заставлял аудиослой ждать завершения вычислений.
Читайте также: Cosmos Hub прибавляет 6% на фоне возрождения Interchain-тезиса
GPT-Live: ответ на задержки голосового ChatGPT
К 2026 году OpenAI последовательно наращивает возможности голосового интерфейса. Ранее в этом году компанию критиковали за то, что голосовые ответы ChatGPT звучали неестественно и запаздывали при обработке многошаговых запросов. Перезапуск стека в формате GPT-Live — это прямой инженерный ответ OpenAI на этот разрыв в пользовательском опыте.
Релиз следует за недавним раскрытием OpenAI, что внутренний прототип её следующей крупной модели сгенерировал десять новых математических результатов при затратах порядка $2 000 на токены. Это указывает на масштабные инвестиции в инфраструктуру по всей продуктовой линейке.
Далее по теме: Qwen и DeepSeek подталкивают китайский ИИ вплотную к Anthropic






