要点概览
OpenAI 重构 ChatGPT 语音架构,使音频可连续流动,不再被频繁中断。 新系统 GPT-Live 支持 ChatGPT “一边说话一边聆听”。 语音会话启动由过去的六次网络往返压缩为一次。 音频通过专用高速通道传输,推理与工具调用异步并行执行。 OpenAI 发布了这次重构的完整技术解析。
OpenAI 对支撑 ChatGPT 的语音基础设施进行了全面重构,推出全新架构 GPT-Live。该系统让语音流保持连续, 即便模型在进行更深层次的推理或调用工具,也不会打断对话。
OpenAI 于 8 月 3 日通过一系列 帖子 披露相关改动, 并在一篇 博客 中详细说明了从客户端到模型端的整体重构过程。 公司表示,语音会话的启动流程由此前依赖的六次网络往返缩减为一次。
GPT-Live 如何运作
在 GPT-Live 中,音频数据被分流到一条专用高速通道,与推理计算、工具调用等“重负载”任务彻底解耦。 后者通过异步方式在后台完成,不再阻塞前端的音频输出。
这样一来,语音会话不仅启动更快,而且在处理复杂请求时,也能持续保持对话,而不会像以往那样在推理阶段出现明显空白和停顿。
OpenAI 在一则 帖子 中指出,新架构专门优化了会话起始的关键时刻, 让用户从第一轮交互起就能感受到更加自然、顺畅的对话节奏。此次重构直接解决了旧技术栈的结构性瓶颈: 只要模型进入推理步骤,音频层就被迫“等待”。
延伸阅读:Cosmos Hub 上涨 6%:跨链叙事再迎复苏
GPT-Live 对准 ChatGPT 语音延迟痛点
进入 2026 年前后,OpenAI 在语音能力上的推进节奏明显加快。今年早些时候, 市场普遍批评 ChatGPT 在处理多步骤复杂问题时,语音回答节奏生硬、反应迟缓。GPT-Live 的推出, 可以视作 OpenAI 针对这一短板的工程化回应。
此次发布紧随 OpenAI 上月披露的一项内部测试:其下一代主力模型的内部版本以约 2,000 美元的 Token 成本, 推导出了 10 个全新的数学成果,侧面体现出公司正在整个产品线加大底层基础设施投入。






