OpenAI 重构语音技术栈 推出 GPT-Live 实现 ChatGPT 连续对话

ChatGPT Voice Can Now Listen While It Speaks After OpenAI Overhauls the Audio Stack
OpenAI Reduces Voice Session Startup From Six Network Round Trips to One With New Architecture (Image: AI)

要点概览

OpenAI 重构 ChatGPT 语音架构,使音频可连续流动,不再被频繁中断。 新系统 GPT-Live 支持 ChatGPT “一边说话一边聆听”。 语音会话启动由过去的六次网络往返压缩为一次。 音频通过专用高速通道传输,推理与工具调用异步并行执行。 OpenAI 发布了这次重构的完整技术解析。

OpenAI 对支撑 ChatGPT 的语音基础设施进行了全面重构,推出全新架构 GPT-Live。该系统让语音流保持连续, 即便模型在进行更深层次的推理或调用工具,也不会打断对话。

OpenAI 于 8 月 3 日通过一系列 帖子 披露相关改动, 并在一篇 博客 中详细说明了从客户端到模型端的整体重构过程。 公司表示,语音会话的启动流程由此前依赖的六次网络往返缩减为一次。

GPT-Live 如何运作

在 GPT-Live 中,音频数据被分流到一条专用高速通道,与推理计算、工具调用等“重负载”任务彻底解耦。 后者通过异步方式在后台完成,不再阻塞前端的音频输出。

这样一来,语音会话不仅启动更快,而且在处理复杂请求时,也能持续保持对话,而不会像以往那样在推理阶段出现明显空白和停顿。

OpenAI 在一则 帖子 中指出,新架构专门优化了会话起始的关键时刻, 让用户从第一轮交互起就能感受到更加自然、顺畅的对话节奏。此次重构直接解决了旧技术栈的结构性瓶颈: 只要模型进入推理步骤,音频层就被迫“等待”。

延伸阅读Cosmos Hub 上涨 6%:跨链叙事再迎复苏

GPT-Live 对准 ChatGPT 语音延迟痛点

进入 2026 年前后,OpenAI 在语音能力上的推进节奏明显加快。今年早些时候, 市场普遍批评 ChatGPT 在处理多步骤复杂问题时,语音回答节奏生硬、反应迟缓。GPT-Live 的推出, 可以视作 OpenAI 针对这一短板的工程化回应。

此次发布紧随 OpenAI 上月披露的一项内部测试:其下一代主力模型的内部版本以约 2,000 美元的 Token 成本, 推导出了 10 个全新的数学成果,侧面体现出公司正在整个产品线加大底层基础设施投入。

下篇看这个Qwen 与 DeepSeek 把中国大模型推到紧逼 Anthropic 的位置

Murtuza Merchant profile photo

Murtuza Merchant

Murtuza 是一位经验丰富的财经记者,在报道加密货币和区块链技术方面具有丰富经验。他曾为 Benzinga 和 Cointelegraph 等多家媒体撰稿,报道新兴趋势、监管环境等内容。你可以在 Twitter 上通过 @murtuza_merc 和在 Telegram 上通过 mmerchant001 找到他。 披露:Murtuza 持有 ATOM、AKT、TIA、INJ 和 OSMO。

免责声明和风险警告: 本文提供的信息仅用于教育和信息目的,基于作者的意见。它不构成财务、投资、法律或税务建议。 加密货币资产具有高度波动性并面临高风险,包括失去全部或大部分投资的风险。交易或持有加密资产可能不适合所有投资者。 本文表达的观点仅为作者的观点,不代表Yellow、其创始人或高管的官方政策或立场。 在做出任何投资决定之前,请务必进行自己的全面研究(D.Y.O.R.)并咨询持牌金融专业人士。
OpenAI 重构语音技术栈 推出 GPT-Live 实现 ChatGPT 连续对话 | Yellow