OpenAI 重构语音技术栈 推出 GPT-Live 实现 ChatGPT 连续对话

Vacant ethics leadership at OpenAI follows the July departure of Chloé Bakalar, whom the company has not replaced. (Image: Shutterstock)
Vacant ethics leadership at OpenAI follows the July departure of Chloé Bakalar, whom the company has not replaced. (Image: Shutterstock)

要点概览

OpenAI 重构 ChatGPT 语音架构,使音频可连续流动,不再被频繁中断。 新系统 GPT-Live 支持 ChatGPT “一边说话一边聆听”。 语音会话启动由过去的六次网络往返压缩为一次。 音频通过专用高速通道传输,推理与工具调用异步并行执行。 OpenAI 发布了这次重构的完整技术解析。

OpenAI 对支撑 ChatGPT 的语音基础设施进行了全面重构,推出全新架构 GPT-Live。该系统让语音流保持连续, 即便模型在进行更深层次的推理或调用工具,也不会打断对话。

OpenAI 于 8 月 3 日通过一系列 帖子 披露相关改动, 并在一篇 博客 中详细说明了从客户端到模型端的整体重构过程。 公司表示,语音会话的启动流程由此前依赖的六次网络往返缩减为一次。

GPT-Live 如何运作

在 GPT-Live 中,音频数据被分流到一条专用高速通道,与推理计算、工具调用等“重负载”任务彻底解耦。 后者通过异步方式在后台完成,不再阻塞前端的音频输出。

这样一来,语音会话不仅启动更快,而且在处理复杂请求时,也能持续保持对话,而不会像以往那样在推理阶段出现明显空白和停顿。

OpenAI 在一则 帖子 中指出,新架构专门优化了会话起始的关键时刻, 让用户从第一轮交互起就能感受到更加自然、顺畅的对话节奏。此次重构直接解决了旧技术栈的结构性瓶颈: 只要模型进入推理步骤,音频层就被迫“等待”。

延伸阅读Cosmos Hub 上涨 6%:跨链叙事再迎复苏

GPT-Live 对准 ChatGPT 语音延迟痛点

进入 2026 年前后,OpenAI 在语音能力上的推进节奏明显加快。今年早些时候, 市场普遍批评 ChatGPT 在处理多步骤复杂问题时,语音回答节奏生硬、反应迟缓。GPT-Live 的推出, 可以视作 OpenAI 针对这一短板的工程化回应。

此次发布紧随 OpenAI 上月披露的一项内部测试:其下一代主力模型的内部版本以约 2,000 美元的 Token 成本, 推导出了 10 个全新的数学成果,侧面体现出公司正在整个产品线加大底层基础设施投入。

下篇看这个Qwen 与 DeepSeek 把中国大模型推到紧逼 Anthropic 的位置

Murtuza Merchant profile photo

Murtuza Merchant

Murtuza 是一位经验丰富的财经记者,在报道加密货币和区块链技术方面具有丰富经验。他曾为 Benzinga 和 Cointelegraph 等多家媒体撰稿,报道新兴趋势、监管环境等内容。你可以在 Twitter 上通过 @murtuza_merc 和在 Telegram 上通过 mmerchant001 找到他。 披露:Murtuza 持有 ATOM、AKT、TIA、INJ 和 OSMO。

免责声明和风险警告: 本文提供的信息仅用于教育和信息目的,基于作者的意见。它不构成财务、投资、法律或税务建议。 加密货币资产具有高度波动性并面临高风险,包括失去全部或大部分投资的风险。交易或持有加密资产可能不适合所有投资者。 本文表达的观点仅为作者的观点,不代表Yellow、其创始人或高管的官方政策或立场。 在做出任何投资决定之前,请务必进行自己的全面研究(D.Y.O.R.)并咨询持牌金融专业人士。