重點摘要
OpenAI 全面翻新 ChatGPT 語音架構,改為可持續輸出音訊,減少說話中斷。 新系統 GPT-Live 令 ChatGPT 可以「一邊講、一邊聽」。 語音對話啟動開銷由原本六次網絡往返,縮減至一次。 音訊經專用高速通道處理,推理及工具調用則改為非同步執行。 OpenAI 已公開重建過程的完整技術拆解。
OpenAI 重新搭建驅動 ChatGPT 的語音基礎設施,推出名為 GPT-Live 的新架構,令語音串流可以持續播放,就算模型在背後進行更深層推理或調用工具,也不會再打斷對話流程。
OpenAI 在 8 月 3 日透過一系列 貼文 披露相關更新,並發布一篇 部落格文章 ,詳述由客戶端到模型端的重建設計。公司指,新語音會話啟動流程已由以往六次網絡往返,削減至一次。
GPT-Live 運作方式
GPT-Live 把音訊傳輸放到一條獨立的高速通道,與模型推理及工具調用清楚分離。後者改為非同步(asynchronous)運行,即是在背景完成計算,而不會迫使前台的音訊串流暫停等待。
實際效果,是語音對話啟動時間顯著縮短,會話期間亦能維持持續發聲,不再出現用戶以往在提出複雜問題時,系統停頓、靜默等待處理的明顯空檔。
OpenAI 在另一則 貼文 中表示,新架構特別針對「會話啟動那一刻」作出優化,令用戶由第一句說話開始,就能感受到更貼近真人的自然對話節奏。是次重建正是為了解決舊有語音技術堆疊的結構性缺陷——只要模型進入任何推理步驟,就會迫使語音層停下來等候。
GPT-Live 直指 ChatGPT 語音延遲痛點
OpenAI 近年在語音能力上加速部署。踏入 2026 年,市場對 ChatGPT 語音的主要批評之一,是在處理多步驟查詢時,回應節奏偏慢、語調生硬,有明顯機械感。GPT-Live 重建,被視為 OpenAI 以工程手段正面回應這一短板。
今次發布緊接 OpenAI 上月披露的另一項成果:公司指其下一代核心模型的內部版本,在約 2,000 美元代幣成本下,產出十項全新數學研究結果,反映其在整體算力及基礎設施方面正持續加碼投資,並橫向支援不同產品線的功能升級。

