要點整理
OpenAI 全面重構 ChatGPT 語音架構,實現語音訊號連續輸出不中斷。
新系統 GPT-Live 讓 ChatGPT 可以一邊說話、一邊收聽。
每次語音對話啟動,所需網絡往返由六次減至一次。
語音數據走專用高速通道,推理及工具調用則以非同步方式執行。
OpenAI 已公開整套重建流程的技術詳解。
OpenAI 重新打造驅動 ChatGPT 的語音基礎設施,推出全新 GPT-Live 架構,令語音串流可以持續播放,就算模型在進行深度推理或調用工具,對話亦無需中斷。
OpenAI 於 8 月 3 日在一系列 貼文 中披露相關更新,並發佈 部落格文章 ,從用戶端到模型端詳述整個系統如何重建。官方指,新語音會話的啟動流程,已由原本六次網絡往返壓縮至一次。
GPT-Live 如何運作
在 GPT-Live 架構下,語音訊號會被引導到一條專用高速通道,與模型推理及工具調用的路徑分開。較重的推理及工具調用工作以非同步方式在背景執行,毋須暫停前台語音串流。
結果是,語音會話可以更快開始,而且過程保持連續,不再出現以往在處理複雜請求時,用戶感受到的停頓空檔。
OpenAI 在另一篇 貼文 指出,新架構特別針對會話啟動一刻進行優化,令用戶由第一句開始已感覺對話更加自然。今次重構,正面破解舊有技術堆疊的結構性限制 —— 只要模型進入推理步驟,語音層就被迫等待的問題。
GPT-Live 重建 直指 ChatGPT 語音延遲痛點
OpenAI 近年在語音能力上加速部署。早前市場批評指,ChatGPT 在處理多步驟查詢時,語音回應不但生硬,亦常出現明顯延遲。GPT-Live 的推出,可視為 OpenAI 對這個缺口作出的直接工程回應。
這次發佈亦緊接 OpenAI 上月披露的一項內部測試:公司指下一代主力模型的內部版本,僅以約 2,000 美元的代幣成本,便產出了十項新的數學成果,反映其在整體基建層面持續大幅投資,涵蓋包括語音在內的多條產品線。






