重點摘要
OpenAI 大幅改造 ChatGPT 語音架構,讓音訊能連續傳輸、不再頻繁中斷。
全新 GPT-Live 系統支援「一邊說話一邊聽」的雙工對話。
語音對話啟動流程,從過去 6 次網路往返縮減為 1 次。
音訊走獨立快速通道,推理與工具呼叫改為非同步處理。
OpenAI 已公開重建過程的完整技術說明。
OpenAI 重新打造驅動 ChatGPT 的語音基礎架構,推出全新 GPT-Live 架構,讓音訊得以持續輸出, 深度推理與工具呼叫不再打斷對話流程。
OpenAI 在 8 月 3 日透過一系列 貼文 說明改版重點, 並在官方 部落格 詳細解構從用戶端到模型端的重建過程。 公司指出,新系統將語音對話啟動的網路往返次數,從 6 次大幅壓縮為 1 次。
GPT-Live 如何運作
GPT-Live 將音訊資料導入專屬的高速通道,與推理與工具呼叫等較重的運算流程切割開來。 這些深度處理改為非同步執行,也就是在背景完成,不會卡住前景的語音串流。
實際效果是語音對話啟動更快、維持連線更穩,過去當 ChatGPT 處理複雜指令時常出現的靜默空檔明顯減少。
OpenAI 在另一則 貼文 中表示,新架構特別處理「對話啟動的那一刻」, 讓使用者從第一句話開始就能感受到接近真人的自然互動。 此次重建正面解決了舊有架構的結構性限制——只要進入推理步驟,音訊層就被迫等待。
GPT-Live 鎖定 ChatGPT 語音延遲痛點
OpenAI 近年在語音功能上大舉投入。年初以來,市場批評 ChatGPT 在多步驟問答時, 語音回應節奏生硬、反應偏慢。GPT-Live 的推出,可視為 OpenAI 針對此一缺口的直接工程解法。
此次發布銜接上月消息:OpenAI 透露,旗下下一代重要模型的內部版本, 僅以約 2,000 美元的權杖成本,就產出 10 項新的數學成果,對外釋出公司正對整體基礎設施大規模加碼投資的訊號。






