OpenAI 重塑 ChatGPT 語音技術堆疊 推 GPT-Live 支援連續對話

ChatGPT Voice Can Now Listen While It Speaks After OpenAI Overhauls the Audio Stack
OpenAI Reduces Voice Session Startup From Six Network Round Trips to One With New Architecture (Image: AI)

要點整理

OpenAI 全面重構 ChatGPT 語音架構,實現語音訊號連續輸出不中斷。
新系統 GPT-Live 讓 ChatGPT 可以一邊說話、一邊收聽。
每次語音對話啟動,所需網絡往返由六次減至一次。
語音數據走專用高速通道,推理及工具調用則以非同步方式執行。
OpenAI 已公開整套重建流程的技術詳解。

OpenAI 重新打造驅動 ChatGPT 的語音基礎設施,推出全新 GPT-Live 架構,令語音串流可以持續播放,就算模型在進行深度推理或調用工具,對話亦無需中斷。

OpenAI 於 8 月 3 日在一系列 貼文 中披露相關更新,並發佈 部落格文章 ,從用戶端到模型端詳述整個系統如何重建。官方指,新語音會話的啟動流程,已由原本六次網絡往返壓縮至一次。

GPT-Live 如何運作

在 GPT-Live 架構下,語音訊號會被引導到一條專用高速通道,與模型推理及工具調用的路徑分開。較重的推理及工具調用工作以非同步方式在背景執行,毋須暫停前台語音串流。

結果是,語音會話可以更快開始,而且過程保持連續,不再出現以往在處理複雜請求時,用戶感受到的停頓空檔。

OpenAI 在另一篇 貼文 指出,新架構特別針對會話啟動一刻進行優化,令用戶由第一句開始已感覺對話更加自然。今次重構,正面破解舊有技術堆疊的結構性限制 —— 只要模型進入推理步驟,語音層就被迫等待的問題。

延伸閱讀Cosmos Hub 漲 6%,跨鏈敘事再度升溫

GPT-Live 重建 直指 ChatGPT 語音延遲痛點

OpenAI 近年在語音能力上加速部署。早前市場批評指,ChatGPT 在處理多步驟查詢時,語音回應不但生硬,亦常出現明顯延遲。GPT-Live 的推出,可視為 OpenAI 對這個缺口作出的直接工程回應。

這次發佈亦緊接 OpenAI 上月披露的一項內部測試:公司指下一代主力模型的內部版本,僅以約 2,000 美元的代幣成本,便產出了十項新的數學成果,反映其在整體基建層面持續大幅投資,涵蓋包括語音在內的多條產品線。

下一步閱讀Qwen 與 DeepSeek 將中國 AI 推到 Anthropic 家門口

Murtuza Merchant profile photo

Murtuza Merchant

Murtuza 是一位資深財經記者,在加密貨幣與區塊鏈技術領域擁有豐富的採訪與報導經驗。他曾為 Benzinga 和 Cointelegraph 等多家媒體撰稿,專注報導新興趨勢、監管環境等主題。你可以在 Twitter 上透過 @murtuza_merc,或在 Telegram 上透過 mmerchant001 找到他。 Disclosure: Murtuza holds ATOM, AKT, TIA, INJ, and OSMO.

免責聲明及風險提示: 本文資訊僅供教育與參考之用,並基於作者意見,並不構成金融、投資、法律或稅務建議。 加密貨幣資產具高度波動性並伴隨高風險,可能導致投資大幅虧損或全部損失,並非適合所有投資者。 文章內容僅代表作者觀點,不代表 Yellow、創辦人或管理層立場。 投資前請務必自行徹底研究(D.Y.O.R.),並諮詢持牌金融專業人士。
OpenAI 重塑 ChatGPT 語音技術堆疊 推 GPT-Live 支援連續對話 | Yellow