OpenAI 重塑 ChatGPT 語音技術堆疊 推 GPT-Live 支援連續對話

Vacant ethics leadership at OpenAI follows the July departure of Chloé Bakalar, whom the company has not replaced. (Image: Shutterstock)
Vacant ethics leadership at OpenAI follows the July departure of Chloé Bakalar, whom the company has not replaced. (Image: Shutterstock)

要點整理

OpenAI 全面重構 ChatGPT 語音架構,實現語音訊號連續輸出不中斷。
新系統 GPT-Live 讓 ChatGPT 可以一邊說話、一邊收聽。
每次語音對話啟動,所需網絡往返由六次減至一次。
語音數據走專用高速通道,推理及工具調用則以非同步方式執行。
OpenAI 已公開整套重建流程的技術詳解。

OpenAI 重新打造驅動 ChatGPT 的語音基礎設施,推出全新 GPT-Live 架構,令語音串流可以持續播放,就算模型在進行深度推理或調用工具,對話亦無需中斷。

OpenAI 於 8 月 3 日在一系列 貼文 中披露相關更新,並發佈 部落格文章 ,從用戶端到模型端詳述整個系統如何重建。官方指,新語音會話的啟動流程,已由原本六次網絡往返壓縮至一次。

GPT-Live 如何運作

在 GPT-Live 架構下,語音訊號會被引導到一條專用高速通道,與模型推理及工具調用的路徑分開。較重的推理及工具調用工作以非同步方式在背景執行,毋須暫停前台語音串流。

結果是,語音會話可以更快開始,而且過程保持連續,不再出現以往在處理複雜請求時,用戶感受到的停頓空檔。

OpenAI 在另一篇 貼文 指出,新架構特別針對會話啟動一刻進行優化,令用戶由第一句開始已感覺對話更加自然。今次重構,正面破解舊有技術堆疊的結構性限制 —— 只要模型進入推理步驟,語音層就被迫等待的問題。

延伸閱讀Cosmos Hub 漲 6%,跨鏈敘事再度升溫

GPT-Live 重建 直指 ChatGPT 語音延遲痛點

OpenAI 近年在語音能力上加速部署。早前市場批評指,ChatGPT 在處理多步驟查詢時,語音回應不但生硬,亦常出現明顯延遲。GPT-Live 的推出,可視為 OpenAI 對這個缺口作出的直接工程回應。

這次發佈亦緊接 OpenAI 上月披露的一項內部測試:公司指下一代主力模型的內部版本,僅以約 2,000 美元的代幣成本,便產出了十項新的數學成果,反映其在整體基建層面持續大幅投資,涵蓋包括語音在內的多條產品線。

下一步閱讀Qwen 與 DeepSeek 將中國 AI 推到 Anthropic 家門口

Murtuza Merchant profile photo

Murtuza Merchant

Murtuza 是一位資深財經記者,在加密貨幣與區塊鏈技術領域擁有豐富的採訪與報導經驗。他曾為 Benzinga 和 Cointelegraph 等多家媒體撰稿,專注報導新興趨勢、監管環境等主題。你可以在 Twitter 上透過 @murtuza_merc,或在 Telegram 上透過 mmerchant001 找到他。 Disclosure: Murtuza holds ATOM, AKT, TIA, INJ, and OSMO.

免責聲明及風險提示: 本文資訊僅供教育與參考之用,並基於作者意見,並不構成金融、投資、法律或稅務建議。 加密貨幣資產具高度波動性並伴隨高風險,可能導致投資大幅虧損或全部損失,並非適合所有投資者。 文章內容僅代表作者觀點,不代表 Yellow、創辦人或管理層立場。 投資前請務必自行徹底研究(D.Y.O.R.),並諮詢持牌金融專業人士。
OpenAI 重塑 ChatGPT 語音技術堆疊 推 GPT-Live 支援連續對話 | Yellow