OpenAI 重建語音技術架構 讓 ChatGPT 聲音對話自然不中斷

ChatGPT Voice Can Now Listen While It Speaks After OpenAI Overhauls the Audio Stack
OpenAI Reduces Voice Session Startup From Six Network Round Trips to One With New Architecture (Image: AI)

重點摘要

OpenAI 大幅改造 ChatGPT 語音架構,讓音訊能連續傳輸、不再頻繁中斷。
全新 GPT-Live 系統支援「一邊說話一邊聽」的雙工對話。
語音對話啟動流程,從過去 6 次網路往返縮減為 1 次。
音訊走獨立快速通道,推理與工具呼叫改為非同步處理。
OpenAI 已公開重建過程的完整技術說明。

OpenAI 重新打造驅動 ChatGPT 的語音基礎架構,推出全新 GPT-Live 架構,讓音訊得以持續輸出, 深度推理與工具呼叫不再打斷對話流程。

OpenAI 在 8 月 3 日透過一系列 貼文 說明改版重點, 並在官方 部落格 詳細解構從用戶端到模型端的重建過程。 公司指出,新系統將語音對話啟動的網路往返次數,從 6 次大幅壓縮為 1 次。

GPT-Live 如何運作

GPT-Live 將音訊資料導入專屬的高速通道,與推理與工具呼叫等較重的運算流程切割開來。 這些深度處理改為非同步執行,也就是在背景完成,不會卡住前景的語音串流。

實際效果是語音對話啟動更快、維持連線更穩,過去當 ChatGPT 處理複雜指令時常出現的靜默空檔明顯減少。

OpenAI 在另一則 貼文 中表示,新架構特別處理「對話啟動的那一刻」, 讓使用者從第一句話開始就能感受到接近真人的自然互動。 此次重建正面解決了舊有架構的結構性限制——只要進入推理步驟,音訊層就被迫等待。

延伸閱讀Cosmos Hub 漲逾 6%,跨鏈敘事再起

GPT-Live 鎖定 ChatGPT 語音延遲痛點

OpenAI 近年在語音功能上大舉投入。年初以來,市場批評 ChatGPT 在多步驟問答時, 語音回應節奏生硬、反應偏慢。GPT-Live 的推出,可視為 OpenAI 針對此一缺口的直接工程解法。

此次發布銜接上月消息:OpenAI 透露,旗下下一代重要模型的內部版本, 僅以約 2,000 美元的權杖成本,就產出 10 項新的數學成果,對外釋出公司正對整體基礎設施大規模加碼投資的訊號。

下一篇Qwen 與 DeepSeek 推進中國 AI,直逼 Anthropic

Murtuza Merchant profile photo

Murtuza Merchant

Murtuza 是一位資深的財經記者,在加密貨幣與區塊鏈技術領域擁有豐富的報導經驗。他曾為 Benzinga 和 Cointelegraph 等多家媒體撰稿,聚焦新興趨勢、監管環境等相關主題。你可以在 Twitter 上透過 @murtuza_merc 找到他,在 Telegram 上則是 mmerchant001。 Disclosure: Murtuza 持有 ATOM、AKT、TIA、INJ 和 OSMO。

免責聲明與風險警告: 本文提供的資訊僅供教育與參考用途,並基於作者觀點,不構成財務、投資、法律或稅務建議。 加密貨幣資產具有高度波動性並伴隨高風險,包括可能損失全部或大部分投資金額。買賣或持有加密資產可能並不適合所有投資者。 本文中所表達的觀點僅代表作者立場,不代表 Yellow、其創辦人或管理層的官方政策或意見。 請務必自行進行充分研究(D.Y.O.R.),並在做出任何投資決策前諮詢持牌金融專業人士。
OpenAI 重建語音技術架構 讓 ChatGPT 聲音對話自然不中斷 | Yellow