OpenAI 重建語音技術架構 讓 ChatGPT 聲音對話自然不中斷

Vacant ethics leadership at OpenAI follows the July departure of Chloé Bakalar, whom the company has not replaced. (Image: Shutterstock)
Vacant ethics leadership at OpenAI follows the July departure of Chloé Bakalar, whom the company has not replaced. (Image: Shutterstock)

重點摘要

OpenAI 大幅改造 ChatGPT 語音架構,讓音訊能連續傳輸、不再頻繁中斷。
全新 GPT-Live 系統支援「一邊說話一邊聽」的雙工對話。
語音對話啟動流程,從過去 6 次網路往返縮減為 1 次。
音訊走獨立快速通道,推理與工具呼叫改為非同步處理。
OpenAI 已公開重建過程的完整技術說明。

OpenAI 重新打造驅動 ChatGPT 的語音基礎架構,推出全新 GPT-Live 架構,讓音訊得以持續輸出, 深度推理與工具呼叫不再打斷對話流程。

OpenAI 在 8 月 3 日透過一系列 貼文 說明改版重點, 並在官方 部落格 詳細解構從用戶端到模型端的重建過程。 公司指出,新系統將語音對話啟動的網路往返次數,從 6 次大幅壓縮為 1 次。

GPT-Live 如何運作

GPT-Live 將音訊資料導入專屬的高速通道,與推理與工具呼叫等較重的運算流程切割開來。 這些深度處理改為非同步執行,也就是在背景完成,不會卡住前景的語音串流。

實際效果是語音對話啟動更快、維持連線更穩,過去當 ChatGPT 處理複雜指令時常出現的靜默空檔明顯減少。

OpenAI 在另一則 貼文 中表示,新架構特別處理「對話啟動的那一刻」, 讓使用者從第一句話開始就能感受到接近真人的自然互動。 此次重建正面解決了舊有架構的結構性限制——只要進入推理步驟,音訊層就被迫等待。

延伸閱讀Cosmos Hub 漲逾 6%,跨鏈敘事再起

GPT-Live 鎖定 ChatGPT 語音延遲痛點

OpenAI 近年在語音功能上大舉投入。年初以來,市場批評 ChatGPT 在多步驟問答時, 語音回應節奏生硬、反應偏慢。GPT-Live 的推出,可視為 OpenAI 針對此一缺口的直接工程解法。

此次發布銜接上月消息:OpenAI 透露,旗下下一代重要模型的內部版本, 僅以約 2,000 美元的權杖成本,就產出 10 項新的數學成果,對外釋出公司正對整體基礎設施大規模加碼投資的訊號。

下一篇Qwen 與 DeepSeek 推進中國 AI,直逼 Anthropic

Murtuza Merchant profile photo

Murtuza Merchant

Murtuza 是一位資深的財經記者,在加密貨幣與區塊鏈技術領域擁有豐富的報導經驗。他曾為 Benzinga 和 Cointelegraph 等多家媒體撰稿,聚焦新興趨勢、監管環境等相關主題。你可以在 Twitter 上透過 @murtuza_merc 找到他,在 Telegram 上則是 mmerchant001。 Disclosure: Murtuza 持有 ATOM、AKT、TIA、INJ 和 OSMO。

免責聲明與風險警告: 本文提供的資訊僅供教育與參考用途,並基於作者觀點,不構成財務、投資、法律或稅務建議。 加密貨幣資產具有高度波動性並伴隨高風險,包括可能損失全部或大部分投資金額。買賣或持有加密資產可能並不適合所有投資者。 本文中所表達的觀點僅代表作者立場,不代表 Yellow、其創辦人或管理層的官方政策或意見。 請務必自行進行充分研究(D.Y.O.R.),並在做出任何投資決策前諮詢持牌金融專業人士。
OpenAI 重建語音技術架構 讓 ChatGPT 聲音對話自然不中斷 | Yellow