OpenAI 推出兩款全新語音識別模型 GPT Transcribe 與 GPT Live Transcribe,將音頻檔轉錄成本下調 25%,並在獨立測試中錄得 3.31% 錯詞率。
重點摘要:
- GPT Transcribe 在 AA-WER 指數錄得 3.31% 錯詞率,在跟蹤約 50 套系統中排第九。
- 檔案轉錄收費降至每分鐘 0.0045 美元,比 GPT-4o Transcribe 便宜 25%;串流轉錄為每分鐘 0.017 美元。
- 兩款模型均支援文字背景描述、關鍵字清單及語言提示,可提升嘈吵錄音情境下的準確度。
兩款轉錄模型正式登陸 API
OpenAI 於 7 月 28 日透過開發者平台推出兩款模型,並同步上載模型說明頁、重寫轉錄教學,以及為各種端點提供示例程式碼。GPT Transcribe 主要處理已完成的音頻檔及大批量工作,處理速度約為實時的 34 倍,足以應付存檔及後期處理,但與市面上最快的專業轉錄服務相比仍有距離。
GPT Live Transcribe 則負責「邊講邊寫」的串流場景,在通話進行期間經開放連線即時輸出文字。開發者可調校模型在延遲與文本穩定度之間的取捨。Microsoft 已在自家 Foundry 平台內加入兩個版本,方便企業整合。
兩款模型皆支援輸入一段文字描述錄音內容、專有名詞及術語的關鍵字清單,以及預期語言提示。OpenAI 指出,在自家測試基準下,加入上述語境資訊後,語義準確度由 41.6% 提升至 45.2%。檔案轉錄按音頻每分鐘收費 0.0045 美元,比前代便宜四分之一;串流版本則按開啟連線時間,每分鐘收取 0.017 美元。
延伸閱讀:去中心化交易所 7 月成交量暴跌 26%,鏈上流動性持續收縮
人工分析評分:GPT Transcribe 排第九
機構 Artificial Analysis 在其 AA-WER 指數上測試 GPT Transcribe,錄得 3.31% 錯詞率,在其目前跟蹤的約 50 套系統中排名第九,較 GPT-4o Transcribe 進步 0.7 個百分點。不過在較難的財報電話會議錄音上,該模型錯詞率仍高達 6.10%。
在 Common Voice 數據集中涵蓋的 22 種語言中,OpenAI 模型整體錯詞率為 19.27%,遠高於 Whisper 的 40.37% 成績(數值愈低愈好)。阿里巴巴 目前在準確度榜首,錯詞率約 1.8%,其後為 ElevenLabs、Google 與 Mistral,分別介乎 2.2% 至 2.9%。有評論在評測指出,這類指數往往美化各家表現:同一套 GPT-4o 模型在乾淨錄音中錯詞率接近 3%,但在雜訊嚴重的財報音頻上表現顯著走樣。
Whisper 之後:OpenAI 音頻產品線加速
是次發佈為 OpenAI 近年音頻產品密集更新再添一筆。早在 2022 年,開源模型 Whisper 面世,迅速成為全球 Podcast、客服中心、新聞機構及研究機構的低成本轉錄「標配」。
其後 OpenAI 在 2025 年推出 GPT-4o Transcribe,定價每分鐘 0.006 美元,並提供收費減半的精簡版本。今年 5 月,OpenAI 又發佈 GPT-Realtime-2,配合一款翻譯模型及 GPT-Realtime-Whisper,支援即時串流轉錄,收費與今次新串流模型同樣為每分鐘 0.017 美元。
不過競爭對手其後持續「減價戰」,Mistral 目前的入門收費已壓低至每分鐘 0.003 美元,令 OpenAI 在價格與準確度兩方面都面臨更大壓力。





