OpenAI 推出兩款語音辨識新模型 GPT Transcribe 與 GPT Live Transcribe,將檔案轉錄費率再砍 25%,並在獨立準確度測試中錄得 3.31% 字詞錯誤率。
重點整理:
- GPT Transcribe 在 AA-WER 指標上的字詞錯誤率為 3.31%,在受追蹤系統中排名第九。
- 檔案轉錄費率調降為每分鐘 0.0045 美元,較 GPT-4o Transcribe 低 25%,即時串流則為每分鐘 0.017 美元。
- 兩款模型皆支援文字背景敘述、關鍵字清單與語言提示,可在噪音環境下提升準確度。
OpenAI 語音轉文字正式登上 API
OpenAI 於 7 月 28 日透過開發者平台推出兩款模型,同步上線模型說明頁、重寫後的轉錄教學文件,以及涵蓋各 API 端點的程式碼範例。GPT Transcribe 主打處理已完成的音訊檔與大量批次任務,轉錄速度約為實際長度的 34 倍,對於媒體或資料庫歸檔算是夠快,但仍明顯落後市場上最快速的專業轉錄服務。
GPT Live Transcribe 則負責另一端的即時場景,可在通話或會議進行中,透過長連線持續串流回文字結果。開發者可自行調整延遲與字幕穩定度之間的取捨。Microsoft 已在自家 Foundry 平台中上架這兩款模型供企業客戶試用。
兩者皆支援輸入錄音內容的簡要文字描述、專有名詞與關鍵字清單,以及預期語言的提示。根據 OpenAI 自行測試,加入這些背景資訊後,語意準確率從 41.6% 提升至 45.2%。檔案轉錄模型的計費為每分鐘音訊 0.0045 美元,較前代便宜約四分之一;即時串流版本則以每分鐘連線時間 0.017 美元計費。
延伸閱讀: DEX 7 月交易量暴跌 26%,鏈上流動性持續緊縮
Artificial Analysis:GPT Transcribe 準確度僅列第九
獨立研究機構 Artificial Analysis 在其 AA-WER 指標上測試 GPT Transcribe,錄得 3.31% 字詞錯誤率,在目前追蹤的約 50 套系統中排名第九。與 GPT-4o Transcribe 相比,錯誤率改善約 0.7 個百分點,但在難度較高的財報電話會議音檔上,錯誤率仍達 6.10%。
在 Common Voice 資料集中涵蓋的 22 種語言測試中,OpenAI 模型平均錯誤率為 19.27%,明顯落後 Whisper 的 40.37% 表現(數值為越低越好)。目前準確度排行榜由 Alibaba 以 1.8% 領先,其後依序是 ElevenLabs、Google 與 Mistral,多數模型集中在 2.2% 至 2.9% 區間。
有評論針對本次發佈提醒,指標數據可能「美化」了所有系統的實際表現:同一套 GPT-4o 模型在乾淨語音片段上可壓低至約 3% 錯誤率,但一旦面對雜訊較多的財報電話音檔就大幅失準。
Whisper 之後:OpenAI 的音訊產品路線
這次新產品為 OpenAI 忙碌的音訊年份畫下另一個里程碑。早在 2022 年,開源模型 Whisper 就已釋出,並迅速成為全球 Podcast、客服中心、新聞編輯室與研究機構的低價預設轉錄工具。
2025 年,OpenAI 推出 GPT-4o Transcribe,費率為每分鐘 0.006 美元,並同步提供半價的小型版本。今年 5 月,公司再發表 GPT-Realtime-2,搭配翻譯模型以及 GPT-Realtime-Whisper,支援即時串流轉錄,費率與本次新款同樣為每分鐘 0.017 美元。
然而競爭對手持續降價,目前 Mistral 的入門價已下探至每分鐘 0.003 美元,價格戰態勢明顯。





