OpenAI 將轉錄收費下調 25%,準確度仍落後主要競爭對手

OpenAI 將轉錄收費下調 25%,準確度仍落後主要競爭對手

OpenAI 推出兩款全新語音識別模型 GPT Transcribe 與 GPT Live Transcribe,將音頻檔轉錄成本下調 25%,並在獨立測試中錄得 3.31% 錯詞率。

重點摘要:

  • GPT Transcribe 在 AA-WER 指數錄得 3.31% 錯詞率,在跟蹤約 50 套系統中排第九。
  • 檔案轉錄收費降至每分鐘 0.0045 美元,比 GPT-4o Transcribe 便宜 25%;串流轉錄為每分鐘 0.017 美元。
  • 兩款模型均支援文字背景描述、關鍵字清單及語言提示,可提升嘈吵錄音情境下的準確度。

兩款轉錄模型正式登陸 API

OpenAI 於 7 月 28 日透過開發者平台推出兩款模型,並同步上載模型說明頁、重寫轉錄教學,以及為各種端點提供示例程式碼。GPT Transcribe 主要處理已完成的音頻檔及大批量工作,處理速度約為實時的 34 倍,足以應付存檔及後期處理,但與市面上最快的專業轉錄服務相比仍有距離。

GPT Live Transcribe 則負責「邊講邊寫」的串流場景,在通話進行期間經開放連線即時輸出文字。開發者可調校模型在延遲與文本穩定度之間的取捨。Microsoft 已在自家 Foundry 平台內加入兩個版本,方便企業整合。

兩款模型皆支援輸入一段文字描述錄音內容、專有名詞及術語的關鍵字清單,以及預期語言提示。OpenAI 指出,在自家測試基準下,加入上述語境資訊後,語義準確度由 41.6% 提升至 45.2%。檔案轉錄按音頻每分鐘收費 0.0045 美元,比前代便宜四分之一;串流版本則按開啟連線時間,每分鐘收取 0.017 美元。

延伸閱讀:去中心化交易所 7 月成交量暴跌 26%,鏈上流動性持續收縮

人工分析評分:GPT Transcribe 排第九

機構 Artificial Analysis 在其 AA-WER 指數上測試 GPT Transcribe,錄得 3.31% 錯詞率,在其目前跟蹤的約 50 套系統中排名第九,較 GPT-4o Transcribe 進步 0.7 個百分點。不過在較難的財報電話會議錄音上,該模型錯詞率仍高達 6.10%。

在 Common Voice 數據集中涵蓋的 22 種語言中,OpenAI 模型整體錯詞率為 19.27%,遠高於 Whisper 的 40.37% 成績(數值愈低愈好)。阿里巴巴 目前在準確度榜首,錯詞率約 1.8%,其後為 ElevenLabsGoogleMistral,分別介乎 2.2% 至 2.9%。有評論在評測指出,這類指數往往美化各家表現:同一套 GPT-4o 模型在乾淨錄音中錯詞率接近 3%,但在雜訊嚴重的財報音頻上表現顯著走樣。

Whisper 之後:OpenAI 音頻產品線加速

是次發佈為 OpenAI 近年音頻產品密集更新再添一筆。早在 2022 年,開源模型 Whisper 面世,迅速成為全球 Podcast、客服中心、新聞機構及研究機構的低成本轉錄「標配」。

其後 OpenAI 在 2025 年推出 GPT-4o Transcribe,定價每分鐘 0.006 美元,並提供收費減半的精簡版本。今年 5 月,OpenAI 又發佈 GPT-Realtime-2,配合一款翻譯模型及 GPT-Realtime-Whisper,支援即時串流轉錄,收費與今次新串流模型同樣為每分鐘 0.017 美元。

不過競爭對手其後持續「減價戰」,Mistral 目前的入門收費已壓低至每分鐘 0.003 美元,令 OpenAI 在價格與準確度兩方面都面臨更大壓力。

下一篇:OpenAI「流氓代理」入侵範圍擴大,再曝四項服務受影響

免責聲明及風險提示: 本文資訊僅供教育與參考之用,並基於作者意見,並不構成金融、投資、法律或稅務建議。 加密貨幣資產具高度波動性並伴隨高風險,可能導致投資大幅虧損或全部損失,並非適合所有投資者。 文章內容僅代表作者觀點,不代表 Yellow、創辦人或管理層立場。 投資前請務必自行徹底研究(D.Y.O.R.),並諮詢持牌金融專業人士。
OpenAI 將轉錄收費下調 25%,準確度仍落後主要競爭對手 | Yellow