OpenAI 推出两款语音识别模型 GPT Transcribe 与 GPT Live Transcribe,将音频文件转写成本再降25%,并在独立基准测试中录得3.31%的词错误率(WER)。
要点速览:
- GPT Transcribe 在 AA-WER 指数上录得 3.31% 词错误率,在受测系统中位列第 9。
- 文件转写费用降至每分钟 0.0045 美元,比 GPT-4o Transcribe 低 25%,流式转写为每分钟 0.017 美元。
- 两款模型均支持上下文提示、关键词列表和多语言提示,以提升嘈杂场景下的识别表现。
转写新模型登陆 OpenAI 开发者平台
OpenAI 已通过开发者平台上线这两款新模型,并同步发布模型介绍页、全新转写指南以及覆盖各接口的代码示例。GPT Transcribe 主要面向已录制完毕的音频文件及大规模批处理场景,处理速度约为“实时时长的 34 倍”,对于播客、档案这类离线内容已足够,但与市场上最快的商用转写服务仍有明显差距。
GPT Live Transcribe 则负责“在线半场”,在讲话尚未结束时就通过持续连接回传文本。开发者可以在延迟与结果稳定性之间调节参数。微软已经在其 Foundry 平台中集成了这两款模型。
两个模型均支持为录音提供简要文字描述、专有名词与术语关键词列表,以及预期语种提示。根据 OpenAI 内部基准测试,引入这些上下文后,语义准确率从 41.6% 提升至 45.2%。文件转写模型的费率为每分钟 0.0045 美元,比前代产品低约四分之一;流式转写按会话开放时间计费,每分钟 0.017 美元,定价与此前实时产品持平。
延伸阅读:去中心化交易所7月交易量下滑26%,链上流动性持续走弱
人工分析机构将 GPT Transcribe 排在第九
独立评测机构 Artificial Analysis 在其 AA-WER 基准上测得 GPT Transcribe 的词错误率为 3.31%,在当前追踪的约 50 套系统中位列第 9。相较 GPT-4o Transcribe,误差率收窄约 0.7 个百分点,但在更困难的财报电话会议场景中仍显吃力,WER 高达 6.10%。
在 Common Voice 涵盖的 22 种语言上,OpenAI 模型整体错误率为 19.27%,而 Whisper 为 40.37%。榜单首位由 阿里巴巴 占据,其模型 WER 仅 1.8%,ElevenLabs、Google 与 Mistral 分列其后,对应区间在 2.2% 至 2.9% 之间。有评测文章提醒,指数成绩普遍“偏乐观”:同一款 GPT-4o 模型在干净音频上可接近 3% 的误差率,但一旦遇到嘈杂的财报音频,表现就“显著崩塌”。
Whisper 之后的 OpenAI 音频布局
此次发布为 OpenAI 在音频领域忙碌一年的最新落子。早在 2022 年,开放模型 Whisper 上线后,便迅速成为播客、呼叫中心、新闻编辑部以及学术档案馆等场景的“低价默认”转写工具。
2025 年,GPT-4o Transcribe 推出,定价为每分钟 0.006 美元,并配套一款价格腰斩的小型号。今年 5 月,公司又推出 GPT-Realtime-2,以及一款翻译模型和负责实时流式音频的 GPT-Realtime-Whisper,实时转写价格同样为每分钟 0.017 美元,与本次新发布的流式模型保持一致。
不过,竞争对手仍在持续“以价换量”。Mistral 最新一轮降价后,语音转写起步价已降至每分钟 0.003 美元,进一步压低行业价格中枢。





