OpenAI heeft twee nieuwe spraakherkenningsmodellen gelanceerd, GPT Transcribe en GPT Live Transcribe. De bestandsversie verlaagt de kosten voor transcripties met 25% en haalt een woordfoutpercentage van 3,31% in een onafhankelijk nauwkeurigheidsklassement.
Belangrijkste punten:
- GPT Transcribe noteert een word error rate van 3,31% op de AA-WER-index en staat daarmee negende op de ranglijst.
- Transcriptie van audiobestanden kost nu $0,0045 per minuut, 25% minder dan GPT-4o Transcribe; livestream-transcriptie kost $0,017 per minuut.
- Beide modellen gebruiken context, sleutelwoorden en taalhints om nauwkeurigheid op ruisrijke audio op te voeren.
OpenAI-transcriptiemodellen nu beschikbaar via API
Het bedrijf introduceerde beide modellen op 28 juli via het ontwikkelaarsplatform en publiceerde aansluitend modelpagina’s, een herziene transcriptiegids en voorbeeldcode voor alle ondersteunde endpoints. GPT Transcribe richt zich op afgeronde audiobestanden en zwaardere batchtaken. Het model verwerkt opnames met circa 34 keer de snelheid van real-time: snel genoeg voor archieven, maar duidelijk trager dan de snelste transcriptiediensten in de markt.
GPT Live Transcribe dekt de andere helft van de gebruikscases en stuurt tekst terug via een open verbinding terwijl iemand nog spreekt. Ontwikkelaars kunnen de balans tussen latency en stabiliteit van het transcript fijnregelen. Microsoft heeft beide varianten inmiddels opgenomen in zijn eigen Foundry-platform.
Beide modellen accepteren een korte beschrijving van de opname, een lijst met namen en vakspecifieke termen, plus aanwijzingen over welke talen een gebruiker verwacht. Die extra context verhoogde de semantische nauwkeurigheid op OpenAI’s eigen benchmark van 41,6% naar 45,2%. De bestandsvariant rekent $0,0045 per audiominuut af, een kwart goedkoper dan zijn voorganger, terwijl de streamingversie $0,017 per minuut voor een actieve sessie kost.
Lees ook: DEX-volume zakt 26% in juli nu on-chain liquiditeit opdroogt
Artificial Analysis zet GPT Transcribe op plek negen
Onderzoeksbureau Artificial Analysis mat voor GPT Transcribe een word error rate van 3,31% op zijn AA-WER-index, goed voor de negende plaats van circa vijftig geteste systemen. Dat is een verbetering van 0,7 procentpunt ten opzichte van GPT-4o Transcribe, maar het model blijft worstelen met complexere audio: op earnings calls kwam het uit op 6,10%.
Over 22 talen in de Common Voice-set noteerde OpenAI 19,27%, tegenover 40,37% voor Whisper. Alibaba voert de nauwkeurigheidsranglijst aan met 1,8%, gevolgd door ElevenLabs, Google en Mistral, die tussen 2,2% en 2,9% scoren. Een recensie van de lancering waarschuwde dat zulke indexcijfers alle systemen flatteren, omdat hetzelfde GPT-4o-model dat schone fragmenten rond 3% wist te houden, instortte op rommelige earnings-audio.
Audio-offensief van OpenAI sinds Whisper
De introductie vormt het voorlopig sluitstuk van een druk audiojaar voor OpenAI. Whisper verscheen in 2022 als open model en groeide razendsnel uit tot de goedkope standaard voor transcripties bij podcasts, callcenters, redacties en onderzoeksarchieven wereldwijd.
GPT-4o Transcribe volgde in 2025 met een tarief van $0,006 per minuut, met een kleinere variant tegen de helft van die prijs. In mei bracht het bedrijf GPT-Realtime-2 uit, samen met een vertaalmodel en GPT-Realtime-Whisper, dat live streaming afhandelde tegen hetzelfde tarief van $0,017 dat het nieuwe model nu hanteert.
Concurrenten bleven ondertussen de prijzen verlagen; Mistral hanteert inmiddels een instaptarief vanaf $0,003.
Lees verder: OpenAI’s rogue agent schond nog vier diensten naast Hugging Face





