OpenAI wprowadził do oferty dwa nowe modele rozpoznawania mowy – GPT Transcribe i GPT Live Transcribe. Obniżył przy tym koszt transkrypcji plików audio o 25%, a nowy model osiągnął 3,31% błędu słownego w niezależnym teście dokładności.
Najważniejsze fakty:
- GPT Transcribe uzyskał 3,31% współczynnika błędu słownego (AA-WER), co daje mu 9. miejsce wśród monitorowanych systemów.
- Transkrypcja plików kosztuje teraz 0,0045 dol. za minutę – o 25% mniej niż w GPT-4o Transcribe. Transkrypcja strumieniowa to 0,017 dol. za minutę.
- Oba modele przyjmują kontekst tekstowy, listy słów kluczowych i wskazówki językowe, aby poprawiać jakość zapisu w trudnym, „zaszumionym” audio.
Modele transkrypcji OpenAI wchodzą do API
Spółka udostępniła oba modele 28 lipca na swojej platformie dla deweloperów. Równocześnie opublikowano karty modeli, przepracowany przewodnik po transkrypcji oraz przykładowy kod dla wszystkich obsługiwanych endpointów. GPT Transcribe obsługuje gotowe pliki audio i większe zlecenia wsadowe. Przetwarza nagrania około 34 razy szybciej niż czas rzeczywisty – wystarczająco szybko dla archiwów, ale wyraźnie wolniej niż najszybsze usługi transkrypcji dostępne na rynku.
GPT Live Transcribe odpowiada za drugą połowę zadania – przesyła tekst na bieżąco podczas trwającej rozmowy, w ramach otwartego połączenia. Programiści mogą regulować kompromis między opóźnieniem a stabilnością tekstu, a Microsoft już dodał oba warianty do własnej platformy Foundry.
Oba modele przyjmują opis nagrania w formie zwykłego tekstu, listę słów kluczowych (np. nazwisk, nazw marek czy specjalistycznej terminologii) oraz wskazania, jakich języków operator się spodziewa. Taki kontekst podniósł trafność semantyczną na wewnętrznym benchmarku OpenAI z 41,6% do 45,2%. Model plikowy jest wyceniony na 0,0045 dol. za minutę audio, czyli o jedną czwartą mniej niż poprzednik, a wersja strumieniowa kosztuje 0,017 dol. za minutę trwającej sesji.
Przeczytaj też: Wolumen DEX spada o 26% w lipcu wraz z kurczącą się płynnością on-chain
Artificial Analysis: GPT Transcribe dopiero dziewiąty
Firma Artificial Analysis zmierzyła dokładność GPT Transcribe, uzyskując 3,31% błędu słownego w indeksie AA-WER. Dało to modelowi dziewiąte miejsce wśród ok. 50 systemów obecnie monitorowanych przez spółkę. To poprawa o 0,7 pkt proc. względem GPT-4o Transcribe, jednak model nadal ma problemy z trudniejszym materiałem – na transkrypcji rozmów z wyników finansowych osiągnął 6,10% błędu.
W teście na 22 językach z wykorzystaniem zestawu Common Voice OpenAI zanotował 19,27% błędu wobec 40,37% w przypadku Whisper. Liderem zestawienia pozostaje Alibaba z wynikiem 1,8%, przed ElevenLabs, Google i Mistral, których modele mieszczą się w przedziale 2,2–2,9%. Jeden z przeglądów premiery zwracał uwagę, że indeksowe wyniki są z natury zbyt optymistyczne – ten sam GPT-4o, który na „czystym” materiale schodził w okolice 3% błędu, znacząco tracił jakość na chaotycznym audio z calli wynikowych.
Co OpenAI zrobił w audio od czasu Whisper
Debiut GPT Transcribe zamyka dla OpenAI intensywny okres w segmencie audio. Whisper pojawił się jako otwarty model w 2022 r., szybko stając się tanim standardem dla transkrypcji podcastów, call center, redakcji i archiwów badawczych na całym świecie.
GPT-4o Transcribe trafił na rynek w 2025 r. z ceną 0,006 dol. za minutę, a jego mniejsza wersja kosztowała połowę tej stawki. W maju spółka wypuściła GPT-Realtime-2, a wraz z nim model tłumaczeniowy i GPT-Realtime-Whisper, który obsługiwał transmisję na żywo w tej samej cenie 0,017 dol. za minutę, jaką dziś ma nowy model.
Konkurenci nie zwalniają – w ostatnich miesiącach również obniżali ceny, a Mistral startuje obecnie z opłatami już od 0,003 dol. za minutę.
Następny artykuł: Zbuntowany agent OpenAI naruszył bezpieczeństwo 4 kolejnych usług poza Hugging Face





