OpenAI, GPT Transcribe ve GPT Live Transcribe adlı iki yeni konuşma tanıma modelini geliştiricilere açtı. Şirket, dosya deşifre maliyetlerini %25 indirirken, bağımsız bir doğruluk endeksinde %3,31 kelime hata oranı elde etti.
Öne çıkanlar:
- GPT Transcribe, AA-WER endeksinde %3,31 kelime hata oranıyla izlenen sistemler arasında dokuzuncu sıraya yerleşti.
- Dosya deşifresi dakikada 0,0045 dolar; bu, GPT-4o Transcribe’a göre %25 indirim anlamına gelirken, canlı akış dakikada 0,017 dolara fiyatlandı.
- Her iki model de gürültülü kayıtlarda doğruluğu artırmak için yazılı bağlam, anahtar kelime listeleri ve dil ipuçlarını kullanabiliyor.
OpenAI’nin yeni deşifre modelleri API’de yayında
Şirket, her iki modeli de 28 Temmuz’da geliştirici platformu üzerinden duyurdu; ardından model sayfalarını, güncellenmiş bir deşifre rehberini ve tüm uç noktalar için örnek kodları yayımladı. GPT Transcribe, tamamlanmış ses dosyalarına ve daha ağır parti işlerine odaklanıyor. Kayıtları gerçek zamanın yaklaşık 34 katı hızda işleyebiliyor; bu, arşiv ve büyük hacimli işler için yeterli olmakla birlikte, piyasadaki en hızlı deşifre hizmetlerinin hâlâ gerisinde.
GPT Live Transcribe ise işin canlı tarafını üstleniyor; konuşma devam ederken açık bir bağlantı üzerinden anlık metin akışı sağlıyor. Geliştiriciler, gecikme ile metnin “oturmuşluğu” arasındaki dengeyi ayarlayabiliyor. Microsoft, her iki sürümü de kendi Foundry platformuna şimdiden ekledi.
Her iki model de kayıt için düz metinle bir açıklama, özel isim ve teknik terimleri içeren bir anahtar kelime listesi ve beklenen dillere dair ipuçları alabiliyor. Bu tür bağlam kullanımı, OpenAI’nin kendi testlerinde anlamsal doğruluğu %41,6’dan %45,2’ye taşıdı. Dosya modeli, sesi dakikada 0,0045 dolardan faturalandırırken, bu rakam selefine göre dörtte bir indirim anlamına geliyor; canlı akış sürümü ise açık oturumun her dakikası için 0,017 dolar.
Ayrıca bkz.: DEX hacmi, zincir üstü likiditenin çekilmesiyle Temmuz’da %26 geriledi
Artificial Analysis, GPT Transcribe’i dokuzuncu sıraya yerleştirdi
Artificial Analysis, GPT Transcribe’in kelime hata oranını AA-WER endeksinde %3,31 olarak ölçerek, modeli şu anda takip ettiği yaklaşık 50 sistem içinde dokuzuncu sıraya yerleştirdi. Bu, GPT-4o Transcribe’a kıyasla 0,7 puanlık bir iyileşmeye işaret ediyor; ancak model zorlu içeriklerde zorlanmaya devam ediyor ve özellikle bilanço sunumlarında hata oranı %6,10’a çıkıyor.
Common Voice üzerinde test edilen 22 dilde OpenAI, %19,27 seviyesinde kalırken, Whisper %40,37 ile belirgin şekilde önde görünüyor. Doğruluk sıralamasında zirvede %1,8 ile Alibaba yer alıyor; onu %2,2 ile %2,9 aralığında konumlanan ElevenLabs, Google ve Mistral izliyor. Lansmana yönelik bir inceleme, uyarıda bulundu: endeks değerlerinin tüm sistemleri olduğundan iyi gösterdiğini, zira temiz kliplerde %3 civarına inebilen aynı GPT-4o modelinin, dağınık bilanço kayıtlarında belirgin biçimde dağıldığını belirtti.
Whisper sonrası OpenAI’nin ses atağı
Bu lansman, OpenAI için ses tarafında yoğun geçen bir dönemi taçlandırıyor. 2022’de açık model olarak yayımlanan Whisper, kısa sürede dünya çapında podcast’lerden çağrı merkezlerine, haber odalarından araştırma arşivlerine kadar deşifre için ucuz bir “varsayılan” çözüm haline geldi.
GPT-4o Transcribe, 2025’te dakikada 0,006 dolar fiyatla piyasaya çıktı; daha küçük bir sürümü ise bunun yarı fiyatına sunuldu. Şirket, Mayıs ayında bir çeviri modeli ve GPT-Realtime-Whisper ile birlikte GPT-Realtime-2’yi de piyasaya sürdü; bu canlı akış çözümü, bugün yeni modelle aynı olan dakikada 0,017 dolardan fiyatlandırılıyordu.
Rakipler ise aralıksız fiyat kesmeye devam etti ve Mistral şu anda kendi giriş seviyesini dakikada 0,003 dolardan başlatıyor.
Sıradaki haber: OpenAI'nin başına buyruk ajanı, Hugging Face’in ötesinde 4 hizmeti daha ihlal etti





