OpenAI представила дві нові моделі розпізнавання мовлення — GPT Transcribe та GPT Live Transcribe, зменшивши вартість файлової транскрипції на 25% та досягнувши 3,31% похибки в незалежному тесті точності.
Головне:
- GPT Transcribe показала 3,31% помилки за словами в індексі AA-WER, посівши дев’яте місце серед відстежуваних систем.
- Тепер транскрипція файлів коштує $0,0045 за хвилину — на 25% дешевше за GPT-4o Transcribe, тоді як стримінг обходиться у $0,017.
- Обидві моделі приймають текстовий контекст, списки ключових слів і мовні підказки, що підвищує точність на зашумленому аудіо.
Моделі транскрипції OpenAI виходять в API
Компанія запустила обидві моделі у своєму середовищі для розробників 28 липня, а також опублікувала окремі сторінки моделей, оновлений гайд з транскрипції та приклади коду для всіх підтримуваних endpoint-ів. GPT Transcribe орієнтована на вже записані аудіофайли та масову офлайн-обробку. Вона опрацьовує записи приблизно у 34 рази швидше за реальний час — достатньо для архівів, але відчутно повільніше за найшвидші комерційні сервіси транскрипції.
GPT Live Transcribe закриває іншу частину задачі: вона віддає текст у режимі реального часу по відкритому з’єднанню, поки співрозмовник ще говорить. Розробники можуть налаштовувати баланс між затримкою та стабільністю фінального тексту, а Microsoft вже інтегрувала обидві версії у власну платформу Foundry.
Обидві моделі приймають короткий текстовий опис запису, список ключових слів (імена, спеціалізована термінологія) та підказки щодо мов, які очікує оператор. Такий контекст підвищив семантичну точність у внутрішньому бенчмарку OpenAI з 41,6% до 45,2%. Модель для файлів тарифікується за ставкою $0,0045 за хвилину аудіо — на чверть дешевше за попередника, тоді як стримінгова версія коштує $0,017 за кожну хвилину сесії в реальному часі.
Читайте також: Обсяги торгів на DEX впали на 26% у липні на тлі виснаження ліквідності ончейн
Artificial Analysis відносить GPT Transcribe на дев’яте місце
Artificial Analysis оцінювала GPT Transcribe за показником word error rate у 3,31% в індексі AA-WER, що дало моделі дев’яту позицію серед близько 50 систем, які компанія зараз відстежує. Це поліпшення приблизно на 0,7 відсоткового пункту порівняно з GPT-4o Transcribe, однак модель як і раніше «просідає» на складнішому контенті, показавши 6,10% помилки на розшифровці телемостів щодо фінрезультатів.
На масиві Common Voice у 22 мовах OpenAI зафіксувала 19,27% помилки проти 40,37% у Whisper. Лідером за точністю залишається Alibaba з 1,8%, далі йдуть ElevenLabs, Google та Mistral із діапазоном від 2,2% до 2,9%. Один з оглядів запуску застеріг, що показники індексів надто «ласкаві» до всіх систем: той самий GPT-4o, який показував близько 3% помилки на чистих фрагментах, значно погіршувався на «шумних» аудіо з корпоративних звітів.
Аудіопродукти OpenAI після Whisper
Запуск нових моделей підсумовує насичений аудіорік для OpenAI. Whisper вийшла як відкрита модель ще у 2022-му й швидко стала «дешевим стандартом» транскрипції для подкастів, кол-центрів, редакцій і дослідницьких архівів по всьому світу.
GPT-4o Transcribe з’явилася у 2025 році за ціною $0,006 за хвилину, а менша версія — за половину цієї ставки. У травні компанія випустила GPT-Realtime-2 разом із новою моделлю перекладу та GPT-Realtime-Whisper, яка забезпечувала живий стримінг за тією ж ставкою $0,017, яку сьогодні має й новий продукт.
Конкуренти тим часом продовжують знижувати ціни, і Mistral зараз стартує з тарифом від $0,003 за хвилину.
Далі по темі: «Бунтівний агент» OpenAI скомпрометував ще 4 сервіси, крім Hugging Face





