OpenAI представила два новых сервиса распознавания речи — GPT Transcribe и GPT Live Transcribe. Компания снизила стоимость файловой транскрибации на 25%, при этом модель показала 3,31% ошибок в независимом рейтинге точности.
Главное:
- GPT Transcribe показала 3,31% доли ошибок по индексу AA-WER и заняла девятое место среди протестированных систем.
- Стоимость файловой транскрибации теперь составляет $0,0045 за минуту, что на 25% дешевле GPT-4o Transcribe; потоковая — $0,017 за минуту.
- Обе модели используют текстовый контекст, списки ключевых слов и языковые подсказки для повышения точности на шумных записях.
Модели OpenAI для транскрибации вышли в API
Компания представила обе модели в интерфейсе для разработчиков 28 июля, одновременно опубликовав отдельные карточки моделей, обновлённое руководство по транскрибации и примеры кода для всех поддерживаемых эндпоинтов. GPT Transcribe ориентирована на уже записанные аудиофайлы и крупные пакетные задания. По скорости она обрабатывает записи примерно в 34 раза быстрее реального времени — достаточно для архивов и бэкафиса, но заметно медленнее самых быстрых решений на рынке.
GPT Live Transcribe закрывает «онлайновую» часть задачи, возвращая расшифровку по открытом соединению, пока собеседник ещё говорит. Разработчики могут настраивать компромисс между задержкой и стабильностью текста, а Microsoft уже добавила обе версии в собственную платформу Foundry.
Оба сервиса принимают текстовое описание записи, список ключевых слов (имена, термины, бренды) и подсказки по ожидаемым языкам. Такой контекст, по данным OpenAI, повысил «семантическую» точность на внутреннем бенчмарке с 41,6% до 45,2%. Модель для файлов тарифицируется по ставке $0,0045 за минуту аудио — на четверть дешевле предыдущей версии, а потоковый режим стоит $0,017 за каждую минуту активной сессии.
Также по теме: Объёмы DEX упали на 26% в июле на фоне снижения ончейн‑ликвидности
Artificial Analysis ставит GPT Transcribe на девятое место
Исследовательская компания Artificial Analysis оценивала GPT Transcribe по индексу AA-WER и зафиксировала 3,31% ошибочных слов — девятый результат примерно из 50 отслеживаемых систем. Это улучшение на 0,7 п.п. по сравнению с GPT-4o Transcribe, однако на сложном материале модель по‑прежнему «проседает»: на аудио созвонов по отчётности ошибка достигла 6,10%.
На датасете Common Voice в 22 языках OpenAI показала 19,27% ошибок против 40,37% у Whisper. Лидером рейтинга точности остаётся Alibaba с показателем 1,8%, за ней идут ElevenLabs, Google и Mistral с результатами в диапазоне от 2,2% до 2,9%. Один из обзоров релиза предупреждает, что цифры индекса переоценивают все системы: тот же GPT‑4o, показавший около 3% на «чистом» аудио, серьёзно провалился на шумных звонках по отчётности.
Что OpenAI выпустила в аудио после Whisper
Новый релиз завершает насыщенный период для OpenAI в сегменте звука. Whisper вышел как открытая модель в 2022 году и быстро стал дешёвым стандартом транскрибации для подкастов, колл‑центров, редакций и исследовательских архивов.
В 2025 году появилась GPT-4o Transcribe по цене $0,006 за минуту, а затем — облегченное издание вдвое дешевле. В мае компания выпустила GPT‑Realtime‑2, а также модель для перевода и GPT‑Realtime‑Whisper, которая обслуживала живые потоки по той же ставке $0,017 за минуту, что и нынешний GPT Live Transcribe.
Конкуренты тем временем продолжили снижать цены: у Mistral стартовая ставка сейчас начинается с $0,003 за минуту.
Читайте далее: «Заблудившийся» агент OpenAI скомпрометировал ещё четыре сервиса помимо Hugging Face





