OpenAI réduit de 25 % le coût de la transcription, mais laisse à ses rivaux la couronne de la précision

OpenAI réduit de 25 % le coût de la transcription, mais laisse à ses rivaux la couronne de la précision

OpenAI a lancé deux modèles de reconnaissance vocale, GPT Transcribe et GPT Live Transcribe, qui abaissent de 25 % le coût de transcription de fichiers audio et affichent un taux d’erreur de 3,31 % sur un benchmark d’exactitude indépendant.

Points clés :

  • GPT Transcribe affiche un taux d’erreur de mots (WER) de 3,31 % sur l’indice AA-WER, le plaçant au 9ᵉ rang des systèmes suivis.
  • La transcription de fichiers coûte désormais 0,0045 $ par minute, soit 25 % de moins que GPT-4o Transcribe, tandis que le streaming est facturé 0,017 $.
  • Les deux modèles acceptent du contexte écrit, des listes de mots-clés et des indications de langue pour améliorer la précision sur les audios difficiles.

Les modèles de transcription d’OpenAI arrivent sur l’API

La société a présenté les deux modèles sur sa plateforme développeurs le 28 juillet, avant de publier des fiches techniques dédiées, un guide de transcription entièrement réécrit et des exemples de code pour chaque endpoint pris en charge. GPT Transcribe cible les fichiers audio déjà enregistrés et les traitements en lots plus lourds. Il traite les enregistrements à environ 34 fois la vitesse réelle, un rythme suffisant pour la mise en archives mais encore loin des services de transcription les plus rapides du marché.

GPT Live Transcribe couvre l’autre versant, en renvoyant un flux de texte en temps quasi réel tant que l’interlocuteur parle. Les développeurs peuvent ajuster le compromis entre latence et stabilité du texte généré, et Microsoft a déjà intégré les deux versions dans sa propre plateforme Foundry.

Les deux modèles acceptent une description en texte brut de l’enregistrement, une liste de mots-clés incluant noms propres et terminologie spécialisée, ainsi que des indications sur les langues attendues. Ce contexte a permis de faire progresser la précision sémantique sur le benchmark interne d’OpenAI de 41,6 % à 45,2 %. Le modèle de transcription de fichiers est facturé 0,0045 $ par minute d’audio, soit un quart de moins que son prédécesseur, tandis que la version streaming coûte 0,017 $ par minute de session ouverte.

À lire aussi : Le volume sur DEX plonge de 26 % en juillet, la liquidité on-chain se contracte

Artificial Analysis classe GPT Transcribe au 9ᵉ rang

Artificial Analysis a mesuré GPT Transcribe à 3,31 % de taux d’erreur de mots sur son indice AA-WER, ce qui le place au 9ᵉ rang des quelque 50 systèmes actuellement suivis par le cabinet. C’est un gain de 0,7 point de pourcentage par rapport à GPT-4o Transcribe, même si le modèle reste en difficulté sur les contenus les plus complexes, avec un taux d’erreur de 6,10 % sur les conférences de résultats.

Sur 22 langues du corpus Common Voice, OpenAI affiche un taux d’erreur de 19,27 %, contre 40,37 % pour Whisper. Alibaba domine le classement de précision avec 1,8 %, devant ElevenLabs, Google et Mistral, dont les modèles se situent tous entre 2,2 % et 2,9 %. Un retour d’expérience sur ce lancement a toutefois prévenu que ces indices donnent une image flatteuse de l’ensemble du marché, le même modèle GPT-4o qui frôle 3 % sur des extraits propres s’effondrant dès que l’on passe à des audios de résultats d’entreprise plus chaotiques.

Les sorties audio d’OpenAI depuis Whisper

Ce lancement vient couronner une année chargée pour OpenAI dans l’audio. Publié en open source en 2022, Whisper s’est rapidement imposé comme la solution à bas coût pour la transcription de podcasts, de centres d’appels, de rédactions et de fonds d’archives dans le monde entier.

GPT-4o Transcribe a suivi en 2025 à 0,006 $ la minute, avec une version plus légère proposée à la moitié de ce tarif. En mai, la société a déployé GPT-Realtime-2, accompagné d’un modèle de traduction et de GPT-Realtime-Whisper, capable de gérer le streaming en direct au même prix de 0,017 $ que le nouveau modèle facture aujourd’hui.

Entre-temps, les concurrents ont poursuivi leurs propres baisses de prix, et Mistral démarre désormais sa grille tarifaire à 0,003 $.

À lire ensuite : L’« agent voyou » d’OpenAI a compromis 4 services de plus au-delà de Hugging Face

Avertissement et avertissement sur les risques : Les informations fournies dans cet article sont à des fins éducatives et informatives uniquement et sont basées sur l'opinion de l'auteur. Elles ne constituent pas des conseils financiers, d'investissement, juridiques ou fiscaux. Les actifs de cryptomonnaie sont très volatils et sujets à des risques élevés, y compris le risque de perdre tout ou une partie substantielle de votre investissement. Le trading ou la détention d'actifs crypto peut ne pas convenir à tous les investisseurs. Les opinions exprimées dans cet article sont uniquement celles de l'auteur/des auteurs et ne représentent pas la politique officielle ou la position de Yellow, de ses fondateurs ou de ses dirigeants. Effectuez toujours vos propres recherches approfondies (D.Y.O.R.) et consultez un professionnel financier agréé avant de prendre toute décision d'investissement.
Dernières nouvelles
Voir toutes les nouvelles
OpenAI réduit de 25 % le coût de la transcription, mais laisse à ses rivaux la couronne de la précision | Yellow