OpenAI ha lanzado dos modelos de reconocimiento de voz, GPT Transcribe y GPT Live Transcribe, con los que rebaja en un 25% el coste de transcribir archivos de audio y logra un 3,31% de error en palabras en un índice independiente de precisión.
Claves:
- GPT Transcribe registra un 3,31% de tasa de error de palabra en el índice AA-WER, noveno puesto entre los sistemas analizados.
- La transcripción de archivos pasa a costar 0,0045 dólares por minuto, un 25% menos que GPT-4o Transcribe, mientras que el streaming cuesta 0,017 dólares.
- Ambos modelos aceptan contexto escrito, listas de palabras clave y pistas de idioma para mejorar la precisión en audios ruidosos.
Los modelos de transcripción de OpenAI llegan a la API
La compañía presentó ambos modelos en su plataforma para desarrolladores el 28 de julio, y acompañó el anuncio con fichas de producto, una guía de transcripción revisada y ejemplos de código para todos los endpoints compatibles. GPT Transcribe está orientado a archivos de audio ya finalizados y cargas por lotes de mayor tamaño. Procesa grabaciones a unas 34 veces la velocidad real, suficiente para archivos de archivo y grandes volúmenes, pero todavía lejos de los servicios de transcripción más rápidos del mercado.
GPT Live Transcribe cubre el otro extremo: devuelve texto en streaming sobre una conexión abierta mientras la persona sigue hablando. Los desarrolladores pueden ajustar el equilibrio entre latencia y estabilidad de la transcripción, y Microsoft ya ha incluido ambas versiones dentro de su plataforma Foundry.
Los dos modelos admiten una breve descripción en texto plano de la grabación, una lista de palabras clave con nombres propios y términos especializados, y pistas sobre los idiomas esperados. Ese contexto elevó la precisión semántica en el benchmark interno de OpenAI del 41,6% al 45,2%. El modelo para archivos tarifa 0,0045 dólares por minuto de audio, un 25% menos que su predecesor, mientras que la versión en streaming cuesta 0,017 dólares por cada minuto de sesión abierta.
También en cartera: El volumen en DEX cae un 26% en julio ante el enfriamiento de la liquidez on-chain
Artificial Analysis sitúa GPT Transcribe en novena posición
Artificial Analysis midió GPT Transcribe con una tasa de error de palabra del 3,31% en su índice AA-WER, lo que lo coloca en novena posición entre unos 50 sistemas que la firma sigue actualmente. Supone una mejora de 0,7 puntos porcentuales frente a GPT-4o Transcribe, aunque el modelo sigue sufriendo con el audio más complejo: marca un 6,10% de error en conferencias de resultados empresariales.
En 22 idiomas del corpus Common Voice, OpenAI obtuvo un 19,27% frente al 40,37% de Whisper. Alibaba lidera el ranking de precisión con un 1,8%, por delante de ElevenLabs, Google y Mistral, cuyos modelos se sitúan entre el 2,2% y el 2,9%. Un análisis del lanzamiento advirtió que estas métricas tienden a ser benevolentes con todos los sistemas, ya que el mismo GPT-4o que se movía en torno al 3% en clips limpios se desplomaba en calidad al enfrentarse a llamadas de resultados llenas de ruido y solapamientos.
El recorrido de OpenAI en audio desde Whisper
El lanzamiento culmina un año intenso para OpenAI en el terreno del audio. Whisper se publicó como modelo abierto en 2022 y se convirtió rápidamente en el estándar económico de facto para transcribir pódcast, centros de llamadas, redacciones y archivos de investigación en todo el mundo.
GPT-4o Transcribe llegó después, en 2025, a 0,006 dólares por minuto, con una versión más pequeña a la mitad de precio. En mayo la compañía lanzó GPT-Realtime-2 junto a un modelo de traducción y GPT-Realtime-Whisper, capaz de gestionar audio en directo al mismo precio de 0,017 dólares que cobra ahora el nuevo modelo.
Desde entonces los rivales han seguido recortando tarifas, y Mistral sitúa ya sus precios de entrada en 0,003 dólares.
Próxima lectura: El agente descontrolado de OpenAI vulneró otros 4 servicios además de Hugging Face





