OpenAI lançou dois modelos de reconhecimento de voz, GPT Transcribe e GPT Live Transcribe, reduzindo em 25% o custo de transcrição de ficheiros e alcançando 3,31% num benchmark independente de precisão.
Pontos‑chave:
- GPT Transcribe registou 3,31% de word error rate no índice AA-WER, ocupando a nona posição entre os sistemas avaliados.
- A transcrição de ficheiros passa a custar 0,0045 dólares por minuto, 25% abaixo do GPT-4o Transcribe, enquanto o streaming custa 0,017 dólares.
- Ambos os modelos aceitam contexto escrito, listas de palavras‑chave e pistas de idioma para melhorar a precisão em áudio ruidoso.
Modelos de transcrição da OpenAI chegam à API
A empresa apresentou os dois modelos na sua plataforma para programadores em 28 de julho, e em seguida publicou páginas detalhadas, um guia de transcrição reescrito e exemplos de código para todos os endpoints suportados. O GPT Transcribe é destinado a ficheiros de áudio já concluídos e a cargas de trabalho em batch mais pesadas. Processa gravações a cerca de 34 vezes o tempo real — velocidade adequada para arquivos e acervos, mas ainda distante dos serviços de transcrição mais rápidos do mercado.
Já o GPT Live Transcribe cobre o outro lado da equação, devolvendo texto em streaming através de uma ligação aberta enquanto o interlocutor ainda está a falar. Os developers podem afinar o equilíbrio entre latência e estabilidade do texto, e a Microsoft já incluiu ambas as versões na sua própria plataforma Foundry.
Ambos os modelos aceitam uma descrição em texto simples da gravação, uma lista de palavras‑chave com nomes próprios e termos técnicos, e indicações sobre quais idiomas são esperados. Esse contexto elevou a precisão semântica no benchmark interno da OpenAI de 41,6% para 45,2%. O modelo para ficheiros cobra 0,0045 dólares por minuto de áudio, cerca de um quarto abaixo do antecessor, enquanto a versão de streaming custa 0,017 dólares por cada minuto de sessão aberta.
Veja também: Volume em DEX cai 26% em julho com redução de liquidez on‑chain
Artificial Analysis coloca GPT Transcribe em nono lugar
A Artificial Analysis mediu o GPT Transcribe com uma taxa de erro de palavras de 3,31% no índice AA-WER, nono lugar entre cerca de 50 sistemas atualmente monitorizados pela consultora. O resultado representa uma melhoria de 0,7 pontos percentuais face ao GPT-4o Transcribe, embora o modelo continue a ter dificuldades em conteúdos mais exigentes, com 6,10% de erro em earnings calls.
Num conjunto de 22 idiomas no Common Voice, a OpenAI registou 19,27%, contra 40,37% do Whisper. A Alibaba lidera o ranking de precisão com 1,8%, à frente de ElevenLabs, Google e Mistral, cujos modelos se situam entre 2,2% e 2,9%. Uma análise ao lançamento alertou que os números do índice favorecem todos os sistemas, já que o mesmo GPT-4o que se manteve próximo de 3% em clipes limpos colapsou perante o áudio mais caótico de chamadas de resultados.
Evolução da oferta de áudio da OpenAI desde o Whisper
O lançamento coroa um ano intenso para a OpenAI na área de áudio. O Whisper chegou em 2022 como modelo aberto e rapidamente se tornou o padrão de baixo custo para transcrição em podcasts, call centers, redações e arquivos de pesquisa em todo o mundo.
O GPT-4o Transcribe veio em 2025, a 0,006 dólares por minuto, com uma versão mais pequena a metade do preço. Em maio, a empresa lançou o GPT-Realtime-2, a par de um modelo de tradução e do GPT-Realtime-Whisper, capaz de lidar com streaming em direto ao mesmo preço de 0,017 dólares que o novo modelo cobra hoje.
A concorrência, no entanto, continuou a cortar preços, e a Mistral já pratica tarifas a partir de 0,003 dólares.
Leia a seguir: Agente descontrolado da OpenAI comprometeu mais 4 serviços além do Hugging Face





