OpenAI lançou dois modelos de reconhecimento de voz, GPT Transcribe e GPT Live Transcribe, reduzindo em 25% o custo de transcrição de arquivos e alcançando 3,31% em um índice independente de erro de palavras.
Principais destaques:
- O GPT Transcribe registrou taxa de erro de palavras de 3,31% no índice AA-WER, ocupando o nono lugar entre os sistemas avaliados.
- A transcrição de arquivos passa a custar US$ 0,0045 por minuto, 25% abaixo do GPT-4o Transcribe, enquanto o streaming sai por US$ 0,017.
- Ambos aceitam contexto em texto, listas de palavras-chave e indicação de idiomas para melhorar a precisão em áudios ruidosos.
Modelos de transcrição da OpenAI chegam à API
A empresa apresentou os dois modelos em sua plataforma para desenvolvedores em 28 de julho, acompanhados de páginas dedicadas, um guia de transcrição reformulado e exemplos de código para todos os endpoints compatíveis. O GPT Transcribe é voltado para arquivos de áudio concluídos e workloads em lote mais pesados. Ele processa gravações a cerca de 34 vezes o tempo real — velocidade adequada para arquivos de acervo, mas ainda distante dos serviços de transcrição mais rápidos do mercado.
O GPT Live Transcribe cobre o outro lado da demanda, devolvendo texto em streaming por uma conexão aberta enquanto o interlocutor ainda está falando. Desenvolvedores podem calibrar o quanto o modelo prioriza baixa latência ou estabilidade do texto, e a Microsoft já incluiu as duas versões dentro de sua própria plataforma Foundry.
Ambos os modelos aceitam uma descrição em texto simples da gravação, uma lista de palavras-chave com nomes próprios e termos técnicos, além de pistas sobre quais idiomas são esperados pelo operador. Esse contexto elevou a acurácia semântica no benchmark interno da OpenAI de 41,6% para 45,2%. O modelo para arquivos cobra US$ 0,0045 por minuto de áudio, cerca de um quarto abaixo do seu antecessor, enquanto a modalidade de streaming custa US$ 0,017 por minuto de sessão ativa.
Veja também: Volume em DEX despenca 26% em julho com enxugamento da liquidez on-chain
Artificial Analysis coloca GPT Transcribe em nono lugar
A Artificial Analysis mediu o GPT Transcribe com taxa de erro de palavras de 3,31% em seu índice AA-WER, o que coloca o modelo na nona posição entre cerca de 50 sistemas acompanhados pela consultoria. O resultado representa uma melhora de 0,7 ponto percentual em relação ao GPT-4o Transcribe, embora o modelo ainda tenha tido dificuldade em conteúdos mais complexos, atingindo 6,10% em teleconferências de resultados.
Em 22 idiomas avaliados no Common Voice, a OpenAI registrou 19,27% de erro, contra 40,37% do Whisper. A Alibaba lidera o ranking de precisão com 1,8%, à frente de ElevenLabs, Google e Mistral, cujos modelos ficam entre 2,2% e 2,9%. Uma análise do lançamento alertou que os números de benchmark podem ser generosos com todos os sistemas, já que o mesmo GPT-4o que ficou perto de 3% em clipes limpos teve desempenho bem pior em áudios bagunçados de calls de resultados.
O caminho da OpenAI em áudio desde o Whisper
O lançamento coroa um ano intenso para a OpenAI em soluções de áudio. O Whisper chegou como modelo aberto em 2022 e rapidamente virou padrão de baixo custo para transcrição em podcasts, centrais de atendimento, redações e acervos de pesquisa ao redor do mundo.
O GPT-4o Transcribe veio em 2025, custando US$ 0,006 por minuto, com uma versão menor pela metade do preço. Em maio, a companhia lançou o GPT-Realtime-2 ao lado de um modelo de tradução e do GPT-Realtime-Whisper, que fazia streaming ao vivo exatamente pelos mesmos US$ 0,017 cobrados hoje pelo novo modelo.
A concorrência, porém, continuou reduzindo preços, e a Mistral agora parte de US$ 0,003 em sua tabela.
Na sequência: “Agente rebelde” da OpenAI invadiu mais 4 serviços além do Hugging Face





