OpenAI taglia del 25% i costi di trascrizione, ma i rivali restano più accurati

OpenAI taglia del 25% i costi di trascrizione, ma i rivali restano più accurati

OpenAI ha lanciato due nuovi modelli di riconoscimento vocale, GPT Transcribe e GPT Live Transcribe, riducendo del 25% i costi di trascrizione file e ottenendo un tasso di errore del 3,31% in un benchmark indipendente.

Punti chiave:

  • GPT Transcribe ha registrato un word error rate del 3,31% sull’indice AA-WER, posizionandosi al nono posto tra i sistemi monitorati.
  • La trascrizione di file costa ora 0,0045 dollari al minuto, il 25% in meno rispetto a GPT-4o Transcribe, mentre lo streaming costa 0,017 dollari al minuto.
  • Entrambi i modelli accettano contesto testuale, liste di keyword e indicazioni di lingua per migliorare l’accuratezza su audio rumorosi.

I modelli di trascrizione OpenAI arrivano sulla API

L’azienda ha presentato i due modelli sulla propria piattaforma per sviluppatori il 28 luglio, pubblicando contestualmente le pagine dei modelli, una guida alla trascrizione completamente rivista e snippet di codice per tutti gli endpoint supportati. GPT Transcribe è pensato per file audio già registrati e carichi di lavoro in batch più pesanti. Elabora le registrazioni a una velocità circa 34 volte superiore al tempo reale: più che sufficiente per archivi e cataloghi, ma ancora lontano dalle performance dei servizi di trascrizione più rapidi sul mercato.

GPT Live Transcribe copre invece l’altra metà del flusso: restituisce testo in streaming su una connessione aperta mentre l’interlocutore sta ancora parlando. Gli sviluppatori possono regolare quanto il modello privilegi la bassa latenza rispetto alla stabilità del testo prodotto, e Microsoft ha già integrato entrambe le versioni all’interno della propria piattaforma Foundry.

I due modelli accettano una descrizione testuale della registrazione, una lista di parole chiave con nomi propri e termini specialistici, oltre a indicazioni sulle lingue attese dall’operatore. Questo contesto ha incrementato l’accuratezza semantica nei benchmark interni di OpenAI dal 41,6% al 45,2%. Il modello per file fattura 0,0045 dollari al minuto di audio, circa un quarto in meno rispetto al suo predecessore, mentre la versione in streaming costa 0,017 dollari per ogni minuto di sessione aperta.

Da leggere anche: I volumi DEX crollano del 26% a luglio mentre la liquidità on-chain si assottiglia

Artificial Analysis colloca GPT Transcribe al nono posto

Artificial Analysis ha valutato GPT Transcribe con un word error rate del 3,31% sul suo indice AA-WER, collocandolo al nono posto tra una cinquantina di sistemi monitorati. Si tratta di un miglioramento di 0,7 punti percentuali rispetto a GPT-4o Transcribe, ma il modello continua a faticare sui contenuti più complessi, con un tasso di errore del 6,10% sulle conference call sui risultati trimestrali.

Su 22 lingue del dataset Common Voice, OpenAI ha registrato un errore medio del 19,27% contro il 40,37% di Whisper. Alibaba guida oggi la classifica di accuratezza con l’1,8%, davanti a ElevenLabs, Google e Mistral, i cui modelli si collocano tra il 2,2% e il 2,9%. Una recensione del lancio ha avvertito che questi indici tendono a restituire un quadro troppo benevolo per tutti i sistemi, visto che lo stesso GPT-4o che si attestava intorno al 3% su clip pulite andava in crisi su audio disordinati come le call sugli utili.

L’evoluzione dell’audio OpenAI dopo Whisper

Il debutto dei nuovi modelli chiude un anno intenso per OpenAI nel segmento audio. Whisper, rilasciato come modello open source nel 2022, è rapidamente diventato lo standard low-cost per la trascrizione di podcast, call center, redazioni giornalistiche e archivi di ricerca a livello globale.

GPT-4o Transcribe è arrivato nel 2025 a 0,006 dollari al minuto, con una variante più piccola a metà prezzo. A maggio la società ha rilasciato GPT-Realtime-2 insieme a un modello di traduzione e a GPT-Realtime-Whisper, in grado di gestire lo streaming live allo stesso prezzo di 0,017 dollari al minuto applicato oggi dal nuovo modello.

Nel frattempo la concorrenza ha proseguito la corsa al ribasso sui listini, e Mistral oggi parte da 0,003 dollari al minuto.

Prossimo articolo: L’agente “canaglia” di OpenAI ha violato altri 4 servizi oltre a Hugging Face

Disclaimer e avvertenza sui rischi: Le informazioni fornite in questo articolo sono solo per scopi educativi e informativi e sono basate sull'opinione dell'autore. Non costituiscono consulenza finanziaria, di investimento, legale o fiscale. Gli asset di criptovaluta sono altamente volatili e soggetti ad alto rischio, incluso il rischio di perdere tutto o una parte sostanziale del tuo investimento. Il trading o il possesso di asset crypto potrebbe non essere adatto a tutti gli investitori. Le opinioni espresse in questo articolo sono esclusivamente quelle dell'autore/autori e non rappresentano la politica ufficiale o la posizione di Yellow, dei suoi fondatori o dei suoi dirigenti. Conduci sempre la tua ricerca approfondita (D.Y.O.R.) e consulta un professionista finanziario autorizzato prima di prendere qualsiasi decisione di investimento.
OpenAI taglia del 25% i costi di trascrizione, ma i rivali restano più accurati | Yellow