Punti chiave
OpenAI ha rivoluzionato l'architettura vocale di ChatGPT per consentire un flusso audio continuo, senza interruzioni. Il nuovo sistema, GPT-Live, permette a ChatGPT di ascoltare mentre parla. L'avvio di una sessione vocale è passato da sei round trip di rete a uno solo. L'audio segue un canale dedicato ad alta velocità, mentre ragionamento e uso di tool girano in modo asincrono. OpenAI ha pubblicato una spiegazione tecnica completa del nuovo stack.
OpenAI ha ricostruito da zero l'infrastruttura vocale che alimenta ChatGPT, lanciando una nuova architettura chiamata GPT-Live pensata per mantenere il flusso audio continuo, così che il ragionamento profondo e l'uso di strumenti non interrompano più la conversazione.
OpenAI ha illustrato le novità in una serie di post del 3 agosto e in un blog che spiega come il sistema sia stato riprogettato end-to-end, dal client al modello. La società ha dichiarato di aver ridotto l'avvio di una sessione vocale da sei round trip di rete a uno solo.
Come funziona GPT-Live
GPT-Live instrada l'audio su un percorso dedicato e a bassa latenza, separato dal livello di ragionamento e dalle chiamate agli strumenti. Le elaborazioni più pesanti girano in asincrono, cioè vengono completate in background senza mettere in pausa lo stream audio.
Il risultato è una sessione vocale che parte più rapidamente e resta attiva senza i vuoti che gli utenti sperimentavano in passato quando ChatGPT affrontava richieste particolarmente complesse.
OpenAI ha spiegato in un post che la nuova architettura gestisce in modo specifico il momento di avvio della sessione, rendendo la conversazione più naturale fin dal primo scambio. La ricostruzione supera un limite strutturale del precedente stack, in cui ogni passaggio di ragionamento costringeva il livello audio a fermarsi in attesa.
Da leggere anche: Cosmos Hub sale del 6% mentre la tesi Interchain torna in primo piano
GPT-Live punta a eliminare i ritardi nella voce di ChatGPT
OpenAI ha accelerato con decisione sul fronte vocale nel biennio fino al 2026. All'inizio dell'anno l'azienda era finita sotto tiro perché le risposte vocali di ChatGPT venivano percepite come lente e poco fluide nella gestione di interrogazioni a più passaggi. La ricostruzione GPT-Live rappresenta la risposta ingegneristica diretta di OpenAI a quel divario di esperienza utente.
Il rilascio arriva dopo la rivelazione, lo scorso mese, che una versione interna del prossimo grande modello dell'azienda ha prodotto dieci nuovi risultati in matematica con un costo di token di circa 2.000 dollari, un segnale di forti investimenti infrastrutturali trasversali a tutta la linea di prodotto.
Prossimo articolo: Qwen e DeepSeek spingono l'AI cinese fino alla soglia di Anthropic






