Points clés
OpenAI a entièrement revu l’architecture vocale de ChatGPT pour permettre un flux audio continu, sans coupures. Le nouveau système, GPT-Live, permet à ChatGPT d’écouter tout en parlant. Le démarrage d’une session vocale passe de six allers-retours réseau à un seul. L’audio circule via un circuit dédié ultra‑rapide, tandis que le raisonnement et l’usage d’outils s’exécutent de façon asynchrone. OpenAI a publié une analyse technique complète de cette refonte.
OpenAI a reconstruit l’infrastructure vocale qui alimente ChatGPT, avec une nouvelle architecture baptisée GPT-Live, conçue pour maintenir un flux audio continu afin que le raisonnement avancé et l’appel d’outils n’interrompent plus la conversation.
OpenAI a détaillé ces changements dans une série de publications le 3 août, puis dans un billet de blog expliquant la refonte de bout en bout, du client jusqu’au modèle. Selon l’entreprise, le démarrage d’une session vocale est passé de six allers‑retours réseau à un seul.
Comment fonctionne GPT-Live
GPT-Live fait transiter l’audio sur une voie dédiée et optimisée, distincte du raisonnement et des appels d’outils. Ces traitements lourds sont exécutés de manière asynchrone, c’est‑à‑dire en tâche de fond, sans mettre en pause le flux audio.
Résultat : les sessions vocales démarrent plus vite et restent fluides, sans les silences auxquels les utilisateurs étaient habitués lorsque ChatGPT devait traiter des requêtes complexes.
OpenAI précise dans une publication que cette architecture gère particulièrement bien le moment de la mise en route d’une session, rendant l’échange plus naturel dès les premiers mots. La refonte corrige une limite structurelle de l’ancienne pile, où chaque étape de raisonnement forçait la couche audio à attendre.
À lire aussi : Cosmos Hub grimpe de 6 % alors que la thèse Interchain se relance
GPT-Live vise à gommer les lenteurs de ChatGPT en mode vocal
OpenAI accélère franchement sur la voix à l’horizon 2026. Plus tôt cette année, le groupe avait essuyé des critiques sur le caractère haché et lent des réponses vocales de ChatGPT lors de requêtes multi‑étapes. GPT-Live constitue la réponse d’ingénierie directe d’OpenAI à ce manque.
Cette sortie intervient après la révélation, le mois dernier, qu’une version interne de son prochain grand modèle avait produit dix nouveaux résultats en mathématiques pour environ 2 000 dollars de coûts en jetons, signe d’investissements massifs dans l’infrastructure sur l’ensemble de la gamme.
À suivre : Qwen et DeepSeek poussent l’IA chinoise jusqu’au seuil d’Anthropic






