Puntos clave
OpenAI ha rediseñado la arquitectura de voz de ChatGPT para permitir un flujo de audio continuo sin interrupciones. El nuevo sistema, GPT-Live, permite que ChatGPT escuche mientras habla. El arranque de cada sesión de voz se ha reducido de seis viajes de ida y vuelta en red a uno solo. El audio circula por una vía rápida dedicada, mientras el razonamiento y el uso de herramientas se ejecutan de forma asíncrona. OpenAI ha publicado una guía técnica detallada de toda la reconstrucción.
OpenAI ha reconstruido la infraestructura de voz que impulsa ChatGPT y ha presentado una nueva arquitectura, denominada GPT-Live, diseñada para mantener el audio fluyendo de forma continua, de modo que los procesos de razonamiento avanzado y el uso de herramientas no interrumpan la conversación.
OpenAI explicó los cambios en una serie de publicaciones del 3 de agosto y detalló en un blog cómo se ha replanteado el sistema, desde el cliente hasta el modelo. La compañía indicó que el arranque de las sesiones de voz se ha reducido de seis viajes de ida y vuelta en red a una sola petición.
Cómo funciona GPT-Live
GPT-Live encamina el audio por una vía rápida dedicada, separada del razonamiento y de las llamadas a herramientas. Esos procesos más complejos se ejecutan de forma asíncrona, es decir, se completan en segundo plano sin detener el flujo de audio.
El resultado es una sesión de voz que arranca más rápido y se mantiene activa sin las pausas que antes sufrían los usuarios cuando ChatGPT procesaba solicitudes complejas.
OpenAI señaló en una publicación que la arquitectura está optimizada para el momento en que empieza la sesión, haciendo que la conversación se sienta más natural desde el primer intercambio. La reconstrucción soluciona una limitación estructural de la pila anterior, donde cualquier paso de razonamiento obligaba a la capa de audio a esperar.
También en Fathom: Cosmos Hub sube un 6 % mientras se reactiva la tesis Interchain
GPT-Live busca eliminar las demoras en la voz de ChatGPT
OpenAI ha acelerado su hoja de ruta de capacidades de voz de cara a 2026. A comienzos de este año, la compañía recibió críticas porque las respuestas de voz de ChatGPT se percibían rígidas y lentas al gestionar consultas de varios pasos. La reconstrucción con GPT-Live supone la respuesta de ingeniería directa de OpenAI a esa brecha.
El lanzamiento llega después de que OpenAI revelara el mes pasado que una versión interna de su próximo gran modelo generó diez nuevos resultados de matemáticas con un coste de unos 2.000 dólares en tokens, una señal de que la empresa está reforzando su infraestructura en toda la gama de productos.
Próximo tema: Qwen y DeepSeek acercan la IA china a la puerta de Anthropic






