OpenAI herbouwt voicetechnologie om vloeiende, doorlopende gesprekken in ChatGPT mogelijk te maken

ChatGPT Voice Can Now Listen While It Speaks After OpenAI Overhauls the Audio Stack
OpenAI Reduces Voice Session Startup From Six Network Round Trips to One With New Architecture (Image: AI)

Belangrijkste punten

OpenAI heeft de voice-architectuur van ChatGPT volledig vernieuwd om ononderbroken audio mogelijk te maken. Het nieuwe systeem, GPT-Live, laat ChatGPT tegelijk luisteren en spreken. De opstart van een voicesessie is teruggebracht van zes netwerk-rondes naar één. Audio loopt via een speciale snelle route, terwijl redeneren en toolgebruik asynchroon worden verwerkt. OpenAI publiceerde een uitgebreid technisch overzicht van de herbouw.

OpenAI heeft de voice-infrastructuur achter ChatGPT vanaf de basis herontworpen. De nieuwe architectuur, GPT-Live, zorgt ervoor dat audio continu kan doorlopen, zodat diepere redeneringen en het gebruik van tools een gesprek niet langer stilleggen.

OpenAI lichtte de wijzigingen toe in een reeks berichten op 3 augustus en in een uitgebreid blogartikel waarin het bedrijf beschrijft hoe het systeem van client tot model is herbouwd. Volgens OpenAI is de opstarttijd van een voicesessie teruggebracht van zes netwerk-rondes naar één.

Hoe GPT-Live werkt

GPT-Live stuurt audio via een speciale snelle route die losstaat van redeneringen en tool-calls. Die zwaardere processen draaien asynchroon, dus op de achtergrond, zonder de audiostream stil te zetten.

Het resultaat is een voicesessie die sneller start en actief blijft, zonder de pauzes die gebruikers eerder merkten wanneer ChatGPT complexe verzoeken verwerkte.

In een bericht schrijft OpenAI dat de architectuur expliciet het moment van sessiestart adresseert, zodat het gesprek vanaf de eerste uitwisseling natuurlijker aanvoelt. De herbouw pakt een structurele beperking van de vorige stack aan, waar elke redeneerstap de audiolaag liet wachten.

Ook interessant: Cosmos Hub stijgt 6% nu de Interchain-these een comeback maakt

GPT-Live pakt vertragingen in ChatGPT Voice gericht aan

OpenAI versnelt de ontwikkeling van voice-functionaliteit richting 2026. Eerder dit jaar kreeg het bedrijf kritiek dat gesproken antwoorden van ChatGPT haperend en traag klonken bij meerstapsvragen. De GPT-Live-herbouw is OpenAI’s directe technische antwoord op die tekortkomingen.

De release volgt op de recente onthulling van OpenAI dat een interne versie van het volgende grote model tien nieuwe wiskundige resultaten heeft gegenereerd voor ongeveer 2.000 dollar aan tokenkosten, een signaal dat het bedrijf breed investeert in de onderliggende infrastructuur van zijn productlijn.

Lees ook: Qwen en DeepSeek brengen Chinese AI tot aan de voordeur van Anthropic

Murtuza Merchant profile photo

Murtuza Merchant

Murtuza is een ervaren financieel journalist met uitgebreide ervaring in het verslaan van cryptovaluta en blockchaintechnologie. Hij heeft bijgedragen aan Benzinga en Cointelegraph, naast andere publicaties, waar hij verslag uitbracht over opkomende trends, het regelgevend landschap en meer. Je vindt hem op Twitter als @murtuza_merc en op Telegram als mmerchant001. Disclosure: Murtuza holds ATOM, AKT, TIA, INJ, and OSMO.

Disclaimer en risicowaarschuwing: De informatie in dit artikel is uitsluitend voor educatieve en informatieve doeleinden en is gebaseerd op de mening van de auteur. Het vormt geen financieel, investerings-, juridisch of belastingadvies. Cryptocurrency-assets zijn zeer volatiel en onderhevig aan hoog risico, inclusief het risico om uw gehele of een substantieel deel van uw investering te verliezen. Het handelen in of aanhouden van crypto-assets is mogelijk niet geschikt voor alle beleggers. De meningen die in dit artikel worden geuit zijn uitsluitend die van de auteur(s) en vertegenwoordigen niet het officiële beleid of standpunt van Yellow, haar oprichters of haar leidinggevenden. Voer altijd uw eigen grondig onderzoek uit (D.Y.O.R.) en raadpleeg een gelicentieerde financiële professional voordat u een investeringsbeslissing neemt.