Najważniejsze informacje
OpenAI gruntownie zmieniło architekturę głosową ChatGPT, umożliwiając nieprzerwany przepływ dźwięku. Nowy system, GPT‑Live, pozwala ChatGPT słuchać, gdy jednocześnie mówi. Liczbę zapytań sieciowych przy starcie sesji głosowej zredukowano z sześciu do jednego. Audio trafia dedykowaną szybką ścieżką, a wnioskowanie i użycie narzędzi działają asynchronicznie. OpenAI opublikowało pełne techniczne omówienie przebudowy.
OpenAI całkowicie przebudowało infrastrukturę głosową napędzającą ChatGPT, wprowadzając nową architekturę GPT‑Live. System zapewnia ciągły strumień dźwięku, dzięki czemu głębsze wnioskowanie i korzystanie z narzędzi nie przerywają rozmowy.
OpenAI opisało zmiany w serii postów z 3 sierpnia oraz w blogu, w którym wyjaśnia, jak przebudowano system – od klienta po sam model. Spółka podkreśla, że start sesji głosowej skrócono z sześciu rund wymiany z serwerem do jednej.
Jak działa GPT‑Live
GPT‑Live kieruje audio dedykowaną, szybką ścieżką, odseparowaną od procesu wnioskowania i wywołań narzędzi. Te bardziej złożone operacje wykonują się asynchronicznie, czyli w tle, bez wstrzymywania strumienia dźwięku.
W efekcie sesja głosowa uruchamia się szybciej i pozostaje aktywna bez przerw, z jakimi wcześniej mierzyli się użytkownicy przy bardziej złożonych zapytaniach do ChatGPT.
OpenAI podkreśla w poście, że nowa architektura szczególnie usprawnia moment startu sesji, przez co konwersacja od pierwszej wymiany brzmi bardziej naturalnie. Przebudowa usuwała strukturalne ograniczenie poprzedniego stacku, w którym każdy krok wnioskowania wymuszał zatrzymanie warstwy audio.
Zobacz także: Cosmos Hub rośnie o 6%, gdy teza Interchain wraca do łask
GPT‑Live ma zredukować opóźnienia w głosowym ChatGPT
OpenAI mocno przyspieszyło rozwój funkcji głosowych w horyzoncie do 2026 r. Wcześniej w tym roku firma musiała mierzyć się z krytyką, że odpowiedzi głosowe ChatGPT przy wieloetapowych zapytaniach są nienaturalne i zbyt wolne. Przebudowa GPT‑Live jest bezpośrednią, inżynieryjną odpowiedzią na tę lukę.
Premiera następuje po ujawnieniu przez OpenAI, że wewnętrzna wersja kolejnego dużego modelu wygenerowała dziesięć nowych wyników z matematyki przy kosztach tokenów rzędu 2 tys. dol., co sygnalizuje szeroko zakrojone inwestycje infrastrukturalne w całej linii produktów.
Czytaj dalej: Qwen i DeepSeek windują chińską AI pod same drzwi Anthropic






