Grok 4.5 i GPT-5.6 zadebiutowały dzień po dniu, polaryzując recenzentów między agentowym wynikiem kodowania OpenAI na poziomie 91,9% a wyzwaniem cenowym SpaceXAI – 2 dolary za milion tokenów, celującym w czołówkę rynku.
Najważniejsze wnioski:
- GPT-5.6 Sol prowadzi w większości bezpośrednich benchmarków, podczas gdy Grok 4.5 wygrywa ceną, szybkością i oszczędnością tokenów.
- Niezależni testerzy plasują Grok 4.5 na czwartym miejscu pod względem inteligencji i sygnalizują wzrost halucynacji do 54%.
- Recenzenci preferują GPT-5.6 do pisania i długich zadań programistycznych, a Grok 4.5 do masowych zleceń przy ograniczonym budżecie.
Grok 4.5 kontra GPT-5.6: wyniki testów
SpaceXAI wprowadził Grok 4.5 na rynek 8 lipca. OpenAI odpowiedziało dzień później GPT-5.6 – rodziną modeli, w której flagowy Sol uzupełniają tańsze warianty Terra i Luna. Firma benchmarkingowa Artificial Analysis umieściła nowego Groka na czwartym miejscu swojego Intelligence Index z wynikiem 54 punktów, za Claude Fable 5, GPT-5.5 i Opus 4.8.
W bezpośrednim starciu przewaga należy do OpenAI. Wstępna tabela wyników wycenia GPT-5.6 Sol na 86 punktów przy 82 punktach Groka 4.5, głównie dzięki przewadze 91,9% do 83,3% w terminalowych zadaniach agentowych. Średnie wyniki w kodowaniu są natomiast praktycznie remisowe – 64,7 wobec 64,6.
OpenAI deklaruje, że Sol przy maksymalnym ustawieniu „reasoning” osiąga rekordowe 80 punktów w niezależnym Coding Agent Index. Grok 4.5 w swoim środowisku Grok Build zdobywa 76 punktów. Ekonomia działa jednak w odwrotną stronę. Grok kosztuje 2 dolary za milion tokenów wejściowych, wobec 5 dolarów dla Sol, a ukończone zadanie kodowe wyceniono na 2,49 dolara wobec 11,80 dolara dla Fable 5.
Zobacz też: Zakłady na Dodgersów rosną do 68 mln dol., gdy Polymarket i Kalshi grają pod baseballowe play-offy
Kod, tekst i praca „na co dzień”
Praktyczne testy potwierdzają podobny podział. W długoterminowym teście „harness” ustalono, że Sol bezbłędnie ukończył 63,7% ze stu kilkudziesięciu realnych zadań na repozytoriach kodu, zachowując orientację w chaotycznych, wieloetapowych checklistach. Osobny, niezależny benchmark programistyczny ocenił Sol na 92 punkty na 100, a Groka 4.5 na 87 – poziom zbliżony do najlepszych modeli open‑weights.
Twórcy treści również przechylają się w stronę Sol. Wczesni użytkownicy opisują go jako „model do codziennej jazdy”, który dziś pokrywa około 80% rutynowej pracy wiedzochłonnej i lepiej niż konkurenci trzyma się firmowych wytycznych stylistycznych.
Grok 4.5 odpowiada prędkością i dyscypliną. Recenzenci testujący go na żywych zleceniach raportowali czyste buildy już przy pierwszym podejściu, wiarygodne, dobrze ustrukturyzowane odpowiedzi oraz czas reakcji poniżej pięciu sekund przy przepustowości rzędu 80 tokenów na sekundę. Problemem pozostaje dokładność: zmierzony odsetek halucynacji wzrósł z 25% do 54%, mimo że trafność faktograficzna poprawiła się do 52%.
Werdykty ekspertów i pytania o zaufanie
Elon Musk przedstawił Groka 4.5 jako „model klasy Opus, ale szybszy, bardziej oszczędny tokenowo i tańszy”. Część analityków argumentuje, że przewaga cenowa może zniwelować różnice w wynikach testów, bo Grok spala średnio 1,9 mln tokenów na zadanie, podczas gdy Fable 5 aż 7,2 mln.
Sceptycy widzą jednak powody do ostrożności. Recenzenci zwracają uwagę, że wyniki z premiery w dużej mierze raportował sam dostawca, model nie dostał oficjalnej „karty modelu”, a Cursor wycofał jeden z wewnętrznych benchmarków po ujawnieniu, że Grok przypadkowo trenował na jego kodzie. GPT-5.6 również ma swój przypis: systemowa karta OpenAI przyznaje, że model częściej niż poprzednik przekracza zadane ograniczenia instrukcji.
Pojedynek zwieńczył burzliwy okres w branży. SpaceX w lutym przejął xAI, w czerwcu kupił Cursor za 60 mld dolarów i dwa dni przed premierą Groka 4.5 przemianował laboratorium na SpaceXAI. OpenAI końcówkę czerwca spędziło z Solem zablokowanym w rządowym przeglądzie bezpieczeństwa, a Fable 5 Anthropic, wciąż lider opublikowanych benchmarków, wrócił na rynek dopiero 1 lipca po 19-dniowym zawieszeniu.
Czytaj dalej: Ethereum goni Bitcoina, wystawiając na próbę byczy scenariusz Toma Lee na 2026 r.






