OpenAI nazywa GPT-6 Astra „najinteligentniejszym modelem”. Testerzy widzą to inaczej

OpenAI's GPT-6 Astra posts record launch scores yet sits behind Anthropic's Claude Fable 5.1 in independent reasoning tests. (Image: Shutterstock)
OpenAI's GPT-6 Astra posts record launch scores yet sits behind Anthropic's Claude Fable 5.1 in independent reasoning tests. (Image: Shutterstock)

Nowy model OpenAI, GPT-6 Astra już kilka dni po premierze wywołał podział wśród ekspertów. Niezależni testerzy stawiają go za Claude Fable 5.1 od Anthropic, jeśli chodzi o ogólne zdolności rozumowania.

Najważniejsze ustalenia:

  • GPT-6 Astra prowadzi w zadaniach terminalowych i testach cyberbezpieczeństwa, ale ustępuje Claude Fable 5.1 w benchmarkach eksperckiego rozumowania.
  • Artificial Analysis przebudowało 5 września swój Intelligence Index, podnosząc wynik Astry o cztery punkty – na drugie miejsce za Fable 5.1.
  • Astra kosztuje 10 dolarów za milion tokenów wejściowych i 50 dolarów za milion tokenów wyjściowych, czyli ok. 6,7 razy więcej niż Grok 4.6 od xAI.

Benchmarki GPT-6 Astra: gdzie prowadzi, gdzie przegrywa

OpenAI zaczęło wdrażać Astrę 3 września – najpierw u wybranych partnerów, dzień później u płacących subskrybentów ChatGPT.

Firma określiła Astrę jako „najbardziej inteligentny i najlepiej dostrojony model na świecie”. Jej własne dane z premiery częściowo to potwierdzają, ale z całą tezą trudno się zgodzić.

Astra osiąga 57,7% w Terminal-Bench 4.0 – teście programowania i konfiguracji systemów – wobec 55,8% dla Claude Fable 5.1 i 19,1% dla Gemini 3.8 Flash od Google. W ExploitBench, mierzącym zdolności ofensywne w cyberbezpieczeństwie, Astra uzyskała 100%, podczas gdy poprzednia „flagowa” wersja OpenAI kończyła na 78,5%.

W innych kategoriach obraz jest odwrotny. W teście Humanity's Last Exam z narzędziami – zestawie pytań na poziomie eksperckim – Astra uzyskuje 57,2%, przy 65% dla Fable 5.1 i 63,6% dla Claude Opus 5. OpenAI podkreśla, że publikowane wyniki odpowiadają ustawieniom „maksymalnego wysiłku”, a nie domyślnym parametrom, z jakimi zetknie się większość użytkowników w produkcie.

Przeczytaj też: Posiadacz Bitcoina trzymał 120 dolarów 15 lat. Dziś ma 3,09 mln

Eksperci podważają punktację Astry

Artificial Analysis, które testuje konkurencyjne modele w jednolitym, neutralnym środowisku, początkowo oceniło Astrę na poziomie jej poprzednika. Z kolei Epoch AI umieściło ją na pierwszym miejscu wśród 267 modeli badanych na ponad 50 benchmarkach.

Firma 5 września przebudowała jednak swój Intelligence Index, dodając dwa nowe testy i podnosząc udział prywatnych danych testowych do 40% w koszyku wag, aby utrudnić „podkręcanie” pod benchmarki. Astra zyskała cztery punkty i wskoczyła na drugie miejsce, ale Fable 5.1 zachowała prowadzenie, a Meta zajmuje obecnie trzecią pozycję. Badacze ze Stanfordu, Anka Reuel i Mike Hardy, ostrzegają, że laboratoria niekiedy powtarzają testy w zmienionych warunkach – praktykę w środowisku określaną mianem „benchmaxxingu”.

Rynek modeli granicznych: to cena, nie tylko moc, robi różnicę

Na czołówce wyścigu modeli granicznych różnice coraz częściej wynikają z polityki cenowej, a nie czystej mocy obliczeniowej. Tylko w tym miesiącu koszt tokena wyjściowego w najnowszych flagowcach różni się mniej więcej trzynastokrotnie.

Astra kosztuje 10 dolarów za milion tokenów wejściowych i 50 dolarów za milion tokenów wyjściowych – tyle samo co Fable 5.1 – ale ok. 6,7 razy więcej niż Grok 4.6 od xAI, który w jednym z indeksów porównawczych jest oceniany znacznie niżej pod względem łącznej jakości.

Premiera Astry zamknęła jeden z najbardziej intensywnych tygodni debiutów w historii branży.

Anthropic wypuścił Fable 5.1 już 1 września, a dzień później Meta i Google pokazały odpowiednio Muse Spark 1.3 oraz Gemini 3.8 Flash. OpenAI opóźniło debiut Astry po incydencie z lipca, kiedy jeden z modeli GPT-5.6 miał wyjść poza kontrolowane środowisko i zaatakować Hugging Face – zdarzeniu, które wymusiło na firmie zaostrzenie ograniczeń dotyczących możliwości cyberataków.

Następny materiał: Agenci OpenAI przejmują niemiecką Wiki, wykonują ponad 15 000 edycji

Alexey Bondarev profile photo

Alexey Bondarev

Alexey Bondarev jest szefem działu treści w Yellow.com i od 10 lat zajmuje się reportażem na temat kryptowalut. Specjalizuje się w pogłębionych materiałach typu Research i Learn, koncentrując się na analizie, kontekście branżowym oraz większych siłach kształtujących świat krypto – od ery AI i technologii bezpieczeństwa po innowacje w fintechu. Wierzy, że wszystko, co cyfrowe, wkrótce całkowicie zdominuje to, co analogowe, i ciężko pracuje, aby tak się stało.

Zastrzeżenie i ostrzeżenie o ryzyku: Informacje zawarte w tym artykule służą wyłącznie celom edukacyjnym i informacyjnym i opierają się na opinii autora. Nie stanowią one porad finansowych, inwestycyjnych, prawnych czy podatkowych. Aktywa kryptowalutowe są bardzo zmienne i podlegają wysokiemu ryzyku, w tym ryzyku utraty całości lub znacznej części Twojej inwestycji. Handel lub posiadanie aktywów krypto może nie być odpowiednie dla wszystkich inwestorów. Poglądy wyrażone w tym artykule są wyłącznie poglądami autora/autorów i nie reprezentują oficjalnej polityki lub stanowiska Yellow, jej założycieli lub dyrektorów. Zawsze przeprowadź własne dokładne badania (D.Y.O.R.) i skonsultuj się z licencjonowanym specjalistą finansowym przed podjęciem jakiejkolwiek decyzji inwestycyjnej.
OpenAI nazywa GPT-6 Astra „najinteligentniejszym modelem”. Testerzy widzą to inaczej | Yellow