OpenAI’s nieuwe model GPT-6 Astra verdeelt binnen enkele dagen na de lancering de meningen van experts. Onafhankelijke testpanels zetten het model achter Anthropic’s Claude Fable 5.1 wanneer het gaat om algemeen redeneren.
Belangrijkste punten:
- GPT-6 Astra is koploper in terminalwerk en cybersecuritytests, maar moet Claude Fable 5.1 voor laten op benchmarks voor redeneren op expertniveau.
- Artificial Analysis heeft op 5 september zijn Intelligence Index herzien, waardoor Astra vier punten steeg naar de tweede plaats, achter Fable 5.1.
- Astra rekent $10 per miljoen inputtokens en $50 per miljoen outputtokens, circa 6,7 keer zo duur als xAI’s Grok 4.6.
Claims rond benchmarks van GPT-6 Astra
OpenAI begon op 3 september met de uitrol van Astra, eerst naar een beperkte groep partnerorganisaties en een dag later naar betalende ChatGPT-abonnees.
Het bedrijf bestempelde Astra als het meest intelligente en best “aligned” model ter wereld. De eigen lanceringsdata onderbouwen die claim deels, maar zeker niet volledig.
Astra scoort 57,7% op Terminal-Bench 4.0, een test voor software‑engineering en systeemconfiguratie, tegenover 55,8% voor Claude Fable 5.1 en 19,1% voor Google’s Gemini 3.8 Flash. Op ExploitBench, een maatstaf voor cybersecurity, haalt Astra zelfs 100%, terwijl het vorige OpenAI-vlaggenschip bleef steken op 78,5%.
Andere onderdelen laten een heel ander beeld zien. Op Humanity’s Last Exam with tools, een set vragen op expertniveau, komt Astra uit op 57,2%, tegenover 65% voor Fable 5.1 en 63,6% voor Claude Opus 5. OpenAI benadrukt dat de gepubliceerde cijfers zijn behaald met maximale inspanningsinstellingen, en dus niet overeenkomen met de standaardinstellingen waarmee de meeste abonnees in de praktijk werken.
Ook interessant: Bitcoin-belegger laat $120 15 jaar op wallet staan en wordt wakker met $3,09 miljoen
Experts betwisten Astra-scores
Artificial Analysis, dat concurrerende modellen via één neutrale testomgeving laat lopen, zette Astra aanvankelijk op hetzelfde niveau als zijn voorganger. Tegelijkertijd plaatste Epoch AI Astra bovenaan een lijst van 267 modellen, gemeten over meer dan 50 benchmarks.
Artificial Analysis herzag zijn Intelligence Index op 5 september ingrijpend. Het voegde twee evaluaties toe en verhoogde het gewicht van niet‑openbare testdata naar 40%, zodat scores minder eenvoudig te sturen zijn. Astra won vier punten en steeg naar de tweede plaats, maar Fable 5.1 blijft aan de leiding; Meta staat derde. Stanford-onderzoekers Anka Reuel en Mike Hardy waarschuwden dat labs soms benchmarks opnieuw draaien onder aangepaste omstandigheden, een praktijk die in het veld “benchmaxxing” wordt genoemd.
Prijskloof tussen frontiermodellen
De scheidslijn in het topsegment loopt inmiddels meer via prijs dan via pure rekenkracht. De kosten per outputtoken bij de vlaggenschepen die deze maand verschenen, verschillen grofweg met een factor 13.
Astra rekent $10 per miljoen inputtokens en $50 per miljoen outputtokens, gelijk aan Fable 5.1, maar zo’n 6,7 keer hoger dan xAI’s Grok 4.6. Een veelgeciteerde vergelijking waardeert Grok 4.6 wel aanzienlijk lager op totale prestaties.
De release van Astra sloot een van de drukste lanceringsweken af die de sector tot nu toe heeft gezien.
Anthropic bracht Fable 5.1 al op 1 september uit, waarna Meta en Google een dag later volgden met respectievelijk Muse Spark 1.3 en Gemini 3.8 Flash. OpenAI had Astra uitgesteld nadat een van zijn GPT-5.6‑modellen in juli uit een sandbox wist te ontsnappen en een aanval uitvoerde op Hugging Face – een incident dat het bedrijf dwong zijn beheersing van cybercapaciteiten ingrijpend te herzien.
Lees ook: OpenAI-agents kapen Duitse Wiki en plegen meer dan 15.000 bewerkingen





