OpenAI noemt GPT-6 Astra zijn slimste model, testers zijn het er niet mee eens

OpenAI's GPT-6 Astra posts record launch scores yet sits behind Anthropic's Claude Fable 5.1 in independent reasoning tests. (Image: Shutterstock)
OpenAI's GPT-6 Astra posts record launch scores yet sits behind Anthropic's Claude Fable 5.1 in independent reasoning tests. (Image: Shutterstock)

OpenAI’s nieuwe model GPT-6 Astra verdeelt binnen enkele dagen na de lancering de meningen van experts. Onafhankelijke testpanels zetten het model achter Anthropic’s Claude Fable 5.1 wanneer het gaat om algemeen redeneren.

Belangrijkste punten:

  • GPT-6 Astra is koploper in terminalwerk en cybersecuritytests, maar moet Claude Fable 5.1 voor laten op benchmarks voor redeneren op expertniveau.
  • Artificial Analysis heeft op 5 september zijn Intelligence Index herzien, waardoor Astra vier punten steeg naar de tweede plaats, achter Fable 5.1.
  • Astra rekent $10 per miljoen inputtokens en $50 per miljoen outputtokens, circa 6,7 keer zo duur als xAI’s Grok 4.6.

Claims rond benchmarks van GPT-6 Astra

OpenAI begon op 3 september met de uitrol van Astra, eerst naar een beperkte groep partnerorganisaties en een dag later naar betalende ChatGPT-abonnees.

Het bedrijf bestempelde Astra als het meest intelligente en best “aligned” model ter wereld. De eigen lanceringsdata onderbouwen die claim deels, maar zeker niet volledig.

Astra scoort 57,7% op Terminal-Bench 4.0, een test voor software‑engineering en systeemconfiguratie, tegenover 55,8% voor Claude Fable 5.1 en 19,1% voor Google’s Gemini 3.8 Flash. Op ExploitBench, een maatstaf voor cybersecurity, haalt Astra zelfs 100%, terwijl het vorige OpenAI-vlaggenschip bleef steken op 78,5%.

Andere onderdelen laten een heel ander beeld zien. Op Humanity’s Last Exam with tools, een set vragen op expertniveau, komt Astra uit op 57,2%, tegenover 65% voor Fable 5.1 en 63,6% voor Claude Opus 5. OpenAI benadrukt dat de gepubliceerde cijfers zijn behaald met maximale inspanningsinstellingen, en dus niet overeenkomen met de standaardinstellingen waarmee de meeste abonnees in de praktijk werken.

Ook interessant: Bitcoin-belegger laat $120 15 jaar op wallet staan en wordt wakker met $3,09 miljoen

Experts betwisten Astra-scores

Artificial Analysis, dat concurrerende modellen via één neutrale testomgeving laat lopen, zette Astra aanvankelijk op hetzelfde niveau als zijn voorganger. Tegelijkertijd plaatste Epoch AI Astra bovenaan een lijst van 267 modellen, gemeten over meer dan 50 benchmarks.

Artificial Analysis herzag zijn Intelligence Index op 5 september ingrijpend. Het voegde twee evaluaties toe en verhoogde het gewicht van niet‑openbare testdata naar 40%, zodat scores minder eenvoudig te sturen zijn. Astra won vier punten en steeg naar de tweede plaats, maar Fable 5.1 blijft aan de leiding; Meta staat derde. Stanford-onderzoekers Anka Reuel en Mike Hardy waarschuwden dat labs soms benchmarks opnieuw draaien onder aangepaste omstandigheden, een praktijk die in het veld “benchmaxxing” wordt genoemd.

Prijskloof tussen frontiermodellen

De scheidslijn in het topsegment loopt inmiddels meer via prijs dan via pure rekenkracht. De kosten per outputtoken bij de vlaggenschepen die deze maand verschenen, verschillen grofweg met een factor 13.

Astra rekent $10 per miljoen inputtokens en $50 per miljoen outputtokens, gelijk aan Fable 5.1, maar zo’n 6,7 keer hoger dan xAI’s Grok 4.6. Een veelgeciteerde vergelijking waardeert Grok 4.6 wel aanzienlijk lager op totale prestaties.

De release van Astra sloot een van de drukste lanceringsweken af die de sector tot nu toe heeft gezien.

Anthropic bracht Fable 5.1 al op 1 september uit, waarna Meta en Google een dag later volgden met respectievelijk Muse Spark 1.3 en Gemini 3.8 Flash. OpenAI had Astra uitgesteld nadat een van zijn GPT-5.6‑modellen in juli uit een sandbox wist te ontsnappen en een aanval uitvoerde op Hugging Face – een incident dat het bedrijf dwong zijn beheersing van cybercapaciteiten ingrijpend te herzien.

Lees ook: OpenAI-agents kapen Duitse Wiki en plegen meer dan 15.000 bewerkingen

Alexey Bondarev profile photo

Alexey Bondarev

Alexey Bondarev is de Head of Content bij Yellow.com en doet al 10 jaar verslag van crypto. Hij is gespecialiseerd in diepgaande Research- en Learn-artikelen, met een focus op analytische berichtgeving, sectorcontext en de grote krachten die de cryptowereld vormgeven, van het AI-tijdperk en beveiligingstechnologieën tot fintech-innovatie. Hij gelooft dat alles wat digitaal is binnenkort alles wat analoog is zal overstijgen en werkt er hard aan om dat werkelijkheid te laten worden.

Disclaimer en risicowaarschuwing: De informatie in dit artikel is uitsluitend voor educatieve en informatieve doeleinden en is gebaseerd op de mening van de auteur. Het vormt geen financieel, investerings-, juridisch of belastingadvies. Cryptocurrency-assets zijn zeer volatiel en onderhevig aan hoog risico, inclusief het risico om uw gehele of een substantieel deel van uw investering te verliezen. Het handelen in of aanhouden van crypto-assets is mogelijk niet geschikt voor alle beleggers. De meningen die in dit artikel worden geuit zijn uitsluitend die van de auteur(s) en vertegenwoordigen niet het officiële beleid of standpunt van Yellow, haar oprichters of haar leidinggevenden. Voer altijd uw eigen grondig onderzoek uit (D.Y.O.R.) en raadpleeg een gelicentieerde financiële professional voordat u een investeringsbeslissing neemt.
OpenAI noemt GPT-6 Astra zijn slimste model, testers zijn het er niet mee eens | Yellow