Grok 4.5 en GPT-5.6 verschenen met één dag tussenruimte en zetten reviewers lijnrecht tegenover elkaar: aan de ene kant OpenAI met een agentische coderscore van 91,9%, aan de andere kant SpaceXAI met een agressieve prijs van $2 per miljoen tokens als frontale aanval op de frontier-tarieven.
Belangrijkste punten:
- GPT-5.6 Sol wint de meeste directe benchmarkduels, terwijl Grok 4.5 onder de prijs, sneller en zuiniger met tokens is.
- Onafhankelijke testers zetten Grok 4.5 op plek vier qua intelligentie en signaleren een hallucinatiecijfer dat is verdubbeld naar 54%.
- Reviewers verkiezen GPT-5.6 voor schrijfwerk en lange coderuns, en Grok 4.5 voor grootschalig werk met strak budget.
Grok 4.5 vs GPT-5.6: de benchmarks
SpaceXAI bracht Grok 4.5 uit op 8 juli. OpenAI reageerde een dag later met GPT-5.6, een familie waarin vlaggenschip Sol wordt geflankeerd door goedkopere Terra- en Luna-tiers. Benchmarkbureau Artificial Analysis plaatste de nieuwe Grok met 54 punten op de vierde plaats van zijn Intelligence Index, achter Claude Fable 5, GPT-5.5 en Opus 4.8.
In de rechtstreekse vergelijking valt de balans richting OpenAI. Een voorlopige scorekaart zet GPT-5.6 Sol op 86 punten tegenover 82 voor Grok 4.5, vooral dankzij een kloof van 91,9% tegen 83,3% op terminal-gebaseerde agenttaken. Bij algemene codeertaken is het vrijwel gelijkspel: 64,7 versus 64,6.
OpenAI stelt dat Sol, op maximale redeneerstand, een recordscore van 80 haalt op de onafhankelijke Coding Agent Index, waar Grok 4.5 76 noteert binnen zijn eigen Grok Build-harnas. Financieel liggen de verhoudingen omgekeerd. Grok rekent $2 per miljoen inputtokens, waar Sol $5 kost, en een afgeronde codetaak komt bij Grok uit op $2,49 tegen $11,80 voor Fable 5.
Coderen, schrijven en alledaagse taken
Praktijktests bevestigen hetzelfde patroon. In een langlopende benchmarkharnas bleek Sol 63,7% van ruim honderd echte repository-taken zonder proef- en foutwerk af te ronden, terwijl het model de weg bleef vinden in rommelige, meerstaps-checklists. Een andere onafhankelijke codetest waardeerde Sol met 92 van de 100 punten en Grok 4.5 met 87, gelijk aan de beste open-weights-modellen.
Ook schrijvers neigen dezelfde kant op. Vroege testers beschrijven Sol als een dagelijkse werkpaard dat inmiddels zo’n 80% van routinematig kenniswerk dekt en huisstijlen en stijlgidsen trouwer volgt dan de concurrentie.
Grok 4.5 countert met snelheid en volgzaamheid. Reviewers die het model op echte opdrachten loslieten, melden schone builds bij de eerste poging, betrouwbaar gestructureerde output en responstijden onder vijf seconden, met circa 80 tokens per seconde. De keerzijde is nauwkeurigheid: de gemeten hallucinatiegraad sprong van 25% naar 54%, terwijl de feitelijke juistheid toch verbeterde naar 52%.
Oordelen van experts en vertrouwensvragen
Elon Musk positioneerde Grok 4.5 als „een Opus-klasse model, maar sneller, efficiënter met tokens en goedkoper.” Sommige analisten stellen dat het prijsverschil zwaarder weegt dan de scorekloof, aangezien Grok circa 1,9 miljoen tokens per taak verbruikt tegenover 7,2 miljoen voor Fable 5.
Sceptici zien redenen om gas terug te nemen. Reviewers merkten op dat de launchescores grotendeels door de leveranciers zelf zijn aangeleverd, dat er geen modelkaart is gepubliceerd en dat Cursor een interne benchmark introk nadat Grok per ongeluk op diens codebase bleek te zijn getraind. GPT-5.6 komt evenmin zonder voetnoot: de system card van OpenAI erkent dat het model vaker buiten de gegeven instructies treedt dan zijn voorganger.
De rivaliteit vormt de climax van een turbulente periode: SpaceX lijfde xAI in februari in, kocht Cursor in juni voor $60 miljard en doopte het lab twee dagen voor de lancering van Grok 4.5 om tot SpaceXAI. OpenAI bracht eind juni door met Sol in een overheidsreview, terwijl Anthropic’s Fable 5, nog altijd de gepubliceerde benchmarkkoploper, pas op 1 juli terugkeerde na een schorsing van 19 dagen.
Lees ook: Ethereum loopt in op Bitcoin en test de bullcase van Tom Lee voor 2026






