Grok 4.5 verslaat Fable 5 en Opus 4.8 in agent‑AI‑test met score van 51,4%

Grok 4.5 verslaat Fable 5 en Opus 4.8 in agent‑AI‑test met score van 51,4%

Grok 4.5 geeft de kosten‑en‑prestatieclaim van Elon Musk nieuw gewicht na een onafhankelijke agentbenchmark waarin het model als beste uit de bus kwam.

Kernpunten:

  • Grok 4.5 behaalde 51,4% op AutomationBench‑AA, vóór twee Claude‑modellen.
  • De kosten lagen op $0,34 per taak, fors onder die van de dichtstbijzijnde Anthropic‑concurrenten.
  • De relatief hoge mate van regeloverschrijdingen blijft een risico bij zakelijke agent‑deployments.

Grok‑benchmark

Artificial Analysis meldde dat Grok 4.5 51,4% scoorde op AutomationBench‑AA, boven Claude Fable 5 met 48,6% en Claude Opus 4.8 met 48,5%. De modelkosten per taak kwamen uit op $0,34, tegenover $1,35 voor Fable 5 en $1,46 voor Opus 4.8.

De benchmark biedt een externe toets van Musks stelling dat Grok 4.5 een Opus‑klasse model is dat sneller draait en goedkoper is. SpaceXAI bracht het model deze week naar het grote publiek, gebouwd op een V9‑fundament met 1,5 biljoen parameters en ondersteund door vroege interne evaluaties.

AutomationBench‑AA omvat 657 taken in 40 gesimuleerde apps, waaronder Gmail, Slack, Salesforce en HubSpot. De test kijkt of een AI‑agent doelstellingen kan afronden zonder guardrails te doorbreken; Artificial Analysis houdt de taakset bewust gesloten om benchmarkvervuiling te beperken.

Zie ook: Grok 4.5 daagt OpenAI en Anthropic uit met goedkopere agentic AI

Musks gewaagde claim

Volgens Artificial Analysis gebruikte Grok 4.5 ongeveer 8.000 outputtokens per taak, ruwweg een kwart van het verbruik van Opus 4.8. “De totale tokenconsumptie van 0,44 miljoen per taak is een van de laagste op het leaderboard,” aldus het bureau, dat de lage kosten toeschrijft aan efficiëntie én tokenpricing.

Het model wist 79,9% van de taakdoelen te behalen en rondde 21,9% van de taken volledig volgens de eisen af. In finance – de lastigste categorie van de benchmark – had Grok 4.5 de hoogste score met 71%, tegen 64% voor Fable 5 en 62% voor Opus 4.8.

De achilleshiel is compliance. Grok 4.5 noteerde gemiddeld 0,63 guardrail‑overtredingen per taak, meer dan Opus 4.8 met 0,55 en Google’s Gemini 3.5 Flash met 0,46. Dat verschil weegt zwaar voor bedrijven die agents dicht tegen live financiële systemen inzetten.

Musks lancering draaide dan ook om een pragmatische afruil, niet om een perfecte benchmarkclean sweep. Grok 4.5 heeft nu onafhankelijke onderbouwing voor kosten- en snelheidsclaims, maar de hogere regelbreukratio onderstreept waarom grootschalige enterprise‑adoptie uiteindelijk zal afhangen van robuuste betrouwbaarheid.

Lees verder: Bitcoin’s herstel kampt met een vraagprobleem dat bulls niet kunnen negeren

Disclaimer en risicowaarschuwing: De informatie in dit artikel is uitsluitend voor educatieve en informatieve doeleinden en is gebaseerd op de mening van de auteur. Het vormt geen financieel, investerings-, juridisch of belastingadvies. Cryptocurrency-assets zijn zeer volatiel en onderhevig aan hoog risico, inclusief het risico om uw gehele of een substantieel deel van uw investering te verliezen. Het handelen in of aanhouden van crypto-assets is mogelijk niet geschikt voor alle beleggers. De meningen die in dit artikel worden geuit zijn uitsluitend die van de auteur(s) en vertegenwoordigen niet het officiële beleid of standpunt van Yellow, haar oprichters of haar leidinggevenden. Voer altijd uw eigen grondig onderzoek uit (D.Y.O.R.) en raadpleeg een gelicentieerde financiële professional voordat u een investeringsbeslissing neemt.
Grok 4.5 verslaat Fable 5 en Opus 4.8 in agent‑AI‑test met score van 51,4% | Yellow