Onafhankelijke testers waardeerden het nieuwe model van Anthropic, Claude Opus 5, op 159 punten op een capaciteitsindex, twee punten onder Claude Fable 5, terwijl de meningen scherp uiteenlopen over zijn prestaties bij code‑review.
Belangrijkste punten:
- Epoch AI zette Claude Opus 5 op 159 punten op zijn capaciteitsindex, tegenover 161 voor Claude Fable 5; op software‑engineering scoren beide gelijk.
- CodeRabbit mat 39,3% precisie in bruikbare review‑comments, tegen een basislijn van 35,2%, maar registreerde vier keer zoveel pietluttige opmerkingen.
- Enterprise‑testers bij Cognition en Zapier zagen duidelijke verbeteringen bij debuggen en end‑to‑end bedrijfsautomatisering.
Claude Opus 5‑benchmarks direct onder het vergrootglas
Anthropic bracht het model vrijdag uit en stelde dat het qua frontier‑intelligentie dicht in de buurt komt van Fable 5 tegen de helft van de prijs, gepositioneerd als werkpaard voor alledag in plaats van niche‑specialist. Externe beoordelaars onderschreven dat beeld grotendeels, maar verschilden sterk over de exacte marge.
Epoch AI zette Opus 5 op 159 punten op zijn capaciteitsindex, tegen 161 voor Fable 5, en vond beide modellen gelijkwaardig op het gebied van software‑engineering, blijkt uit een overzicht van Latent Space dat dit toonde.
Artificial Analysis plaatste het model bovenaan zijn benchmark voor agent‑gedreven kenniswerk, waarbij Opus 5 Fable 5 met bijna 150 Elo‑punten versloeg en de kosten per taak met 20% verlaagde. Sommige ontwikkelaars zetten vraagtekens bij de capaciteitsindex. Zij stellen dat één enkel punt verbetering ten opzichte van de oudere Opus 4.8 het verschil dat zij in de praktijk ervaren zwaar onderschat. Eén beoordelaar constateerde dat een instelling met “medium effort” beter presteerde dan hogere instellingen bij een coding‑test.
Ook interessant: BitMEX sluit na 11 jaar de deuren zonder koper in zicht
Verdeelde oordelen over code‑review
CodeRabbit testte Opus 5 op zo’n 100 foutpatronen afkomstig uit echte open‑source pull requests, met drie runs per configuratie, en mat een precisie van 39,3% voor bruikbare opmerkingen.
Dat resultaat ligt boven de basislijn van 35,2% van zijn huidige productie‑reviewer, maar het model vond minder bekende bugs en genereerde vier keer zoveel “nitpicks”: opmerkingen met lage toegevoegde waarde die ontwikkelaars handmatig moeten wegfilteren.
Bij de standaard‑inspanning zakte de precisie terug naar 26,4%. Volgens CodeRabbit moeten teams Opus 5 daarom eerder inzetten als tweede, op precisie gerichte reviewer dan als directe upgrade van een pipeline die al naar wens draait. Claire Vo, die een evaluatie over zeven modellen voor productteams runt, noemde het model briljant maar vermoeiend, met een neurotische inslag en een merge‑conflict dat het hardnekkig weigerde op te lossen.
Klanten van Anthropic zien vooruitgang bij agents
Scott Wu, topman van Cognition, zegt dat Opus 5 binnen Devin qua prestaties in de buurt komt van Fable, tegen de helft van de kosten, met name sterk bij debuggen en root‑causeanalyse. Wade Foster, CEO van Zapier, meldde dat het model bovenaan de automatiseringsranglijst van zijn bedrijf staat, zonder meer tokens te verbruiken dan eerdere Claude‑versies die tegen dezelfde prijs van $5 per miljoen inputtokens worden aangeboden.
De lof kende een duidelijke randvoorwaarde. Anthropic wijst er zelf op dat Opus 5 achterblijft bij het Mythos 5‑model op het gebied van offensieve cyberbeveiliging, en dat verzoeken die door de veiligheidsclassifiers worden gemarkeerd automatisch terugvallen op Opus 4.8.
Die behoedzaamheid volgt op een onrustige periode in het topsegment. Fable 5 werd in juni gelanceerd, kort daarna weer offline gehaald en pas begin juli opnieuw beschikbaar gesteld aan gebruikers.
Lees ook: HubSpot kelderde 12,7% en analisten wijzen direct naar OpenAI's nieuwe agent





