Onafhankelijke testers waardeerden het nieuwe model van Anthropic, Claude Opus 5, op 159 punten op een capaciteitsindex, twee punten onder Claude Fable 5, terwijl de meningen over zijn prestaties bij codereviews sterk uiteenlopen.
Belangrijkste punten:
- Epoch AI gaf Claude Opus 5 een score van 159 op zijn capaciteitsindex, tegenover 161 voor Claude Fable 5; op software engineering liggen de scores gelijk.
- CodeRabbit mat 39,3% precisie op bruikbare reviewcommentaren, een stijging ten opzichte van de 35,2%-baseline, maar telde wel vier keer zoveel pietluttige opmerkingen.
- Enterprise-testers bij Cognition en Zapier melden duidelijke verbeteringen bij debuggen en end‑to‑end businessautomatisering.
Claude Opus 5‑benchmarks direct onder het vergrootglas
Anthropic bracht het model vrijdag uit en stelde dat het qua tophoogte dicht in de buurt komt van Fable 5, maar dan tegen de helft van de prijs, en positioneert Opus 5 nadrukkelijk als werkpaard voor dagelijks gebruik in plaats van als niche‑specialist. Externe beoordelaars onderschreven dat beeld grotendeels, maar verschillen over de exacte marge.
Epoch AI zette Opus 5 op 159 op zijn capaciteitsindex, tegen 161 voor Fable 5, en beoordeelde beide modellen als gelijkwaardig op software engineering, zo blijkt uit een overzicht van Latent Space toonde.
Artificial Analysis plaatste het model op nummer één in zijn benchmark voor agent‑achtige kennisarbeid, waarbij Opus 5 Fable 5 bijna 150 Elo‑punten aftroefde, terwijl de kosten per taak met 20% daalden. Sommige ontwikkelaars zetten vraagtekens bij de capaciteitsindex. Zij stellen dat een winst van één punt ten opzichte van de oudere Opus 4.8 de sprong voorwaarts die zij in de praktijk ervaren zwaar onderschat. Een evaluator zag zelfs dat de stand “medium effort” beter presteerde dan hogere instellingen op een coding‑test.
Lees ook: BitMEX stopt na 11 jaar zonder koper in zicht
Verdeelde oordelen over codereviews
CodeRabbit testte Opus 5 op circa 100 foutpatronen uit echte open‑source pull requests, met drie runs per configuratie, en mat een precisie van 39,3% op actiegerichte, bruikbare commentaren.
Dat is beter dan de 35,2% baseline van zijn huidige productie‑reviewer, maar Opus 5 vond minder bekende bugs en genereerde vier keer zoveel “nitpicks”: opmerkingen met lage toegevoegde waarde die engineers handmatig moeten wegfilteren.
In de standaardinstelling zakte de precisie terug naar 26,4%. Volgens CodeRabbit doen teams er daarom beter aan Opus 5 in te zetten als tweede, op precisie gerichte reviewer dan als één‑op‑één vervanger van een bestaande, goed draaiende pipeline. Claire Vo, die een evaluatieframework met zeven modellen voor productteams runt, noemde het model briljant maar vermoeiend: het zou volgens haar neurotisch gedrag vertonen en weigerde een merge conflict überhaupt aan te raken.
Anthropic‑klanten zien winst bij AI‑agents
Scott Wu, topman van Cognition, zegt dat Opus 5 in Devin qua prestaties dicht tegen Fable‑niveau aanschurkt tegen de helft van de kosten, met name bij debuggen en root‑cause‑analyse. Wade Foster, CEO van Zapier, stelt dat het model bovenaan de interne ranglijst voor automatisering staat, zonder meer tokens te verbruiken dan eerdere Claude‑versies die net zo geprijsd zijn op 5 dollar per miljoen inputtokens.
De lof kende duidelijke kanttekeningen. Anthropic wijst er zelf op dat Opus 5 achterblijft bij het Mythos 5‑model op offensieve cybersecurity‑taken, en dat aanvragen die door de eigen veiligheidsclassifiers worden gemarkeerd automatisch worden teruggeschakeld naar Opus 4.8.
Die voorzichtigheid volgt op een turbulente periode aan de bovenkant van het portfolio: Fable 5 ging live in juni, werd enkele dagen later teruggetrokken, en pas begin juli weer beschikbaar gemaakt voor gebruikers.
Lees verder: HubSpot daalde 12,7% en analisten wijzen direct naar de nieuwe agent van OpenAI





