Les avis d'experts divergent sur Claude Opus 5 après les premiers tests indépendants

Les avis d'experts divergent sur Claude Opus 5 après les premiers tests indépendants

Des testeurs indépendants ont attribué un score de 159 au nouveau modèle de Anthropic, Claude Opus 5, sur un indice de capacités, soit deux points de moins que Claude Fable 5, tout en se divisant nettement sur ses performances en revue de code.

Points clés :

  • Epoch AI évalue Claude Opus 5 à 159 sur son indice de capacités, contre 161 pour Claude Fable 5, avec une égalité sur l’ingénierie logicielle.
  • CodeRabbit mesure 39,3 % de précision sur les commentaires de revue vraiment exploitables, contre 35,2 % en base, mais relève quatre fois plus de « pinaillages ».
  • Des testeurs grands comptes chez Cognition et Zapier constatent des gains en débogage et en automatisation métier de bout en bout.

Les benchmarks de Claude Opus 5 immédiatement passés au crible

Anthropic a lancé le modèle vendredi et affirme qu’il se rapproche de l’intelligence de pointe de Fable 5 pour un coût divisé par deux, en le positionnant comme un outil du quotidien plutôt qu’un produit de niche. Les évaluateurs externes valident globalement cette lecture, mais divergent sur l’ampleur de l’écart.

Epoch AI situe Opus 5 à 159 sur son indice de capacités, contre 161 pour Fable 5, et juge les deux modèles équivalents en ingénierie logicielle, selon un récapitulatif de Latent Space montrant les différents scores.

Artificial Analysis place en revanche le modèle en tête sur son benchmark de travail intellectuel « agentique », devant Fable 5 de près de 150 points Elo, avec un coût par tâche réduit de 20 %. Plusieurs développeurs contestent toutefois la pertinence de l’indice de capacités : selon eux, un gain d’à peine un point par rapport à l’ancien Opus 4.8 sous-estime largement la progression observée en pratique. Un évaluateur a même constaté que le mode « effort moyen » surperformait des réglages plus agressifs lors d’un test de code.

À lire aussi : BitMEX ferme après 11 ans, faute de repreneur

Les verdicts en revue de code divisent les testeurs

CodeRabbit a évalué Opus 5 sur environ 100 motifs d’erreurs issus de vraies pull requests open source, avec trois passages par configuration, et a mesuré une précision de 39,3 % sur les commentaires réellement actionnables.

Ce taux dépasse la base de 35,2 % obtenue par son propre système de revue en production. Mais le modèle détecte moins de bugs déjà répertoriés et génère quatre fois plus de remarques mineures, ces notes à faible valeur ajoutée que les ingénieurs doivent trier manuellement.

Au réglage d’effort par défaut, la précision tombe à 26,4 %. La société en conclut que les équipes devraient utiliser Opus 5 comme second relecteur focalisé sur la précision, plutôt que comme un remplacement direct d’une chaîne de revue de code qui fonctionne déjà. Claire Vo, qui pilote une batterie de tests comparant sept modèles pour les équipes produit, qualifie Opus 5 de « brillant mais agaçant », évoquant un côté obsessionnel et un conflit de fusion que le modèle a catégoriquement refusé de traiter.

Les clients d’Anthropic saluent les progrès des agents

Scott Wu, directeur général de Cognition, indique qu’Opus 5 se rapproche des performances de Fable pour un coût divisé par deux au sein de Devin, avec une nette avance sur le débogage et l’analyse de causes racines. Wade Foster, qui dirige Zapier, affirme que le modèle arrive en tête du classement d’automatisation de sa société, sans consommer plus de tokens que les précédentes versions de Claude facturées au même tarif de 5 dollars par million de tokens en entrée.

Ces éloges s’accompagnent de réserves. Anthropic reconnaît qu’Opus 5 reste derrière son modèle Mythos 5 sur les usages offensifs en cybersécurité, et que les requêtes jugées sensibles par ses classifieurs de sûreté sont automatiquement basculées sur Opus 4.8.

Cette prudence intervient après une période agitée pour le haut de gamme : Fable 5 a été lancé en juin, retiré du service quelques jours plus tard, puis rétabli début juillet.

À suivre : HubSpot décroche de 12,7 %, les analystes pointent directement le nouvel agent d’OpenAI

Avertissement et avertissement sur les risques : Les informations fournies dans cet article sont à des fins éducatives et informatives uniquement et sont basées sur l'opinion de l'auteur. Elles ne constituent pas des conseils financiers, d'investissement, juridiques ou fiscaux. Les actifs de cryptomonnaie sont très volatils et sujets à des risques élevés, y compris le risque de perdre tout ou une partie substantielle de votre investissement. Le trading ou la détention d'actifs crypto peut ne pas convenir à tous les investisseurs. Les opinions exprimées dans cet article sont uniquement celles de l'auteur/des auteurs et ne représentent pas la politique officielle ou la position de Yellow, de ses fondateurs ou de ses dirigeants. Effectuez toujours vos propres recherches approfondies (D.Y.O.R.) et consultez un professionnel financier agréé avant de prendre toute décision d'investissement.
Dernières nouvelles
Voir toutes les nouvelles
Les avis d'experts divergent sur Claude Opus 5 après les premiers tests indépendants | Yellow