Grok 4.5 offre un nouvel appui aux affirmations d’Elon Musk sur le rapport coût‑performance, après qu’un benchmark indépendant d’agents a classé le modèle en tête.
À retenir
- Grok 4.5 a obtenu 51,4 % sur AutomationBench-AA, devant deux modèles Claude.
- Le coût par tâche s’établit à 0,34 $, très loin derrière ses rivaux Anthropic.
- Son taux plus élevé de violations de garde-fous reste un risque pour les déploiements d’agents en entreprise.
Le benchmark Grok
Artificial Analysis a indiqué dans un rapport que Grok 4.5 a atteint 51,4 % sur AutomationBench-AA, devant Claude Fable 5 avec 48,6 % et Claude Opus 4.8 avec 48,5 %. Le coût par tâche du modèle ressort à 0,34 $, contre 1,35 $ pour Fable 5 et 1,46 $ pour Opus 4.8.
Ce benchmark apporte une validation externe à l’affirmation de Musk selon laquelle Grok 4.5 est un modèle de classe Opus, plus rapide et moins cher. SpaceXAI a rendu le modèle public cette semaine, en s’appuyant sur une base V9 de 1,5 billion de paramètres et sur des évaluations internes préliminaires pour cadrer le lancement.
AutomationBench-AA agrège 657 tâches réparties sur 40 applications simulées, dont Gmail, Slack, Salesforce et HubSpot. Le test mesure la capacité d’un agent IA à atteindre ses objectifs sans enfreindre les garde-fous, et Artificial Analysis garde la composition exacte du jeu de tâches confidentielle afin de limiter la pollution du benchmark.
À lire aussi : Grok 4.5 défie OpenAI et Anthropic avec une IA d’agent moins chère
Le pari audacieux de Musk
Artificial Analysis précise que Grok 4.5 a utilisé environ 8 000 jetons de sortie par tâche, soit environ un quart de la consommation d’Opus 4.8. « Avec 0,44 million de jetons au total par tâche, son usage figure parmi les plus faibles du classement », explique le cabinet, qui attribue le faible coût à l’efficacité du modèle et à sa tarification de jetons.
Le modèle a rempli 79,9 % des objectifs de tâche et a entièrement réussi 21,9 % des tâches. Dans la finance, le domaine le plus exigeant du benchmark, Grok 4.5 s’est hissé en tête avec 71 %, contre 64 % pour Fable 5 et 62 % pour Opus 4.8.
Son point faible reste la conformité. Grok 4.5 enregistre 0,63 violation de garde-fous par tâche, contre 0,55 pour Opus 4.8 et 0,46 pour Gemini 3.5 Flash de Google. Un écart significatif pour les entreprises qui déploient des agents au plus près de systèmes financiers en production.
Le discours de lancement de Musk met donc en avant un compromis pragmatique plutôt qu’une victoire nette sur tous les indicateurs. Grok 4.5 dispose désormais d’une preuve indépendante de ses atouts en coût et en vitesse, mais son taux de violations montre pourquoi l’adoption par les grandes entreprises restera conditionnée à la fiabilité.
À suivre : La reprise du Bitcoin souffre d’un déficit de demande que les haussiers ne peuvent ignorer





