Grok 4.5 et GPT-5.6 ont été lancés à un jour d’intervalle, polarisant les testeurs entre le score de 91,9 % de OpenAI sur le codage « agentique » en environnement terminal et le défi tarifaire de SpaceXAI à 2 dollars le million de jetons, bien en dessous des prix de pointe du secteur.
À retenir
- GPT-5.6 Sol domine la plupart des benchmarks en confrontation directe, tandis que Grok 4.5 le devance en prix, vitesse et parcimonie de jetons.
- Des testeurs indépendants classent Grok 4.5 au quatrième rang en intelligence et signalent un taux d’hallucination qui a doublé à 54 %.
- Les critiques plébiscitent GPT-5.6 pour la rédaction et les longues sessions de code, et Grok 4.5 pour les volumes massifs à budget serré.
Grok 4.5 vs GPT-5.6 : les benchmarks
SpaceXAI a mis Grok 4.5 sur le marché le 8 juillet. OpenAI a répliqué dès le lendemain avec GPT-5.6, une gamme qui associe le modèle phare Sol à des variantes plus abordables, Terra et Luna. Le cabinet de mesure Artificial Analysis a positionné le nouveau Grok au quatrième rang de son Intelligence Index, à 54 points, derrière Claude Fable 5, GPT-5.5 et Opus 4.8.
En duel direct, l’avantage va à OpenAI. Une feuille de match provisoire attribue 86 points à GPT-5.6 Sol contre 82 pour Grok 4.5, un écart porté par la performance sur les tâches agentiques en terminal (91,9 % contre 83,3 %), tandis que les scores moyens en codage finissent quasiment à égalité, 64,7 contre 64,6.
OpenAI revendique pour Sol, en mode raisonnement maximal, un record de 80 sur l’indice indépendant Coding Agent Index, là où Grok 4.5 obtient 76 dans son environnement Grok Build. L’économie, en revanche, tourne à l’avantage de SpaceXAI : Grok facture 2 dollars par million de jetons en entrée, contre 5 dollars pour Sol, et un projet de codage terminé coûte 2,49 dollars, contre 11,80 dollars pour Fable 5.
À lire aussi : Les paris sur les Dodgers culminent à 68 M$ alors que Polymarket et Kalshi misent sur la course aux playoffs de la MLB
Codage, rédaction et tâches du quotidien
Les retours de terrain confirment cette fracture. Sur un protocole long terme, un banc de test a constaté que Sol menait à bien 63,7 % de plus de 100 tâches issues de dépôts de code réels, sans erreurs de parcours, en restant aligné malgré des check-lists complexes et multi-étapes. Un autre test indépendant de programmation a noté Sol à 92 sur 100 et Grok 4.5 à 87, au niveau des meilleurs modèles à poids ouverts.
Les auteurs se montrent tout aussi favorables à Sol. Les premiers utilisateurs le décrivent comme un outil de travail quotidien couvrant désormais près de 80 % des tâches de connaissance courantes, avec une capacité à respecter les guides de style supérieure à celle de ses rivaux.
Grok 4.5 riposte par la vitesse et la discipline d’exécution. Des testeurs qui l’ont utilisé en conditions réelles relatent des builds propres dès la première tentative, un formatage fiable des réponses structurées et des latences inférieures à cinq secondes, avec un débit d’environ 80 jetons par seconde. Le point noir reste la précision : son taux d’hallucination mesuré a bondi de 25 % à 54 %, alors même que sa justesse factuelle grimpait à 52 %.
Avis d’experts et questions de confiance
Elon Musk a présenté Grok 4.5 comme « un modèle de classe Opus, mais plus rapide, plus économe en jetons et moins cher ». Certains analystes estiment que l’écart de prix compense l’écart de score, Grok ne consommant que 1,9 million de jetons par tâche contre 7,2 millions pour Fable 5.
Les sceptiques appellent toutefois à la prudence. Des examinateurs ont relevé que les performances de lancement étaient auto-déclarées par l’éditeur, qu’aucune « model card » n’avait été publiée et que Cursor avait retiré un benchmark interne après que Grok a été entraîné par erreur sur son propre code. GPT-5.6 traîne aussi une astérisque : la fiche système d’OpenAI reconnaît que le modèle outrepasse plus souvent les instructions que son prédécesseur.
Cette rivalité conclut une séquence particulièrement agitée. SpaceX a absorbé xAI en février, racheté Cursor pour 60 milliards de dollars en juin, puis rebaptisé le laboratoire SpaceXAI deux jours avant la sortie de Grok 4.5. OpenAI a passé la fin juin avec Sol bloqué en revue réglementaire, tandis que Fable 5 d’Anthropic, toujours leader des benchmarks publiés, n’est revenu en ligne que le 1er juillet après 19 jours de suspension.
À suivre : Ethereum rattrape Bitcoin et met à l’épreuve le scénario haussier 2026 de Tom Lee






