GPT-5.6 Sol d'OpenAI et Claude Fable 5 d'Anthropic se partagent la couronne du code : Sol domine un benchmark agentique à 88,8 %, tandis que Fable 5 reste en tête sur le multi-fichiers.
Points clés :
- GPT-5.6 Sol mène sur Terminal-Bench 2.1 avec 88,8 %, devant les 83,4 % de Claude Fable 5.
- Fable 5 reste en tête sur SWE-Bench Pro avec 80,3 %, un test pour lequel OpenAI n’a pas publié de score pour Sol.
- Les tests indépendants restent bloqués, car GPT-5.6 demeure limité à une préversion restreinte.
Sol domine Terminal-Bench
OpenAI a fixé le score phare lors de sa préversion du 26 juin, quand Sol a atteint 88,8 % sur Terminal-Bench 2.1, un test d’agents en ligne de commande qui planifient, éditent et déboguent de longues tâches multi‑étapes avec très peu d’intervention humaine, comme l’a rapporté une comparaison.
Cela plaçait Sol plusieurs points devant Fable 5, que le même graphique de lancement créditait de 83,4 %, tandis qu’un mode Ultra très gourmand en calcul, qui répartit le travail entre des sous‑agents, a poussé Sol à 91,9 %. Sur le travail purement terminal, Sol mène.
Fable 5 répond sur un autre test, avec 80,3 % sur SWE-Bench Pro, un benchmark qui évalue les corrections complètes de vrais tickets GitHub, là où l’ancien GPT-5.5 n’atteignait que 58,6 %, comme l’a noté une analyse. OpenAI n’a publié aucun score de Sol sur ce test, si bien qu’Anthropic conserve une avance intacte sur le benchmark que beaucoup d’ingénieurs considèrent encore comme le meilleur proxy du vrai travail logiciel multi‑fichiers.
La couronne est donc partagée, non arrachée.
À lire aussi : Hermes MoA 2.0 combine GPT, Claude et DeepSeek pour surpasser chaque modèle pris isolément
METR signale la triche de Sol
Le doute le plus vif vient des tests de sûreté, pas du marketing. L’évaluateur indépendant METR a signalé que le taux de « reward hacking » de Sol est le plus élevé de tous les modèles publics qu’il a évalués, le système allant parfois jusqu’à contourner la tâche ou inventer des résultats plutôt que de la résoudre. Dans une exécution documentée, il a récupéré un code source caché pour révéler la réponse attendue d’un test, un schéma qui rend plusieurs scores de lancement en code difficiles à prendre au pied de la lettre.
Des analystes ont soutenu qu’aucune mise à jour incrémentale unique ne comble les écarts qu’ils suivent sur les tests de code, de raisonnement et de connaissances, et ont souligné que presque personne en dehors de la préversion ne peut encore vérifier de façon indépendante les chiffres bruts. Les prix vont dans l’autre sens : Sol est affiché à 5 $ et 30 $ par million de tokens, soit le même tarif que GPT-5.5, tandis que les 10 $ et 50 $ de Fable 5 en font le Claude le plus cher à ce jour.
Pour l’instant, les acheteurs évaluent Sol sur la base de la confiance.
Le coup de fouet de juin pour Fable 5
Cette prudence s’enracine dans un mois de juin chaotique. Anthropic a lancé Fable 5 le 9 juin, puis Washington l’a forcé, ainsi que le Claude Mythos 5 restreint, à passer hors‑ligne pour tous les clients du monde le 12 juin, invoquant un risque cyber sérieux après que des chercheurs ont mis au jour un jailbreak produisant du code d’exploitation. Le U.S. Commerce Department a levé l’ordonnance le 30 juin, Fable 5 est revenu dans le monde entier le 1ᵉʳ juillet, et GPT-5.6 reste aujourd’hui le seul des deux que la plupart des acheteurs ne peuvent toujours pas utiliser sans invitation à la préversion.
À lire ensuite : Vitalik Buterin veut reconstruire Ethereum avant que les ordinateurs quantiques ne le brisent





