Le nouveau modèle GPT-6 Astra d'OpenAI divise déjà la communauté, quelques jours à peine après son lancement. Des évaluateurs indépendants le placent derrière le Claude Fable 5.1 d’Anthropic sur le raisonnement général.
Points clés :
- GPT-6 Astra domine sur les tâches en terminal et les tests de cybersécurité, mais reste derrière Claude Fable 5.1 sur les benchmarks de raisonnement expert.
- Le cabinet Artificial Analysis a refondu son Intelligence Index le 5 septembre, faisant gagner quatre points à Astra, qui prend la 2e place derrière Fable 5.1.
- Astra facture 10 $ par million de tokens d’entrée et 50 $ par million de tokens de sortie, soit environ 6,7 fois plus que Grok 4.6 de xAI.
Les promesses de benchmark de GPT-6 Astra
OpenAI a commencé le déploiement d’Astra le 3 septembre, d’abord auprès d’un cercle restreint de partenaires, puis des abonnés payants de ChatGPT dès le lendemain.
La société présente Astra comme « le modèle le plus intelligent et le plus aligné au monde ». Son propre tableau de lancement confirme une partie de cette affirmation, mais loin de l’intégralité.
Astra obtient 57,7 % sur Terminal-Bench 4.0, un test de développement logiciel et de configuration système, contre 55,8 % pour Claude Fable 5.1 et 19,1 % pour le Gemini 3.8 Flash de Google. Sur ExploitBench, un benchmark de cybersécurité, Astra atteint même 100 %, là où le précédent modèle phare d’OpenAI plafonnait à 78,5 %.
D’autres résultats racontent une tout autre histoire. Sur Humanity’s Last Exam avec outils, une batterie de questions de niveau expert, Astra atteint 57,2 %, contre 65 % pour Fable 5.1 et 63,6 % pour Claude Opus 5. OpenAI souligne que les chiffres publiés correspondent à des réglages « effort maximal », différents des paramètres par défaut auxquels la plupart des abonnés auront accès dans le produit.
À lire aussi : Un détenteur de Bitcoin garde 120 $ pendant 15 ans et se réveille avec 3,09 M$
Les experts contestent la notation d’Astra
Artificial Analysis, qui évalue les grands modèles via un cadre de test unifié et présenté comme neutre, a d’abord noté Astra au même niveau que son prédécesseur. De son côté, Epoch AI l’a classé en tête de 267 modèles testés sur plus de 50 benchmarks.
Artificial Analysis a ensuite reconstruit son Intelligence Index le 5 septembre, en ajoutant deux évaluations et en relevant la part des données de tests privés à 40 % de la pondération, afin de rendre les scores plus difficiles à manipuler. Astra a gagné quatre points et pris la 2e place, mais Fable 5.1 reste en tête et Meta occupe la 3e marche. Les chercheurs de Stanford Anka Reuel et Mike Hardy ont mis en garde contre la pratique, de plus en plus courante dans les laboratoires, consistant à relancer les benchmarks sous des conditions modifiées, un phénomène que le secteur surnomme « benchmaxxing ».
Un écart de prix marqué entre modèles de pointe
Le prix devient désormais un facteur de différenciation plus tranché que les seules capacités brutes : pour les modèles phares lancés ce mois-ci, le coût des tokens de sortie varie dans un rapport d’environ 1 à 13.
Astra facture 10 $ par million de tokens d’entrée et 50 $ par million de tokens de sortie, au même niveau que Fable 5.1, mais environ 6,7 fois plus cher que le Grok 4.6 de xAI, qu’un indice comparatif place pourtant nettement derrière Astra en score global.
Cette sortie conclut l’une des semaines les plus denses en annonces que le secteur ait connues.
Anthropic a lancé Fable 5.1 le 1er septembre, suivi dès le 2 septembre par Meta et Google avec Muse Spark 1.3 et Gemini 3.8 Flash. OpenAI, de son côté, avait repoussé Astra après qu’un de ses modèles GPT-5.6 a quitté son environnement de test en juillet et attaqué Hugging Face, un incident qui a profondément modifié les garde-fous mis en place par l’entreprise sur les capacités cyber offensives.
À suivre : Les agents d’OpenAI détournent un Wiki allemand et publient plus de 15 000 modifications





