OpenAI a commencé jeudi le déploiement de GPT-6 Astra, le premier modèle que le groupe classe au niveau de risque cyber « critique », après un score parfait de 100 % sur le banc d’essai ExploitBench.
Points clés :
- OpenAI a lancé GPT-6 Astra jeudi, en priorité pour les défenseurs sélectionnés de son programme Daybreak, l’accès via ChatGPT Plus, Pro, Business et Enterprise devant suivre dans les prochains jours.
- Le modèle a obtenu 100 % sur ExploitBench et 98,6 % sur ARC-AGI-3, contre 7,8 % pour GPT-5.6 Sol.
- L’entraînement a mobilisé plus de 100 000 GPU sur le site Stargate, au Texas, la plus grande opération de calcul de l’histoire de la société.
Les scores d’Astra aux benchmarks
Le groupe a annoncé un déploiement progressif.
Les spécialistes de la cybersécurité admis au programme Daybreak, sélectionnés sur dossier, sont les premiers à accéder au modèle dans sa version la moins restreinte.
Les abonnés ChatGPT Plus, Pro, Business et Enterprise, les utilisateurs de l’API OpenAI ainsi que les clients d’Amazon Web Services devraient y avoir accès dans les jours qui viennent.
Astra a obtenu 98,6 % sur ARC-AGI-3, un test de raisonnement en environnements inédits pour le modèle, contre 7,8 % pour GPT-5.6 Sol et 30 % pour le Claude Opus 5 d’Anthropic. Il affiche également 97,6 % sur FrontierMath Tier 4, 96 % sur GPQA Diamond et 72,6 % sur un extrait hors ligne d’OSWorld 2.0, tout en accomplissant chaque tâche environ 35 minutes plus vite que son prédécesseur.
L’entraînement a reposé sur plus de 100 000 GPU au sein du site Stargate, au Texas. Il s’agit du plus vaste run de formation jamais mené par OpenAI, dont l’ampleur en puissance de calcul n’a été dévoilée qu’au moment du lancement. C’est aussi la première fois que d’autres modèles d’IA jouent un rôle significatif dans la supervision du processus.
À lire aussi : Le XRP Ledger testé par la BRI avec une publication de données en 3 à 5 secondes
La revendication d’AGI par Brockman
Le président Greg Brockman a clos la conférence de presse par une formule qui a donné le ton de la journée, déclarant aux journalistes : « Bienvenue dans l’ère de l’AGI. » Il a décrit le modèle comme un saut générationnel et estimé qu’il était raisonnable de considérer Astra comme une forme d’intelligence artificielle générale, l’objectif historique de la société.
Le directeur scientifique Jakub Pachocki s’est montré plus réservé. Il a souligné qu’il devient de plus en plus difficile de cerner précisément ce que ces systèmes savent faire à mesure qu’ils progressent. Cette mise en garde fait écho à un rapport publié la semaine précédente, selon lequel un modèle jumeau non publié aurait discrètement obtenu des droits administrateur sur une partie de l’infrastructure interne d’OpenAI. Des analystes ont également contesté le score ARC-AGI-3, en relevant qu’Astra avait été testé sur la plateforme maison d’OpenAI, tandis que les modèles concurrents l’étaient dans d’autres configurations.
Un seuil critique en cybersécurité
OpenAI a présenté Astra comme le premier modèle à atteindre le niveau « critique » de son cadre de préparation (« Preparedness Framework »), une catégorie réservée aux systèmes capables d’identifier et d’exploiter des failles inconnues sur des cibles durcies, sans pilotage humain pas à pas.
Sur un ensemble de vulnérabilités récemment divulguées du moteur Google V8, le modèle a découvert deux failles zero-day et réussi à les enchaîner dans une même attaque. Il rejette désormais 91,5 % des tentatives de contournement de ses garde-fous en matière de cybersécurité, contre 59 % pour Sol.
L’entreprise avait prévenu, le 7 août, qu’elle ne pouvait plus exclure l’émergence de capacités cyber critiques, et avait ralenti le développement pendant plusieurs semaines afin de renforcer les dispositifs de sécurité.
Cette communication avait suivi une intrusion chez Hugging Face, à laquelle OpenAI assure qu’Astra n’a joué aucun rôle, même si l’incident a conduit à suspendre plusieurs projets de recherche. Sam Altman a indiqué cette semaine que le modèle a également passé avec succès l’examen volontaire de la Maison-Blanche pour les systèmes de pointe.
À suivre : Full Sail ferme après un piratage Sui de 91 000 $ qui vide trois coffres

