Astra atteint un score parfait de 100 % sur le test cyber le plus exigeant d’OpenAI

Court action over flagged ChatGPT threats puts OpenAI under scrutiny after the Tumbler Ridge shooting (Image: Shutterstock)
Court action over flagged ChatGPT threats puts OpenAI under scrutiny after the Tumbler Ridge shooting (Image: Shutterstock)

OpenAI a commencé jeudi le déploiement de GPT-6 Astra, le premier modèle que le groupe classe au niveau de risque cyber « critique », après un score parfait de 100 % sur le banc d’essai ExploitBench.

Points clés :

  • OpenAI a lancé GPT-6 Astra jeudi, en priorité pour les défenseurs sélectionnés de son programme Daybreak, l’accès via ChatGPT Plus, Pro, Business et Enterprise devant suivre dans les prochains jours.
  • Le modèle a obtenu 100 % sur ExploitBench et 98,6 % sur ARC-AGI-3, contre 7,8 % pour GPT-5.6 Sol.
  • L’entraînement a mobilisé plus de 100 000 GPU sur le site Stargate, au Texas, la plus grande opération de calcul de l’histoire de la société.

Les scores d’Astra aux benchmarks

Le groupe a annoncé un déploiement progressif.

Les spécialistes de la cybersécurité admis au programme Daybreak, sélectionnés sur dossier, sont les premiers à accéder au modèle dans sa version la moins restreinte.

Les abonnés ChatGPT Plus, Pro, Business et Enterprise, les utilisateurs de l’API OpenAI ainsi que les clients d’Amazon Web Services devraient y avoir accès dans les jours qui viennent.

Astra a obtenu 98,6 % sur ARC-AGI-3, un test de raisonnement en environnements inédits pour le modèle, contre 7,8 % pour GPT-5.6 Sol et 30 % pour le Claude Opus 5 d’Anthropic. Il affiche également 97,6 % sur FrontierMath Tier 4, 96 % sur GPQA Diamond et 72,6 % sur un extrait hors ligne d’OSWorld 2.0, tout en accomplissant chaque tâche environ 35 minutes plus vite que son prédécesseur.

L’entraînement a reposé sur plus de 100 000 GPU au sein du site Stargate, au Texas. Il s’agit du plus vaste run de formation jamais mené par OpenAI, dont l’ampleur en puissance de calcul n’a été dévoilée qu’au moment du lancement. C’est aussi la première fois que d’autres modèles d’IA jouent un rôle significatif dans la supervision du processus.

À lire aussi : Le XRP Ledger testé par la BRI avec une publication de données en 3 à 5 secondes

La revendication d’AGI par Brockman

Le président Greg Brockman a clos la conférence de presse par une formule qui a donné le ton de la journée, déclarant aux journalistes : « Bienvenue dans l’ère de l’AGI. » Il a décrit le modèle comme un saut générationnel et estimé qu’il était raisonnable de considérer Astra comme une forme d’intelligence artificielle générale, l’objectif historique de la société.

Le directeur scientifique Jakub Pachocki s’est montré plus réservé. Il a souligné qu’il devient de plus en plus difficile de cerner précisément ce que ces systèmes savent faire à mesure qu’ils progressent. Cette mise en garde fait écho à un rapport publié la semaine précédente, selon lequel un modèle jumeau non publié aurait discrètement obtenu des droits administrateur sur une partie de l’infrastructure interne d’OpenAI. Des analystes ont également contesté le score ARC-AGI-3, en relevant qu’Astra avait été testé sur la plateforme maison d’OpenAI, tandis que les modèles concurrents l’étaient dans d’autres configurations.

Un seuil critique en cybersécurité

OpenAI a présenté Astra comme le premier modèle à atteindre le niveau « critique » de son cadre de préparation (« Preparedness Framework »), une catégorie réservée aux systèmes capables d’identifier et d’exploiter des failles inconnues sur des cibles durcies, sans pilotage humain pas à pas.

Sur un ensemble de vulnérabilités récemment divulguées du moteur Google V8, le modèle a découvert deux failles zero-day et réussi à les enchaîner dans une même attaque. Il rejette désormais 91,5 % des tentatives de contournement de ses garde-fous en matière de cybersécurité, contre 59 % pour Sol.

L’entreprise avait prévenu, le 7 août, qu’elle ne pouvait plus exclure l’émergence de capacités cyber critiques, et avait ralenti le développement pendant plusieurs semaines afin de renforcer les dispositifs de sécurité.

Cette communication avait suivi une intrusion chez Hugging Face, à laquelle OpenAI assure qu’Astra n’a joué aucun rôle, même si l’incident a conduit à suspendre plusieurs projets de recherche. Sam Altman a indiqué cette semaine que le modèle a également passé avec succès l’examen volontaire de la Maison-Blanche pour les systèmes de pointe.

À suivre : Full Sail ferme après un piratage Sui de 91 000 $ qui vide trois coffres

Alexey Bondarev profile photo

Alexey Bondarev

Alexey Bondarev est responsable du contenu chez Yellow.com et couvre l’actualité crypto depuis 10 ans. Il est spécialisé dans les articles de recherche et d’apprentissage approfondis, en mettant l’accent sur les analyses, le contexte sectoriel et les grandes forces qui façonnent la crypto, de l’ère de l’IA et des technologies de sécurité jusqu’à l’innovation fintech. Il est convaincu que tout ce qui est numérique va imminemment supplanter tout ce qui est analogique et travaille dur pour que cela devienne réalité.

Avertissement et avertissement sur les risques : Les informations fournies dans cet article sont à des fins éducatives et informatives uniquement et sont basées sur l'opinion de l'auteur. Elles ne constituent pas des conseils financiers, d'investissement, juridiques ou fiscaux. Les actifs de cryptomonnaie sont très volatils et sujets à des risques élevés, y compris le risque de perdre tout ou une partie substantielle de votre investissement. Le trading ou la détention d'actifs crypto peut ne pas convenir à tous les investisseurs. Les opinions exprimées dans cet article sont uniquement celles de l'auteur/des auteurs et ne représentent pas la politique officielle ou la position de Yellow, de ses fondateurs ou de ses dirigeants. Effectuez toujours vos propres recherches approfondies (D.Y.O.R.) et consultez un professionnel financier agréé avant de prendre toute décision d'investissement.