Astra décroche un score parfait de 100 % sur le test cyber le plus exigeant d’OpenAI

Perfect exploit scores put OpenAI's GPT-6 Astra in the critical cyber tier as its staged rollout begins. (Image: Shutterstock)
Perfect exploit scores put OpenAI's GPT-6 Astra in the critical cyber tier as its staged rollout begins. (Image: Shutterstock)

OpenAI a commencé jeudi le déploiement de GPT-6 Astra, premier modèle que le groupe classe dans la catégorie « risque cyber critique », après un score parfait de 100 % sur le benchmark ExploitBench.

Points clés :

  • OpenAI a lancé jeudi GPT-6 Astra, d’abord auprès de défenseurs certifiés via son programme Daybreak, avant une ouverture dans les jours à venir à ChatGPT Plus, Pro, Business et Enterprise.
  • Le modèle affiche 100 % sur ExploitBench et 98,6 % sur ARC-AGI-3, contre 7,8 % pour GPT-5.6 Sol.
  • L’entraînement a mobilisé plus de 100 000 GPU sur le site Stargate au Texas, soit la plus vaste opération de calcul jamais menée par la société.

Les scores de référence d’Astra

L’entreprise a annoncé un déploiement par étapes.

Les spécialistes de cybersécurité sélectionnés via le programme Daybreak, basé sur candidature, sont les premiers à accéder au modèle dans sa version la moins restreinte.

Les clients ChatGPT Plus, Pro, Business et Enterprise, les utilisateurs de l’API OpenAI ainsi que Amazon Web Services doivent suivre dans les tout prochains jours.

Astra a obtenu 98,6 % sur ARC-AGI-3, un test de raisonnement en contexte inédit pour le modèle, contre 7,8 % pour GPT-5.6 Sol et 30 % pour Claude Opus 5 d’Anthropic. Il affiche 97,6 % sur FrontierMath Tier 4, 96 % sur GPQA Diamond et 72,6 % sur un extrait hors ligne d’OSWorld 2.0, avec un temps moyen par tâche réduit d’environ 35 minutes par rapport à son prédécesseur.

L’entraînement a mobilisé plus de 100 000 GPU sur le site Stargate au Texas. Il s’agit de la campagne de calcul la plus ambitieuse jamais menée par OpenAI, dont le volume n’a été dévoilé qu’au moment du lancement. C’est aussi la première fois que d’autres modèles jouent un rôle significatif dans la supervision de l’entraînement.

À lire aussi : XRP Ledger testé par la BRI avec une publication de données en 3 à 5 secondes

La revendication d’AGI par Brockman

Le président Greg Brockman a conclu une conférence de presse par une formule qui a donné le ton de la journée, lançant aux journalistes : « Bienvenue dans l’ère de l’AGI. » Il a présenté Astra comme un saut générationnel et estimé qu’il était raisonnable d’y voir une intelligence artificielle générale, objectif de longue date de l’entreprise.

Le directeur scientifique Jakub Pachocki s’est montré plus prudent. Il a souligné qu’il devient de plus en plus difficile, à mesure que ces systèmes progressent, de cerner précisément leurs capacités. Une remarque renforcée par un rapport, la semaine précédente, indiquant qu’un modèle frère non publié aurait discrètement pris le contrôle administrateur d’une partie de l’infrastructure interne d’OpenAI. Des analystes ont également mis en doute le score ARC-AGI-3, notant qu’Astra a été évalué sur l’infrastructure maison d’OpenAI, alors que les modèles concurrents l’étaient sous d’autres configurations.

Un seuil critique en cybersécurité

OpenAI présente Astra comme le premier modèle à atteindre le niveau « critique » de son Preparedness Framework, une catégorie réservée aux systèmes capables d’identifier et d’exploiter des failles inconnues sur des cibles durcies, sans supervision humaine pas-à-pas.

Sur un ensemble récent de vulnérabilités du moteur Google V8, le modèle a découvert deux failles zero-day et les a enchaînées dans une même attaque. Il bloque désormais 91,5 % des tentatives de « jailbreak » à visée cyber, contre 59 % pour Sol.

L’entreprise avait d’abord prévenu, le 7 août, qu’elle ne pouvait exclure que le modèle atteigne un seuil critique de capacité cyber, puis avait ralenti le développement plusieurs semaines pour ajouter des garde-fous.

Cette mise en garde avait suivi une intrusion chez Hugging Face, dont OpenAI affirme qu’Astra n’a joué aucun rôle, même si l’épisode a conduit à suspendre plusieurs travaux de recherche. Sam Altman a indiqué cette semaine que le modèle avait également passé avec succès l’examen volontaire de la Maison-Blanche pour les systèmes de frontière.

À suivre : Full Sail ferme ses portes après un hack Sui de 91 000 $ qui a vidé trois coffres

Alexey Bondarev profile photo

Alexey Bondarev

Alexey Bondarev est responsable du contenu chez Yellow.com et couvre l’actualité crypto depuis dix ans. Il est spécialisé dans les articles de Recherche et Learn approfondis, avec un accent particulier sur l’analyse, la mise en contexte sectorielle et les grandes forces qui façonnent l’écosystème crypto, de l’ère de l’IA et des technologies de sécurité aux innovations fintech. Il est convaincu que tout ce qui est numérique supplantera très prochainement tout ce qui est analogique et travaille dur pour contribuer à rendre cela possible.

Avertissement et avertissement sur les risques : Les informations fournies dans cet article sont à des fins éducatives et informatives uniquement et sont basées sur l'opinion de l'auteur. Elles ne constituent pas des conseils financiers, d'investissement, juridiques ou fiscaux. Les actifs de cryptomonnaie sont très volatils et sujets à des risques élevés, y compris le risque de perdre tout ou une partie substantielle de votre investissement. Le trading ou la détention d'actifs crypto peut ne pas convenir à tous les investisseurs. Les opinions exprimées dans cet article sont uniquement celles de l'auteur/des auteurs et ne représentent pas la politique officielle ou la position de Yellow, de ses fondateurs ou de ses dirigeants. Effectuez toujours vos propres recherches approfondies (D.Y.O.R.) et consultez un professionnel financier agréé avant de prendre toute décision d'investissement.
Astra décroche un score parfait de 100 % sur le test cyber le plus exigeant d’OpenAI | Yellow