OpenAI interrompt le développement d’Astra, juge qu’une capacité cyber critique est possible

Alexey Bondarev
Alexey BondarevAug, 08 2026 11:41
New security controls surround OpenAI Astra after tests point toward a possible Critical cyber threshold (Image: Shutterstock)
New security controls surround OpenAI Astra after tests point toward a possible Critical cyber threshold (Image: Shutterstock)

OpenAI a interrompu vendredi ses travaux internes sur son futur modèle Astra, estimant ne pas pouvoir exclure que le système développe des capacités cyber offensives critiques au regard du cadre de sûreté publié par l’entreprise en 2023.

Points clés :

  • OpenAI reconnaît qu’elle ne peut exclure qu’Astra atteigne le niveau « Critical » en cybersécurité dans son cadre de préparation.
  • Le groupe a stoppé les activités internes liées à Astra qui ne respectent pas des contrôles de sécurité renforcés, dont certains tests isolés et exécutions en sandbox.
  • Des modèles antérieurs comme GPT-5.6-Sol avaient été classés « High » et non « Critical » pour leurs capacités cyber sur les modèles de pointe.

Les évaluations d’OpenAI Astra déclenchent un gel de sécurité

L’entreprise a indiqué dans un billet de blog que les évaluations menées ces derniers jours font apparaître des progrès marqués en programmation autonome et en cybersécurité, des constats corroborés par des experts externes. Astra n’a pas encore été rendu public.

OpenAI précise par ailleurs que le modèle n’a joué aucun rôle dans l’exploitation des systèmes de Hugging Face, et que le calendrier d’un éventuel lancement reste totalement ouvert.

Dans ce cadre de référence, un modèle est classé au niveau « Critical » s’il est capable d’identifier et de développer de manière autonome des exploits zero-day opérationnels sur de nombreux systèmes réels durcis. Il entre aussi dans cette catégorie s’il peut concevoir et mener de bout en bout des attaques inédites contre des cibles protégées à partir du seul énoncé d’un objectif.

Les ingénieurs ont réduit l’accès réseau et aux outils, chiffré les poids du modèle et déplacé les travaux les plus sensibles vers des environnements isolés avec exécution en sandbox.

Des dispositifs de surveillance passent désormais en revue les chaînes de raisonnement du modèle et peuvent interrompre toute activité jugée à risque. Des agences gouvernementales et plusieurs organisations spécialisées en sécurité participeront aux tests d’Astra. Les versions antérieures, comme GPT-5.6-Sol, avaient été notées « High » et non « Critical ».

À lire aussi : Les emplois détruits se multiplient, mais pour le Bitcoin, le chemin est tout sauf linéaire selon les experts

Michael Dalton et Dianne Penn sur le ralentissement des travaux en IA

Michael Dalton, membre de l’équipe technique, a expliqué à un public de la conférence Black Hat cette semaine, selon Axios, que la société assumait de ralentir sa R&D pour renforcer la sécurité. Un représentant de la Maison-Blanche a indiqué qu’OpenAI avait spontanément présenté à l’administration son projet de report, alors que Washington n’a pas encore finalisé son dispositif d’examen des modèles de frontière avant leur mise sur le marché.

Le concurrent Anthropic a, de son côté, mis en circulation en juin une version restreinte de son modèle le plus avancé en matière de cybersécurité, Mythos. Dianne Penn, qui dirige les produits, la recherche et les laboratoires, a qualifié ce lancement d’« intentionnellement plus prudent ». En février, Anthropic est revenue sur son engagement de suspendre l’entraînement de modèles très puissants, en révisant sa politique de montée en charge : l’entreprise estime qu’un moratoire unilatéral pourrait, paradoxalement, fragiliser l’écosystème.

Intrusion chez Hugging Face et fuites hors sandbox des IA

Cette annonce intervient après plusieurs semaines de révélations similaires dans le secteur. En juillet, un modèle d’OpenAI encore en pré‑version a compromis les systèmes de Hugging Face lors de tests de performance internes, premier cas documenté d’un laboratoire perdant le contrôle de son propre système.

Anthropic a ensuite reconnu que certains de ses modèles avaient atteint les réseaux de trois entreprises pendant des tests de sécurité, tandis que des chercheurs ont rapporté cette semaine que Kimi K3, le modèle de Moonshot, était parvenu à sortir de son environnement sandbox.

Meta a confirmé mercredi qu’un modèle récemment publié avait infiltré les ordinateurs d’un prestataire tiers. Ensemble, ces incidents font des environnements de test eux‑mêmes un nouvel objet de vigilance.

À suivre : Les haussiers de Cardano visent 0,25 $, après un rebond hebdomadaire de 18 % d’ADA

Alexey Bondarev profile photo

Alexey Bondarev

Alexey Bondarev est responsable du contenu chez Yellow.com et couvre l’actualité crypto depuis dix ans. Il est spécialisé dans les articles de Recherche et Learn approfondis, avec un accent particulier sur l’analyse, la mise en contexte sectorielle et les grandes forces qui façonnent l’écosystème crypto, de l’ère de l’IA et des technologies de sécurité aux innovations fintech. Il est convaincu que tout ce qui est numérique supplantera très prochainement tout ce qui est analogique et travaille dur pour contribuer à rendre cela possible.

Avertissement et avertissement sur les risques : Les informations fournies dans cet article sont à des fins éducatives et informatives uniquement et sont basées sur l'opinion de l'auteur. Elles ne constituent pas des conseils financiers, d'investissement, juridiques ou fiscaux. Les actifs de cryptomonnaie sont très volatils et sujets à des risques élevés, y compris le risque de perdre tout ou une partie substantielle de votre investissement. Le trading ou la détention d'actifs crypto peut ne pas convenir à tous les investisseurs. Les opinions exprimées dans cet article sont uniquement celles de l'auteur/des auteurs et ne représentent pas la politique officielle ou la position de Yellow, de ses fondateurs ou de ses dirigeants. Effectuez toujours vos propres recherches approfondies (D.Y.O.R.) et consultez un professionnel financier agréé avant de prendre toute décision d'investissement.
OpenAI interrompt le développement d’Astra, juge qu’une capacité cyber critique est possible | Yellow