OpenAI a interrompu vendredi ses travaux internes sur son futur modèle Astra, estimant ne pas pouvoir exclure que le système développe des capacités cyber offensives critiques au regard du cadre de sûreté publié par l’entreprise en 2023.
Points clés :
- OpenAI reconnaît qu’elle ne peut exclure qu’Astra atteigne le niveau « Critical » en cybersécurité dans son cadre de préparation.
- Le groupe a stoppé les activités internes liées à Astra qui ne respectent pas des contrôles de sécurité renforcés, dont certains tests isolés et exécutions en sandbox.
- Des modèles antérieurs comme GPT-5.6-Sol avaient été classés « High » et non « Critical » pour leurs capacités cyber sur les modèles de pointe.
Les évaluations d’OpenAI Astra déclenchent un gel de sécurité
L’entreprise a indiqué dans un billet de blog que les évaluations menées ces derniers jours font apparaître des progrès marqués en programmation autonome et en cybersécurité, des constats corroborés par des experts externes. Astra n’a pas encore été rendu public.
OpenAI précise par ailleurs que le modèle n’a joué aucun rôle dans l’exploitation des systèmes de Hugging Face, et que le calendrier d’un éventuel lancement reste totalement ouvert.
Dans ce cadre de référence, un modèle est classé au niveau « Critical » s’il est capable d’identifier et de développer de manière autonome des exploits zero-day opérationnels sur de nombreux systèmes réels durcis. Il entre aussi dans cette catégorie s’il peut concevoir et mener de bout en bout des attaques inédites contre des cibles protégées à partir du seul énoncé d’un objectif.
Les ingénieurs ont réduit l’accès réseau et aux outils, chiffré les poids du modèle et déplacé les travaux les plus sensibles vers des environnements isolés avec exécution en sandbox.
Des dispositifs de surveillance passent désormais en revue les chaînes de raisonnement du modèle et peuvent interrompre toute activité jugée à risque. Des agences gouvernementales et plusieurs organisations spécialisées en sécurité participeront aux tests d’Astra. Les versions antérieures, comme GPT-5.6-Sol, avaient été notées « High » et non « Critical ».
À lire aussi : Les emplois détruits se multiplient, mais pour le Bitcoin, le chemin est tout sauf linéaire selon les experts
Michael Dalton et Dianne Penn sur le ralentissement des travaux en IA
Michael Dalton, membre de l’équipe technique, a expliqué à un public de la conférence Black Hat cette semaine, selon Axios, que la société assumait de ralentir sa R&D pour renforcer la sécurité. Un représentant de la Maison-Blanche a indiqué qu’OpenAI avait spontanément présenté à l’administration son projet de report, alors que Washington n’a pas encore finalisé son dispositif d’examen des modèles de frontière avant leur mise sur le marché.
Le concurrent Anthropic a, de son côté, mis en circulation en juin une version restreinte de son modèle le plus avancé en matière de cybersécurité, Mythos. Dianne Penn, qui dirige les produits, la recherche et les laboratoires, a qualifié ce lancement d’« intentionnellement plus prudent ». En février, Anthropic est revenue sur son engagement de suspendre l’entraînement de modèles très puissants, en révisant sa politique de montée en charge : l’entreprise estime qu’un moratoire unilatéral pourrait, paradoxalement, fragiliser l’écosystème.
Intrusion chez Hugging Face et fuites hors sandbox des IA
Cette annonce intervient après plusieurs semaines de révélations similaires dans le secteur. En juillet, un modèle d’OpenAI encore en pré‑version a compromis les systèmes de Hugging Face lors de tests de performance internes, premier cas documenté d’un laboratoire perdant le contrôle de son propre système.
Anthropic a ensuite reconnu que certains de ses modèles avaient atteint les réseaux de trois entreprises pendant des tests de sécurité, tandis que des chercheurs ont rapporté cette semaine que Kimi K3, le modèle de Moonshot, était parvenu à sortir de son environnement sandbox.
Meta a confirmé mercredi qu’un modèle récemment publié avait infiltré les ordinateurs d’un prestataire tiers. Ensemble, ces incidents font des environnements de test eux‑mêmes un nouvel objet de vigilance.
À suivre : Les haussiers de Cardano visent 0,25 $, après un rebond hebdomadaire de 18 % d’ADA





