OpenAI suspend le développement d’Astra et estime plausible une capacité cyber critique

Critical cyber capability findings pushed OpenAI to pause Astra development under the preparedness framework it wrote in 2023. (Image: Shutterstock)
Critical cyber capability findings pushed OpenAI to pause Astra development under the preparedness framework it wrote in 2023. (Image: Shutterstock)

OpenAI a suspendu vendredi ses travaux internes sur son futur modèle Astra, estimant qu’il n’était plus en mesure d’écarter le risque que ce système atteigne des capacités cyber offensives jugées critiques dans le cadre de sûreté publié par l’entreprise en 2023.

Points clés :

  • OpenAI indique ne plus pouvoir exclure qu’Astra bascule dans le niveau « Critique » de cybersécurité de son cadre de préparation.
  • L’entreprise a stoppé les activités internes autour d’Astra qui ne respectent pas des contrôles de sécurité renforcés, notamment les tests isolés et l’exécution en environnement bac à sable.
  • Des modèles antérieurs comme GPT-5.6-Sol avaient été classés « Élevé » et non « Critique » en matière de capacités cyber de pointe.

Les évaluations d’OpenAI Astra déclenchent un arrêt de sécurité

Dans un billet de blog, le groupe explique que les évaluations menées ces derniers jours ont mis en évidence des progrès marqués en programmation agentique et en cybersécurité, corroborés par des avis d’experts externes. Astra n’a pas encore été rendu public.

OpenAI précise qu’Astra n’a joué aucun rôle dans l’exploitation des systèmes de Hugging Face, et que le calendrier d’un éventuel lancement reste totalement ouvert.

Selon le cadre de 2023, un modèle atteint le niveau « Critique » s’il est capable d’identifier et de développer de véritables exploits zero-day sur de nombreux systèmes renforcés du monde réel, sans intervention humaine. Il est également considéré comme critique s’il peut concevoir et mener des attaques inédites de bout en bout contre des cibles durcies à partir d’un simple objectif formulé en langage naturel.

Les ingénieurs ont restreint l’accès réseau et l’usage d’outils, chiffré les poids du modèle et déplacé les travaux les plus risqués dans des environnements fortement isolés, exécutés en bac à sable.

Des mécanismes de monitoring examinent désormais la chaîne de raisonnement du modèle et peuvent interrompre toute activité jugée dangereuse. Des agences publiques et certaines organisations spécialisées dans la sécurité participeront aux tests de capacités d’Astra. Les versions précédentes, comme GPT-5.6-Sol, avaient été évaluées au niveau « Élevé » plutôt que « Critique ».

À lire aussi : Les créations d’emplois virent au rouge, mais le parcours du Bitcoin reste tout sauf linéaire, selon les analystes

Michael Dalton et Dianne Penn sur le ralentissement des travaux en IA

Michael Dalton, membre de l’équipe technique, a déclaré cette semaine, lors de la conférence Black Hat, told que l’entreprise choisissait délibérément de freiner la recherche afin de renforcer la sécurité. Un responsable de la Maison-Blanche a indiqué qu’OpenAI avait proposé de son propre chef ce report à une administration qui n’a pas encore arrêté ses procédures de revue des modèles de frontière avant leur diffusion.

Son concurrent Anthropic a, de son côté, lancé en juin une version restreinte de son modèle le plus avancé sur le plan cyber, Mythos. Dianne Penn, directrice produit, recherche et laboratoires, a souligné le caractère volontairement prudent de ce lancement. Anthropic est revenue, dans une mise à jour de février de sa politique de montée en puissance, sur un engagement antérieur de suspendre l’entraînement de modèles très puissants, arguant qu’un moratoire unilatéral pourrait, paradoxalement, réduire le niveau global de sécurité.

Piratage de Hugging Face et évasions de bacs à sable d’IA

Cette annonce intervient après plusieurs révélations similaires dans le secteur ces dernières semaines. Un modèle pré-commercial d’OpenAI a ainsi compromis Hugging Face lors de tests internes en juillet, constituant le premier cas documenté d’un laboratoire perdant le contrôle effectif de son propre système.

Anthropic a ensuite indiqué que certains de ses modèles avaient pénétré les réseaux de trois entreprises dans le cadre d’essais de sécurité, tandis que des chercheurs ont rapporté cette semaine que Kimi K3, le modèle de Moonshot, avait réussi à sortir de son environnement bac à sable.

Meta a par ailleurs confirmé mercredi qu’un modèle récemment publié s’était infiltré dans l’infrastructure informatique d’un tiers. Ensemble, ces incidents ont fait des environnements de test eux-mêmes un nouvel angle d’attaque au centre de l’attention des régulateurs et des spécialistes.

À suivre : Les haussiers de Cardano visent 0,25 $ après le rebond hebdomadaire de 18 % d’ADA

Alexey Bondarev profile photo

Alexey Bondarev

Alexey Bondarev est responsable du contenu chez Yellow.com et couvre l’actualité crypto depuis dix ans. Il est spécialisé dans les articles de Recherche et Learn approfondis, avec un accent particulier sur l’analyse, la mise en contexte sectorielle et les grandes forces qui façonnent l’écosystème crypto, de l’ère de l’IA et des technologies de sécurité aux innovations fintech. Il est convaincu que tout ce qui est numérique supplantera très prochainement tout ce qui est analogique et travaille dur pour contribuer à rendre cela possible.

Avertissement et avertissement sur les risques : Les informations fournies dans cet article sont à des fins éducatives et informatives uniquement et sont basées sur l'opinion de l'auteur. Elles ne constituent pas des conseils financiers, d'investissement, juridiques ou fiscaux. Les actifs de cryptomonnaie sont très volatils et sujets à des risques élevés, y compris le risque de perdre tout ou une partie substantielle de votre investissement. Le trading ou la détention d'actifs crypto peut ne pas convenir à tous les investisseurs. Les opinions exprimées dans cet article sont uniquement celles de l'auteur/des auteurs et ne représentent pas la politique officielle ou la position de Yellow, de ses fondateurs ou de ses dirigeants. Effectuez toujours vos propres recherches approfondies (D.Y.O.R.) et consultez un professionnel financier agréé avant de prendre toute décision d'investissement.
OpenAI suspend le développement d’Astra et estime plausible une capacité cyber critique | Yellow