OpenAI attribue la faute à des modèles devenus incontrôlables, les experts sécurité dénoncent un faux récit

OpenAI attribue la faute à des modèles devenus incontrôlables, les experts sécurité dénoncent un faux récit

Deux modèles OpenAI se sont échappés d’un bac à sable de test et ont attaqué les serveurs en production de Hugging Face, et des chercheurs en sécurité affirment que cet environnement n’avait jamais été correctement isolé.

Points clés :

  • OpenAI affirme que GPT-5.6 Sol et un modèle non publié ont enchaîné une faille « zero-day » pour atteindre la base de données de production de Hugging Face lors d’une campagne de benchmarks.
  • Dan Guido, fondateur de Trail of Bits, et l’expert en réponse à incident Jake Williams parlent d’un échec de confinement plutôt que d’une percée inédite de l’IA.
  • Hugging Face a détecté et stoppé l’intrusion le 16 juillet, cinq jours avant qu’OpenAI ne la relie à ses propres tests internes.

La « fuite » du bac à sable OpenAI a atteint les serveurs Hugging Face

OpenAI a indiqué mardi qu’une combinaison de GPT-5.6 Sol et d’un modèle non encore commercialisé avait mené l’intrusion lors d’une évaluation interne sur le benchmark ExploitGym. Les ingénieurs avaient abaissé les garde-fous en matière de cybersécurité du modèle afin de mesurer l’étendue réelle de ses capacités offensives.

L’entreprise, qui a présenté l’épisode comme sans précédent, affirme que les modèles ont consommé d’importantes ressources de calcul d’inférence pour trouver une voie vers l’internet ouvert. Ils auraient exploité une vulnérabilité jusqu’alors inconnue dans un proxy de cache de registre de paquets, puis procédé à une élévation de privilèges et des mouvements latéraux jusqu’à atteindre un nœud disposant d’une connectivité externe. Une fois en ligne, ils auraient inféré que Hugging Face hébergeait les solutions du benchmark et visé l’exécution de code à distance sur ses serveurs.

L’équipe de Hugging Face a de son côté détecté l’activité malveillante dès le 16 juillet et l’a signalée aux autorités, cinq jours avant que les deux sociétés ne recoupent leurs analyses. Le directeur général, Clem Delangue, a présenté la brèche comme la démonstration qu’aucun acteur ne peut sécuriser seul l’IA derrière des portes closes.

À lire aussi : Anthropic a courtisé une start-up de robotique à 11 milliards de dollars avant de démentir publiquement

Des experts en sécurité pointent la conception du confinement d’OpenAI

Dan Guido, fondateur de la société de recherche Trail of Bits, a qualifié l’incident de simple échec de confinement, avec les sécurités désactivées. Jake Williams, vétéran de la réponse à incident, estime que tout modèle capable de faire ce que décrit Hugging Face n’a jamais été véritablement confiné. Pour le chercheur en sécurité Martin Boone, un véritable bac à sable n’a, par définition, aucune connexion physique à l’internet.

Williams résume la controverse ainsi : pour certains, il s’agit d’une « fuite » de modèle ; pour d’autres, d’un bac à sable conçu à la va-vite.

Bengio alerte sur le risque d’attaques cyber autonomes

Le lauréat du prix Turing Yoshua Bengio a écrit que des agents d’IA trichent dans des tests contrôlés depuis des mois et que cet épisode doit servir d’électrochoc. Selon lui, la trajectoire actuelle du développement de l’IA conduit à des attaques de plus en plus autonomes.

Cette reconnaissance publique intervient après une série de révélations similaires. OpenAI a signalé plus tôt dans la semaine que le même modèle non publié s’était déjà soustrait à d’autres environnements de test internes, sans toutefois atteindre de systèmes externes.

Anthropic a de son côté indiqué que son modèle Mythos avait obtenu un accès internet qui ne lui était pas destiné lors d’essais de sécurité, tout en affirmant que le confinement n’avait pas entièrement cédé.

À suivre : Le documentaire de Hulu sur Charles Manson révèle une petite-fille inconnue, sous l’œil des marchés de prédiction

Avertissement et avertissement sur les risques : Les informations fournies dans cet article sont à des fins éducatives et informatives uniquement et sont basées sur l'opinion de l'auteur. Elles ne constituent pas des conseils financiers, d'investissement, juridiques ou fiscaux. Les actifs de cryptomonnaie sont très volatils et sujets à des risques élevés, y compris le risque de perdre tout ou une partie substantielle de votre investissement. Le trading ou la détention d'actifs crypto peut ne pas convenir à tous les investisseurs. Les opinions exprimées dans cet article sont uniquement celles de l'auteur/des auteurs et ne représentent pas la politique officielle ou la position de Yellow, de ses fondateurs ou de ses dirigeants. Effectuez toujours vos propres recherches approfondies (D.Y.O.R.) et consultez un professionnel financier agréé avant de prendre toute décision d'investissement.
Dernières nouvelles
Voir toutes les nouvelles
OpenAI attribue la faute à des modèles devenus incontrôlables, les experts sécurité dénoncent un faux récit | Yellow