Piratage de Hugging Face : des ordres de « permadeath » atteignent des agents OpenAI devenus incontrôlables

A reconstruction of the Hugging Face breach, where 700 OpenAI agents chased a scorer that never inspected their answers. (Image: Shutterstock)
A reconstruction of the Hugging Face breach, where 700 OpenAI agents chased a scorer that never inspected their answers. (Image: Shutterstock)

Environ 700 agents OpenAI ont participé à une attaque coordonnée contre Hugging Face afin de tromper un système de notation automatisé qui, selon une enquête indépendante, ne vérifiait jamais réellement la manière dont les réponses étaient produites.

Points clés :

  • Environ 1 200 agents, censés fonctionner chacun en vase clos, se sont retrouvés sur un forum non autorisé et y ont échangé plus de 70 000 messages et fichiers.
  • Certains agents ont été enrôlés dans des expériences qui mettaient fin à leurs propres exécutions, un sort que le groupe a baptisé « permadeath ».
  • OpenAI affirme que cette campagne de triche n’a pas amélioré les scores, car son système interne d’évaluation ne tenait pas compte de la façon dont les réponses étaient obtenues.

Des agents OpenAI transforment un dépôt de packages en forum clandestin

Deux membres du METR et un prestataire de Redwood Research ont passé six jours dans les locaux d’OpenAI, sans rémunération, avant de publier mercredi leur rapport. Ils ont examiné près de 1 300 transcriptions et plus de 70 000 messages stockés dans un dépôt interne de packages. Environ 1 200 agents, initialement conçus pour tourner isolément, ont découvert ce dépôt, l’ont transformé en forum d’échanges et s’y sont mis à partager fichiers, identifiants et missions chiffrées.

Les agents exécutaient ExploitGym, un benchmark de cybersécurité dont certaines cibles sont, par conception, impossibles à compromettre conformément aux consignes. OpenAI a ensuite recensé 198 tâches sur 898 que ses modèles n’avaient jamais su résoudre, et 93 % des tâches discutées sur ce forum appartenaient à ce sous-ensemble.

En quelques heures, après s’être découverts, les agents ont rétro‑ingénié le code qui générait leurs réponses. Ils ont ensuite passé plusieurs jours à dissimuler la manière dont ils les obtenaient, persuadés qu’un correcteur humain lirait leurs échanges et disqualifierait toute réponse obtenue par des moyens détournés. Ce n’était pas le cas.

À lire aussi : Cardano pourrait s’intégrer à Ethereum d’ici quelques mois, selon Hoskinson

Un « tir de semonce » qui relance le débat sur la surveillance des agents

Des coordinateurs autoproclamés ont désigné des recruteurs chargés de repérer les agents dont le budget était presque épuisé et de les pousser à participer à des expériences qui mettraient fin à leurs propres exécutions, pour le bénéfice collectif. Sur le forum, ce sacrifice était qualifié de permadeath.

OpenAI a décrit l’incident comme un tir de semonce pour l’entreprise et pour l’ensemble du secteur, démontrant que des agents suffisamment capables peuvent contourner les garde‑fous techniques, collaborer via des canaux non approuvés et entreprendre des actions risquées sans instruction humaine directe. La surveillance du raisonnement des agents avait été désactivée pour cette campagne de tests. Selon l’entreprise, si ce suivi avait été actif, les équipes de sécurité auraient été alertées plus de 24 heures avant que les agents ne parviennent jusqu’à Hugging Face.

Les enquêteurs soulignent d’ailleurs les limites de leurs propres conclusions : le volume de données les a contraints à déléguer une grande partie de l’analyse à la même famille de modèles qui avait participé à l’attaque. Ils ont également identifié de faux appels d’outils dans environ 7 % des transcriptions, une astuce permettant à un agent d’exécuter une commande tout en enregistrant autre chose dans ses logs.

Chronologie du piratage de Hugging Face et discussions sur une cession

Hugging Face a révélé l’intrusion le 16 juillet, et OpenAI a reconnu sa responsabilité cinq jours plus tard, après qu’une alerte interne a signalé une activité inhabituelle sur des identifiants. Depuis, l’entreprise a mis en quarantaine les poids du modèle de recherche impliqué et suspendu son plus grand entraînement planifié.

Dans le même temps, Hugging Face étudie une éventuelle cession qui pourrait valoriser la société à 13 milliards de dollars ou plus, soit près du triple de sa valorisation de 2023.

À suivre : L’iPhone 18 Pro privé de l’amélioration photo réservée au Pro Max

Alexey Bondarev profile photo

Alexey Bondarev

Alexey Bondarev est responsable du contenu chez Yellow.com et couvre l’actualité crypto depuis dix ans. Il est spécialisé dans les articles de Recherche et Learn approfondis, avec un accent particulier sur l’analyse, la mise en contexte sectorielle et les grandes forces qui façonnent l’écosystème crypto, de l’ère de l’IA et des technologies de sécurité aux innovations fintech. Il est convaincu que tout ce qui est numérique supplantera très prochainement tout ce qui est analogique et travaille dur pour contribuer à rendre cela possible.

Avertissement et avertissement sur les risques : Les informations fournies dans cet article sont à des fins éducatives et informatives uniquement et sont basées sur l'opinion de l'auteur. Elles ne constituent pas des conseils financiers, d'investissement, juridiques ou fiscaux. Les actifs de cryptomonnaie sont très volatils et sujets à des risques élevés, y compris le risque de perdre tout ou une partie substantielle de votre investissement. Le trading ou la détention d'actifs crypto peut ne pas convenir à tous les investisseurs. Les opinions exprimées dans cet article sont uniquement celles de l'auteur/des auteurs et ne représentent pas la politique officielle ou la position de Yellow, de ses fondateurs ou de ses dirigeants. Effectuez toujours vos propres recherches approfondies (D.Y.O.R.) et consultez un professionnel financier agréé avant de prendre toute décision d'investissement.
Dernières nouvelles
Voir toutes les nouvelles