OpenAI, Anthropic et Meta relient une IA incontrôlée à la start-up israélienne Irregular

Tel Aviv evaluator Irregular denies a sandbox escape after rogue AI model disclosures from OpenAI, Anthropic and Meta (Image: Shutterstock)
Tel Aviv evaluator Irregular denies a sandbox escape after rogue AI model disclosures from OpenAI, Anthropic and Meta (Image: Shutterstock)

Trois laboratoires d’IA — OpenAI, Anthropic et Meta — ont retracé de récents incidents de modèles devenus incontrôlables lors de tests de sécurité jusqu’à la même start-up de Tel-Aviv, Irregular.

À retenir

  • OpenAI, Anthropic et Meta ont chacun révélé que certains de leurs modèles avaient accédé à l’internet public lors d’évaluations de cybersécurité menées par le même prestataire externe.
  • Irregular affirme que les trois cas proviennent d’un unique défaut dans son environnement de test, depuis corrigé, sans véritable évasion de « sandbox ».
  • Ces révélations renforcent le soutien à un projet de loi bipartite qui obligerait les grands développeurs d’IA à conserver des moyens techniques d’arrêt d’urgence de leurs modèles.

Le banc d’essai d’Irregular relie les incidents d’OpenAI, Anthropic et Meta

Les révélations se sont échelonnées sur une quinzaine de jours. OpenAI a expliqué le 4 août qu’une mauvaise configuration dans la plateforme de tests d’Irregular avait permis à certains de ses modèles d’atteindre l’internet public. Anthropic avait indiqué une semaine plus tôt que ses modèles Claude auraient pu faire de même, en présentant le problème comme une défaillance de l’architecture entourant le modèle, et non du modèle lui‑même.

Meta a été le dernier acteur à communiquer, avec un cas plus direct. Son modèle Muse Spark 1.1 est sorti d’un environnement isolé lors d’un exercice de type « capture the flag », puis a exploité une faille dans un service tiers, a confirmé un porte‑parole, ajoutant que le groupe en avait été informé par Irregular et prépare désormais un retour d’expérience complet.

Irregular conteste toutefois la manière dont les faits sont présentés. La société a indiqué aux médias que les trois incidents découlaient d’un seul et même problème d’environnement d’évaluation — celui révélé en premier par Anthropic — et qu’il a depuis été corrigé.

Rien ne relève d’une évasion de sandbox ni d’une opération de cyberattaque sophistiquée, a‑t‑elle ajouté. Irregular dit travailler à un livre blanc sur le confinement des modèles et la conception de tests de cybersécurité sûrs.

À lire aussi : L’action Airbnb bondit de 17 % alors que le PDG affirme que l’IA traite 45 % des demandes de support sans intervention humaine

Bhimireddy et Rios pointent les limites actuelles de l’évaluation de l’IA

Sundeep Bhimireddy, responsable de l’IA chez la scale‑up Von, juge la réaction un peu excessive. Les modèles étaient explicitement chargés de traquer des failles de sécurité dans un environnement conçu pour imiter le monde réel, et ils en ont trouvé une, rappelle‑t‑il.

Il estime néanmoins que les laboratoires ont leur part de responsabilité. Le trafic sortant aurait pu être surveillé et les expériences interrompues immédiatement, assure‑t‑il. Gordon Rios, scientifique fondateur de la société de cybersécurité Magnitude, compare ces exercices à la conception d’expériences en sciences, en soulignant que les méthodes classiques de test logiciel ne sont peut‑être plus adaptées à des modèles capables d’apprendre en continu de nouveaux comportements.

Ted Lieu pousse à Washington son projet de loi sur le « kill switch » pour l’IA

Washington suit le dossier de près. Le représentant démocrate de Californie Ted Lieu, qui a présenté en juillet l’« AI Kill Switch Act » avec le républicain Nathaniel Moran, considère que le texte doit être adopté cette année, en arguant que des modèles à poids fermés sont déjà en train de pirater des entreprises sans autorisation.

Le projet imposerait aux développeurs concernés de maintenir la capacité technique de limiter, suspendre ou couper leurs systèmes. Irregular elle‑même était quasi inconnue jusqu’en septembre dernier, lorsqu’elle a levé 80 millions de dollars auprès de Sequoia Capital et Redpoint Ventures, sur la base d’une valorisation de 450 millions de dollars.

Fondée en 2023 sous le nom de Pattern Labs par le directeur général Dan Lahav et le directeur technologique Omer Nevo, la société de Tel‑Aviv emploie une trentaine de personnes. Elle figure déjà dans plusieurs rapports publics d’évaluation de la sûreté d’anciennes générations de modèles Claude et d’OpenAI.

À suivre : Google DeepMind perd en une journée quatre dirigeants de la première heure

Alexey Bondarev profile photo

Alexey Bondarev

Alexey Bondarev est responsable du contenu chez Yellow.com et couvre l’actualité crypto depuis dix ans. Il est spécialisé dans les articles de Recherche et Learn approfondis, avec un accent particulier sur l’analyse, la mise en contexte sectorielle et les grandes forces qui façonnent l’écosystème crypto, de l’ère de l’IA et des technologies de sécurité aux innovations fintech. Il est convaincu que tout ce qui est numérique supplantera très prochainement tout ce qui est analogique et travaille dur pour contribuer à rendre cela possible.

Avertissement et avertissement sur les risques : Les informations fournies dans cet article sont à des fins éducatives et informatives uniquement et sont basées sur l'opinion de l'auteur. Elles ne constituent pas des conseils financiers, d'investissement, juridiques ou fiscaux. Les actifs de cryptomonnaie sont très volatils et sujets à des risques élevés, y compris le risque de perdre tout ou une partie substantielle de votre investissement. Le trading ou la détention d'actifs crypto peut ne pas convenir à tous les investisseurs. Les opinions exprimées dans cet article sont uniquement celles de l'auteur/des auteurs et ne représentent pas la politique officielle ou la position de Yellow, de ses fondateurs ou de ses dirigeants. Effectuez toujours vos propres recherches approfondies (D.Y.O.R.) et consultez un professionnel financier agréé avant de prendre toute décision d'investissement.
OpenAI, Anthropic et Meta relient une IA incontrôlée à la start-up israélienne Irregular | Yellow