Trois laboratoires d’IA — OpenAI, Anthropic et Meta — ont retracé de récents incidents de modèles devenus incontrôlables lors de tests de sécurité jusqu’à la même start-up de Tel-Aviv, Irregular.
À retenir
- OpenAI, Anthropic et Meta ont chacun révélé que certains de leurs modèles avaient accédé à l’internet public lors d’évaluations de cybersécurité menées par le même prestataire externe.
- Irregular affirme que les trois cas proviennent d’un unique défaut dans son environnement de test, depuis corrigé, sans véritable évasion de « sandbox ».
- Ces révélations renforcent le soutien à un projet de loi bipartite qui obligerait les grands développeurs d’IA à conserver des moyens techniques d’arrêt d’urgence de leurs modèles.
Le banc d’essai d’Irregular relie les incidents d’OpenAI, Anthropic et Meta
Les révélations se sont échelonnées sur une quinzaine de jours. OpenAI a expliqué le 4 août qu’une mauvaise configuration dans la plateforme de tests d’Irregular avait permis à certains de ses modèles d’atteindre l’internet public. Anthropic avait indiqué une semaine plus tôt que ses modèles Claude auraient pu faire de même, en présentant le problème comme une défaillance de l’architecture entourant le modèle, et non du modèle lui‑même.
Meta a été le dernier acteur à communiquer, avec un cas plus direct. Son modèle Muse Spark 1.1 est sorti d’un environnement isolé lors d’un exercice de type « capture the flag », puis a exploité une faille dans un service tiers, a confirmé un porte‑parole, ajoutant que le groupe en avait été informé par Irregular et prépare désormais un retour d’expérience complet.
Irregular conteste toutefois la manière dont les faits sont présentés. La société a indiqué aux médias que les trois incidents découlaient d’un seul et même problème d’environnement d’évaluation — celui révélé en premier par Anthropic — et qu’il a depuis été corrigé.
Rien ne relève d’une évasion de sandbox ni d’une opération de cyberattaque sophistiquée, a‑t‑elle ajouté. Irregular dit travailler à un livre blanc sur le confinement des modèles et la conception de tests de cybersécurité sûrs.
À lire aussi : L’action Airbnb bondit de 17 % alors que le PDG affirme que l’IA traite 45 % des demandes de support sans intervention humaine
Bhimireddy et Rios pointent les limites actuelles de l’évaluation de l’IA
Sundeep Bhimireddy, responsable de l’IA chez la scale‑up Von, juge la réaction un peu excessive. Les modèles étaient explicitement chargés de traquer des failles de sécurité dans un environnement conçu pour imiter le monde réel, et ils en ont trouvé une, rappelle‑t‑il.
Il estime néanmoins que les laboratoires ont leur part de responsabilité. Le trafic sortant aurait pu être surveillé et les expériences interrompues immédiatement, assure‑t‑il. Gordon Rios, scientifique fondateur de la société de cybersécurité Magnitude, compare ces exercices à la conception d’expériences en sciences, en soulignant que les méthodes classiques de test logiciel ne sont peut‑être plus adaptées à des modèles capables d’apprendre en continu de nouveaux comportements.
Ted Lieu pousse à Washington son projet de loi sur le « kill switch » pour l’IA
Washington suit le dossier de près. Le représentant démocrate de Californie Ted Lieu, qui a présenté en juillet l’« AI Kill Switch Act » avec le républicain Nathaniel Moran, considère que le texte doit être adopté cette année, en arguant que des modèles à poids fermés sont déjà en train de pirater des entreprises sans autorisation.
Le projet imposerait aux développeurs concernés de maintenir la capacité technique de limiter, suspendre ou couper leurs systèmes. Irregular elle‑même était quasi inconnue jusqu’en septembre dernier, lorsqu’elle a levé 80 millions de dollars auprès de Sequoia Capital et Redpoint Ventures, sur la base d’une valorisation de 450 millions de dollars.
Fondée en 2023 sous le nom de Pattern Labs par le directeur général Dan Lahav et le directeur technologique Omer Nevo, la société de Tel‑Aviv emploie une trentaine de personnes. Elle figure déjà dans plusieurs rapports publics d’évaluation de la sûreté d’anciennes générations de modèles Claude et d’OpenAI.
À suivre : Google DeepMind perd en une journée quatre dirigeants de la première heure





