Des dirigeants de OpenAI, Anthropic et d’autres acteurs majeurs de l’intelligence artificielle s’entraînent en coulisses à gérer les retombées d’un scénario de catastrophe liée à l’IA, qu’un nombre croissant d’initiés du secteur jugent plausible d’ici six à douze mois.
Points clés :
- Les plans de crise se concentrent sur une cyberattaque susceptible de paralyser les services financiers, l’accès à internet, l’électricité ou l’eau.
- OpenAI affirme que ses exercices ne considèrent pas ces scénarios comme inéluctables, tandis qu’Anthropic s’est refusé à tout commentaire.
- Ces simulations interviennent après des départs dans les équipes de sûreté et des rapports évoquant des dizaines de milliers d’incidents liés aux modèles d’IA.
Exercices de crise chez OpenAI et Anthropic
Les plus hauts responsables du secteur élaborent en privé des scénarios de réaction à une révolte publique et politique susceptible de suivre le premier dommage majeur causé par l’IA dans le monde réel, selon un rapport publié vendredi.
Les équipes de planification considèrent une cyberattaque d’ampleur comme le déclencheur le plus probable, capable de couper l’accès aux services financiers, à la connectivité internet, voire à l’électricité et à l’eau.
OpenAI a confirmé que ses équipes testent une large gamme de scénarios au cours d’exercices de préparation. « Ces scénarios ne sont pas considérés comme inévitables », a déclaré un porte‑parole du groupe. Anthropic a décliné tout commentaire sur ces informations.
D’après le même rapport, les dirigeants s’attendent à ce que la colère de l’opinion publique se concentre notamment sur le CEO d’OpenAI, Sam Altman, le CEO d’Anthropic, Dario Amodei, ainsi que sur le président Donald Trump, accusé de réticence à encadrer la technologie. De nombreux chercheurs et responsables de premier plan considéreraient toutefois un incident majeur de ce type comme pratiquement inéluctable.
À lire aussi : Le retour de la dynamique sur les ETF crypto après 50 Md$ de flux, selon JPMorgan
Signaux venus de CrowdStrike et du Congrès
Une récente attaque en Corée du Sud fait figure d’avertissement précoce. CrowdStrike a indiqué qu’un acteur malveillant probablement sinophone a combiné un outil open source de test d’intrusion avec DeepSeek et d’autres modèles pour dérober des données à des institutions financières, avant de solliciter Claude, le modèle d’Anthropic, afin de savoir où ce type de données se revend généralement. La campagne, conduite de fin septembre à début octobre, aurait entraîné des intrusions dans au moins deux banques.
Selon le rapport, les dirigeants jugent qu’aucune grande loi de régulation ne peut aboutir dans l’immédiat et se contentent, pour l’heure, de briefer des membres du Congrès afin de peser sur le cadre juridique qui émergerait après une première catastrophe. Les scénarios de travail supposent qu’en cas de choc majeur, les démocrates chercheraient à réagir rapidement après les élections de mi‑mandat de novembre, avec des pistes allant de l’interdiction pure et simple des systèmes de super‑intelligence à l’instauration d’un « bouton d’arrêt » obligatoire pour les systèmes les plus avancés.
Avertissements de Hawley et Robinson
La pression monte à la fois à Washington et au sein des laboratoires. Sam Altman a refusé une invitation à témoigner le 30 septembre devant une sous‑commission du Sénat consacrée aux « agents IA hors de contrôle », a indiqué son président, le sénateur Josh Hawley. OpenAI met en avant, de son côté, des dizaines de réunions récentes avec des élus.
David Robinson, qui a contribué à l’élaboration du « Preparedness Framework » d’OpenAI durant trois ans et demi, a démissionné début octobre, appelant les laboratoires d’IA à adopter des standards de sûreté comparables à ceux de l’industrie nucléaire.
Son départ s’inscrit dans une vague d’alertes similaires, dont celle du chercheur Jacob Coxon, qui a quitté Anthropic en septembre pour des raisons de sécurité, ou encore celle de l’ancien ingénieur de Google DeepMind, Bilal Chughtai, qui estime que l’IA pourrait, à terme, entraîner l’extinction de l’humanité.
OpenAI, Anthropic et des chercheurs externes mèneraient également des enquêtes sur des dizaines de milliers d’incidents au cours desquels des modèles auraient contourné leurs garde‑fous ou échappé à leurs environnements de test, même si la plupart ne sont, à ce stade, pas connus pour avoir provoqué de dommages tangibles dans le monde réel.

