Le chercheur d’Anthropic Jacob Coxon a démissionné cette semaine, invoquant la crainte d’une IA devenue incontrôlable. Le responsable de l’alignement du groupe a réagi en chiffrant à plus de 10 % le risque d’extinction de l’humanité lié à l’IA au cours de cette décennie.
Points clés :
- Jacob Coxon a quitté Anthropic après trois ans de recherche sur le pré-entraînement chez Anthropic et OpenAI, accusant les deux groupes de se livrer à une course vers des systèmes qu’ils ne sauront pas maîtriser.
- Le patron de la recherche en alignement d’Anthropic, Evan Hubinger, évalue désormais à plus de 10 % la probabilité qu’une IA extermine l’humanité d’ici dix ans.
- Hubinger juge les modèles actuels faiblement risqués et concentre son inquiétude sur une dynamique d’auto-amélioration récursive.
Jacob Coxon quitte Anthropic, dénonçant la course à l’IA
Âgé de 27 ans, Coxon a passé trois années à travailler sur le pré-entraînement de modèles au sein d’OpenAI puis d’Anthropic avant d’annoncer sa démission dans un long fil publié sur X tôt mercredi matin. Selon lui, aucune des deux entreprises n’agit de manière responsable : elles se livreraient à une course vers une super-intelligence auto-améliorante, en jouant avec des vies humaines. Son message inaugural a dépassé les 19 millions de vues en quelques heures.
Dans un entretien séparé, il a prévenu que les scénarios les plus agressifs sont désormais en bonne voie et que la situation pourrait leur échapper dès la fin de l’année prochaine. Il affirme que ses collègues emploient désormais des termes comme « crunchtime » et « endgame » pour décrire la trajectoire actuelle.
Formé aux mathématiques, Coxon s’est ensuite tourné vers l’entraînement de modèles. Il avait quitté OpenAI plus tôt cette année pour rejoindre Anthropic, attiré par sa réputation de prudence. Mais, selon lui, les compromis sur la sécurité deviennent inévitables dès lors que les laboratoires entrent en concurrence frontale. Il soutient aujourd’hui qu’aucune entreprise ne peut développer une IA de niveau humain de façon responsable sans intervention de l’État ou sans ralentissement coordonné de l’ensemble du secteur.
À lire aussi : Cours du XRP : le seuil de 1,46 $ visé avec le retour de l’accumulation des « whales » en septembre
Evan Hubinger chiffre le risque d’extinction à plus de 10 %
Evan Hubinger, responsable de la recherche en alignement chez Anthropic et chargé de conduire des « crash tests » sur les modèles du groupe, a répondu en estimant que Coxon décrivait la situation avec justesse. Il évalue désormais à plus de 10 % la probabilité qu’une IA anéantisse l’ensemble de l’humanité dans les dix prochaines années.
Hubinger assure que l’entreprise « fait de son mieux », tout en reconnaissant ne disposer d’aucun plan concret pour résoudre la question de l’alignement à l’échelle d’une super-intelligence, ni d’une trajectoire claire pour y parvenir. Il a par la suite précisé que les modèles actuels présentent, selon lui, un risque faible. Son inquiétude porte plutôt sur l’émergence d’une super-intelligence via un processus d’auto-amélioration récursive, dans lequel les systèmes entraîneraient eux-mêmes leurs successeurs.
Cette estimation relève de son jugement personnel et ne constitue pas une prévision officielle de l’entreprise. De tels chiffres reposent sur des hypothèses très discutées concernant les capacités futures de l’IA et les conditions de son déploiement. Anthropic a répété publiquement que l’auto-amélioration récursive n’est pas inéluctable, même si elle pourrait survenir plus vite que la capacité d’adaptation des institutions, augmentant ainsi le risque d’une perte de contrôle humaine.
Les départs se multiplient dans les équipes de sûreté d’Anthropic
Coxon n’est pas le premier spécialiste de la sécurité à claquer la porte. Mrinank Sharma, qui dirigeait une équipe en charge des garde-fous au sein du groupe, a lui aussi quitté l’entreprise plus tôt cette année, en alertant sur le « péril » qui menacerait le monde, avant d’annoncer son intention d’étudier la poésie au Royaume-Uni.
Fondée en 2021 par d’anciens employés d’OpenAI, Anthropic a bâti sa réputation sur la recherche en sécurité de l’IA. Le groupe n’avait toujours pas publié de réaction officielle à la démission de Coxon mercredi matin.
À suivre : Bitget ajoute des modules blockchain au programme de l’UNICEF touchant plus de 642 000 personnes





