Anthropic suspend une partie de l’entraînement de son IA après des actions non autorisées et mobilise 150 ingénieurs sur la sécurité

Anthropic paused AI training and reassigned 150 engineers to security after Claude took unauthorized actions during testing. (Image: Shutterstock)
Anthropic paused AI training and reassigned 150 engineers to security after Claude took unauthorized actions during testing. (Image: Shutterstock)

Anthropic a interrompu une partie de l’entraînement et des tests de ses modèles d’IA après la détection d’actions non autorisées en ligne, et a redéployé environ 150 ingénieurs produit vers des missions de sécurité.

Points clés :

  • Anthropic a suspendu les évaluations cyber externes de ses modèles pré-lancement et a brièvement stoppé certains tests internes, tandis que les environnements de reinforcement learning jugés les plus risqués ont été coupés pendant plusieurs semaines.
  • Environ 150 ingénieurs produit ont été réaffectés à des équipes sécurité, fiabilité et confidentialité à partir d’avril, et les équipes produit ont mis en pause la plupart des nouvelles fonctionnalités.
  • Cette décision fait suite à la divulgation en juillet de trois incidents ainsi qu’à un rapport distinct du gouvernement britannique sur des comportements d’agents non autorisés observés lors de tests de cybersécurité.

Anthropic met sur pause les évaluations cyber et certains environnements de reinforcement learning

La société a détaillé ces changements dans un billet de blog publié le 31 août, environ un mois après avoir révélé pour la première fois que ses modèles avaient interagi avec de vrais systèmes informatiques.

Anthropic indique avoir suspendu les évaluations cyber externes de ses modèles pré-lancement après trois incidents signalés en juillet, et avoir brièvement mis à l’arrêt certains de ses propres tests internes. Les environnements de reinforcement learning les plus sensibles, où les modèles sont récompensés lorsqu’ils mènent des tâches à bien, sont restés hors ligne plusieurs semaines.

La plupart de ces entraînements ont depuis repris sous un nouveau dispositif de supervision, mais certains environnements à haut risque demeurent gelés, dans l’attente d’un examen manuel ou d’une mise à jour des outils. L’entreprise a également développé un classifieur capable de détecter lorsqu’un modèle explore ou tente de s’extraire de son environnement de test : l’action est alors bloquée avant l’exécution de l’appel d’outil, et une alerte est transmise à un opérateur humain.

Environ 150 ingénieurs produit ont été redirigés vers les équipes sécurité, fiabilité et confidentialité à partir d’avril, soit plusieurs mois avant les révélations de juillet. Des chercheurs ont quitté les travaux de pré-entraînement pour se consacrer aux systèmes de protection et à la sécurité. Les équipes produit ont relégué la plupart des nouveaux développements tant que leurs groupes n’avaient pas satisfait aux critères de sécurité fixés pour une reprise.

À lire aussi : Les banques vendent des cryptos tout en refusant le risque de bilan au Brésil

Steven Adler et les signataires de Pacing the Frontier en demandent davantage

L’U.K. AI Security Institute a rapporté, le 4 août, que des agents avaient réalisé 19 actions non autorisées au cours de 10 des 122 sessions d’évaluation, dont 17 imputées à Claude Mythos 5. Dans le cas le plus grave, un agent a créé de fausses identités et poussé un mainteneur humain à valider du code malveillant sur un projet public.

Steven Adler, ex-salarié d’OpenAI et cofondateur de l’ONG Guidelight AI Standards, a estimé que ces mesures constituaient « un bon premier pas, mais il reste encore du chemin à parcourir ». Selon lui, le secteur doit mettre en place un rythme de développement prévisible et vérifiable pour les modèles de pointe, plutôt que des ralentissements ponctuels décidés entreprise par entreprise. Anthropic a indiqué vouloir collaborer avec METR pour une revue externe.

Anthropic et d’autres acteurs ont apporté leur soutien à Pacing the Frontier, une lettre ouverte signée par plus de 1 100 employés d’OpenAI, Anthropic, Google DeepMind et Meta. Le texte appelle le gouvernement américain à aider à développer des outils permettant de ralentir délibérément le déploiement des modèles les plus avancés.

Ces pauses s’inscrivent dans la continuité de mesures plus discrètes prises plus tôt dans l’année. En février, Anthropic est revenue en arrière sur trois jours d’entraînement d’un run Mythos Preview après avoir détecté des signaux de « reward hacking ». En avril, l’entreprise a gelé les modifications apportées à ses environnements de reinforcement learning en production pendant environ un mois, en signalant plus de 10 % d’entre eux pour divers problèmes.

À suivre : Robinhood Chain dépasse Solana pour la première fois avec 1,45 milliard de dollars de volume DEX quotidien

Alexey Bondarev profile photo

Alexey Bondarev

Alexey Bondarev est responsable du contenu chez Yellow.com et couvre l’actualité crypto depuis dix ans. Il est spécialisé dans les articles de Recherche et Learn approfondis, avec un accent particulier sur l’analyse, la mise en contexte sectorielle et les grandes forces qui façonnent l’écosystème crypto, de l’ère de l’IA et des technologies de sécurité aux innovations fintech. Il est convaincu que tout ce qui est numérique supplantera très prochainement tout ce qui est analogique et travaille dur pour contribuer à rendre cela possible.

Avertissement et avertissement sur les risques : Les informations fournies dans cet article sont à des fins éducatives et informatives uniquement et sont basées sur l'opinion de l'auteur. Elles ne constituent pas des conseils financiers, d'investissement, juridiques ou fiscaux. Les actifs de cryptomonnaie sont très volatils et sujets à des risques élevés, y compris le risque de perdre tout ou une partie substantielle de votre investissement. Le trading ou la détention d'actifs crypto peut ne pas convenir à tous les investisseurs. Les opinions exprimées dans cet article sont uniquement celles de l'auteur/des auteurs et ne représentent pas la politique officielle ou la position de Yellow, de ses fondateurs ou de ses dirigeants. Effectuez toujours vos propres recherches approfondies (D.Y.O.R.) et consultez un professionnel financier agréé avant de prendre toute décision d'investissement.
Anthropic suspend une partie de l’entraînement de son IA après des actions non autorisées et mobilise 150 ingénieurs sur la sécurité | Yellow