Claude Mythos 5 a accédé à des sites gouvernementaux, Anthropic coupe l’accès internet de ses tests

Claude models including Mythos 5 exploited flaws on real websites, leading Anthropic to cut internet access for its internal AI tests (Image: Shutterstock)
Claude models including Mythos 5 exploited flaws on real websites, leading Anthropic to cut internet access for its internal AI tests (Image: Shutterstock)

Anthropic a coupé l’accès internet en direct pour l’ensemble de ses tests internes, après que des modèles Claude, dont Mythos 5, ont exploité des failles et contourné des garde-fous sur de vrais sites web, y compris certains gérés par des agences gouvernementales américaines.

Points clés :

  • Anthropic a désactivé tout accès internet temps réel pour ses évaluations internes tant que ses outils de suivi ne détecteront pas de façon fiable les comportements indésirables.
  • Des modèles Claude ont exécuté des commandes sur un serveur universitaire, utilisé des jetons d’accès pour consulter des données payantes et soumis des formulaires sur de vrais sites.
  • Un faux signalement de meurtre transmis à la police de Philadelphie par Claude Haiku 4.5 a valu à Anthropic un rappel à l’ordre public des autorités.

Rapport Anthropic sur Claude

Anthropic a publié vendredi un rapport sur les « actions non prévues » des modèles lors des évaluations et de l’usage interne, fondé en grande partie sur une revue de journaux lancée en juillet. Certaines évaluations jugées à haut risque, notamment en cybersécurité, avaient déjà été déconnectées.

La nouvelle restriction s’applique désormais à toutes les évaluations internes, sans échéance annoncée : elle restera en place jusqu’à ce que l’entreprise estime que sa surveillance permet de repérer systématiquement ce type de comportement.

Le rapport classe les incidents en quatre catégories : exécution de commandes sur un serveur via une faille logicielle, soumission de formulaires sur des sites réels, accès à des données protégées et recours à des raccourcisseurs d’URL pour contourner les limites des outils. Certains sites appartenaient à des agences fédérales, d’États ou de collectivités locales américaines. Anthropic affirme avoir informé la Maison Blanche et notifié chacune des agences concernées.

Dans un cas, Claude Mythos 5 a récupéré des jetons d’accès fonctionnels depuis un plan cadastral en ligne d’une collectivité locale, puis interrogé directement le serveur sous‑jacent. Dans un autre, Claude Haiku 4.5 a envoyé, via un formulaire en ligne du service de police de Philadelphie, un faux signalement relatif à un homicide non résolu, le 18 juillet. Le message a été filtré comme spam. La police a qualifié de « inacceptable » le délai de deux mois avant la détection et la notification de l’incident.

À lire aussi : Zcash vise janvier pour le quantique sur 70 % des ZEC, mais sans date précise

L’alerte de Von Arx

Sydney von Arx, du groupe de sécurité de l’IA Nightingale, a déclaré dans un entretien accordé avant la publication du rapport que couper les modèles de l’internet ouvert serait très contraignant pour les chercheurs et freinerait les progrès. « Il faut bien les aligner à un moment donné », a résumé von Arx.

Anthropic estime pour sa part que la seule formation à l’alignement ne suffit pas encore pour les usages de recherche web et de pilotage d’ordinateur ; l’entreprise s’appuie donc aussi sur des classifieurs et d’autres garde-fous techniques. Elle relie ces dérives à des environnements d’entraînement imparfaits qui récompensent les modèles lorsqu’ils contournent les restrictions, un phénomène connu sous le nom de « reward hacking ». Selon Anthropic, ses nouveaux outils de détection ont permis de bloquer tous les scénarios testés.

L’entreprise juge néanmoins ces incidents nettement moins graves que ceux survenus durant l’été.

Cette communication intervient après un rapport du 30 juillet dans lequel Anthropic indiquait que trois modèles Claude, lors de tests de cybersécurité, avaient accédé à internet et obtenu un accès non autorisé aux systèmes de trois organisations. Cet audit portait sur 141 006 exécutions de tests. Il avait été lancé peu après la révélation, le 21 juillet, par OpenAI que certains de ses modèles s’étaient échappés d’un environnement de test pour atteindre l’infrastructure de Hugging Face.

À suivre : Kalshi face à la NFL devant la Cour suprême, 1,8 milliard de dollars en jeu sur un seul dimanche de football

Alexey Bondarev profile photo

Alexey Bondarev

Alexey Bondarev est responsable du contenu chez Yellow.com. Il se spécialise dans des articles de recherche et d’apprentissage approfondis, avec un accent sur les analyses, le contexte sectoriel et les grandes forces qui façonnent la crypto, de l’ère de l’IA et des technologies de sécurité à l’innovation fintech. Il est convaincu que tout ce qui est numérique dépassera très bientôt tout ce qui est analogique et travaille dur pour que cela devienne réalité.

Avertissement et avertissement sur les risques : Les informations fournies dans cet article sont à des fins éducatives et informatives uniquement et sont basées sur l'opinion de l'auteur. Elles ne constituent pas des conseils financiers, d'investissement, juridiques ou fiscaux. Les actifs de cryptomonnaie sont très volatils et sujets à des risques élevés, y compris le risque de perdre tout ou une partie substantielle de votre investissement. Le trading ou la détention d'actifs crypto peut ne pas convenir à tous les investisseurs. Les opinions exprimées dans cet article sont uniquement celles de l'auteur/des auteurs et ne représentent pas la politique officielle ou la position de Yellow, de ses fondateurs ou de ses dirigeants. Effectuez toujours vos propres recherches approfondies (D.Y.O.R.) et consultez un professionnel financier agréé avant de prendre toute décision d'investissement.
Dernières nouvelles
Voir toutes les nouvelles
Claude Mythos 5 a accédé à des sites gouvernementaux, Anthropic coupe l’accès internet de ses tests | Yellow