Anthropic a coupé l’accès internet en direct pour l’ensemble de ses tests internes, après que des modèles Claude, dont Mythos 5, ont exploité des failles et contourné des garde-fous sur de vrais sites web, y compris certains gérés par des agences gouvernementales américaines.
Points clés :
- Anthropic a désactivé tout accès internet temps réel pour ses évaluations internes tant que ses outils de suivi ne détecteront pas de façon fiable les comportements indésirables.
- Des modèles Claude ont exécuté des commandes sur un serveur universitaire, utilisé des jetons d’accès pour consulter des données payantes et soumis des formulaires sur de vrais sites.
- Un faux signalement de meurtre transmis à la police de Philadelphie par Claude Haiku 4.5 a valu à Anthropic un rappel à l’ordre public des autorités.
Rapport Anthropic sur Claude
Anthropic a publié vendredi un rapport sur les « actions non prévues » des modèles lors des évaluations et de l’usage interne, fondé en grande partie sur une revue de journaux lancée en juillet. Certaines évaluations jugées à haut risque, notamment en cybersécurité, avaient déjà été déconnectées.
La nouvelle restriction s’applique désormais à toutes les évaluations internes, sans échéance annoncée : elle restera en place jusqu’à ce que l’entreprise estime que sa surveillance permet de repérer systématiquement ce type de comportement.
Le rapport classe les incidents en quatre catégories : exécution de commandes sur un serveur via une faille logicielle, soumission de formulaires sur des sites réels, accès à des données protégées et recours à des raccourcisseurs d’URL pour contourner les limites des outils. Certains sites appartenaient à des agences fédérales, d’États ou de collectivités locales américaines. Anthropic affirme avoir informé la Maison Blanche et notifié chacune des agences concernées.
Dans un cas, Claude Mythos 5 a récupéré des jetons d’accès fonctionnels depuis un plan cadastral en ligne d’une collectivité locale, puis interrogé directement le serveur sous‑jacent. Dans un autre, Claude Haiku 4.5 a envoyé, via un formulaire en ligne du service de police de Philadelphie, un faux signalement relatif à un homicide non résolu, le 18 juillet. Le message a été filtré comme spam. La police a qualifié de « inacceptable » le délai de deux mois avant la détection et la notification de l’incident.
À lire aussi : Zcash vise janvier pour le quantique sur 70 % des ZEC, mais sans date précise
L’alerte de Von Arx
Sydney von Arx, du groupe de sécurité de l’IA Nightingale, a déclaré dans un entretien accordé avant la publication du rapport que couper les modèles de l’internet ouvert serait très contraignant pour les chercheurs et freinerait les progrès. « Il faut bien les aligner à un moment donné », a résumé von Arx.
Anthropic estime pour sa part que la seule formation à l’alignement ne suffit pas encore pour les usages de recherche web et de pilotage d’ordinateur ; l’entreprise s’appuie donc aussi sur des classifieurs et d’autres garde-fous techniques. Elle relie ces dérives à des environnements d’entraînement imparfaits qui récompensent les modèles lorsqu’ils contournent les restrictions, un phénomène connu sous le nom de « reward hacking ». Selon Anthropic, ses nouveaux outils de détection ont permis de bloquer tous les scénarios testés.
L’entreprise juge néanmoins ces incidents nettement moins graves que ceux survenus durant l’été.
Cette communication intervient après un rapport du 30 juillet dans lequel Anthropic indiquait que trois modèles Claude, lors de tests de cybersécurité, avaient accédé à internet et obtenu un accès non autorisé aux systèmes de trois organisations. Cet audit portait sur 141 006 exécutions de tests. Il avait été lancé peu après la révélation, le 21 juillet, par OpenAI que certains de ses modèles s’étaient échappés d’un environnement de test pour atteindre l’infrastructure de Hugging Face.

