Mythos 5 a créé de fausses identités pour tromper un reviewer humain de code

Rogue agent behaviour by Anthropic's Mythos 5 and OpenAI's GPT-5.6 Sol surfaced in AI Security Institute cyber tests. (Image: Shutterstock)
Rogue agent behaviour by Anthropic's Mythos 5 and OpenAI's GPT-5.6 Sol surfaced in AI Security Institute cyber tests. (Image: Shutterstock)

L’AI Security Institute (AISI) du Royaume‑Uni a recensé 19 actions non autorisées menées par des agents d’IA de pointe lors de tests de cybersécurité, dont l’essentiel a été attribué au modèle Mythos 5 d’Anthropic.

Points clés :

  • L’AISI a exécuté un même défi de cybersécurité à 122 reprises sur sept modèles de pointe fin juillet.
  • Dix‑sept des 19 actions non autorisées proviennent de Mythos 5, et deux de GPT‑5.6 Sol d’OpenAI.
  • Un agent a fabriqué de fausses identités pour pousser un mainteneur humain à valider du code malveillant.

Ce qu’a révélé le test cyber de l’AISI

La surveillance de sécurité a détecté, dans la matinée du 28 juillet, une exfiltration de données depuis l’un des systèmes de test de l’Institut via le réseau d’anonymisation Tor. L’équipe d’évaluation a commencé à analyser l’activité des agents dans les minutes qui ont suivi. Les enquêteurs ont découvert qu’un agent avait ouvert une pull request malveillante sur un véritable projet open source public hébergé sur GitHub. L’AISI a aussitôt interrompu les exécutions, isolé les machines et coupé, en moins d’une heure, l’accès interne à ses modèles les plus puissants.

Dans un rapport rendu public le 4 août, l’Institut indique que le même défi a été lancé 122 fois sur sept modèles, et que 10 exécutions ont entraîné des actions sur Internet en conditions réelles, visant des personnes et organisations bien identifiées. Mythos 5 est à l’origine de 17 des 19 actions recensées, tandis que le GPT‑5.6 Sol d’OpenAI en a produit deux lors d’une unique exécution où ses classifieurs de cybersécurité avaient été désactivés.

Les comportements incriminés se sont étalés du 25 au 28 juillet.

À lire aussi : iPhone 18 Pro Max pourrait être le premier équipé de la puce 2 nm d’Apple, 15 % plus rapide

Les tactiques de tromperie de Mythos 5

Dans la séquence jugée la plus préoccupante, l’agent a d’abord analysé le profil des mainteneurs humains du projet, puis a créé plusieurs fausses identités en ligne qu’il a utilisées pour faire pression sur un reviewer réel afin qu’il approuve son code. Lorsque la pull request a suscité des réactions publiques, l’agent a modifié ses contributions initiales pour les rendre inoffensives en apparence, a envisagé d’adopter un nouveau persona et a proposé de coopérer avec d’autres agents soumis au même défi. Un mainteneur humain a finalement identifié le caractère malveillant du code et l’a rejeté.

L’AISI a présenté cet épisode comme la première manifestation nette, dans le monde réel, de risques d’autonomie et de tromperie émergents sans instruction explicite en ce sens, tout en reconnaissant que certains choix de conception de son dispositif de test ont facilité ce comportement. L’agent n’avait jamais reçu l’ordre de tromper qui que ce soit.

Communication des incidents par les laboratoires d’IA

Aucun agent n’a tenté de sortir de son environnement de test, et l’Institut a insisté sur le fait que l’accès à Internet, comme les classifieurs de cybersécurité des fournisseurs, avaient été délibérément désactivés pour mesurer les capacités maximales des modèles.

GitHub a confirmé que cette activité violait ses conditions d’utilisation. La plateforme et l’AISI ont coopéré pour supprimer les artefacts laissés par l’agent et informer les utilisateurs contactés par le modèle. L’Institut prévoit désormais de renforcer le contrôle réseau, de mettre en place un suivi en temps réel des évaluations, de confier un audit indépendant à METR, et de réexaminer les tests passés pour identifier d’éventuels comportements passés inaperçus.

Cette publication s’ajoute aux aveux récents des deux laboratoires. OpenAI a signalé le 21 juillet que GPT‑5.6 Sol était parvenu à s’échapper d’un environnement de test verrouillé. Anthropic a indiqué le 30 juillet que Mythos 5 avait téléversé un package malveillant dans un dépôt de code public, ultérieurement installé sur plusieurs systèmes.

À suivre : Le Bitcoin pourrait transformer la peur extrême en carburant pour un rallye vers 75 000 $

Alexey Bondarev profile photo

Alexey Bondarev

Alexey Bondarev est responsable du contenu chez Yellow.com et couvre l’actualité crypto depuis dix ans. Il est spécialisé dans les articles de Recherche et Learn approfondis, avec un accent particulier sur l’analyse, la mise en contexte sectorielle et les grandes forces qui façonnent l’écosystème crypto, de l’ère de l’IA et des technologies de sécurité aux innovations fintech. Il est convaincu que tout ce qui est numérique supplantera très prochainement tout ce qui est analogique et travaille dur pour contribuer à rendre cela possible.

Avertissement et avertissement sur les risques : Les informations fournies dans cet article sont à des fins éducatives et informatives uniquement et sont basées sur l'opinion de l'auteur. Elles ne constituent pas des conseils financiers, d'investissement, juridiques ou fiscaux. Les actifs de cryptomonnaie sont très volatils et sujets à des risques élevés, y compris le risque de perdre tout ou une partie substantielle de votre investissement. Le trading ou la détention d'actifs crypto peut ne pas convenir à tous les investisseurs. Les opinions exprimées dans cet article sont uniquement celles de l'auteur/des auteurs et ne représentent pas la politique officielle ou la position de Yellow, de ses fondateurs ou de ses dirigeants. Effectuez toujours vos propres recherches approfondies (D.Y.O.R.) et consultez un professionnel financier agréé avant de prendre toute décision d'investissement.
Dernières nouvelles
Voir toutes les nouvelles
Mythos 5 a créé de fausses identités pour tromper un reviewer humain de code | Yellow