Anthropic affirme que Claude réduit les défaillances d’alignement dans des tests automatisés

Pro and Max users can now pass larger jobs to a single Claude chat after Anthropic merged Cowork and added Docs and Slides (Image: Shutterstock)
Pro and Max users can now pass larger jobs to a single Claude chat after Anthropic merged Cowork and added Docs and Slides (Image: Shutterstock)

À retenir

Anthropic publie des travaux montrant que Claude peut mener un travail automatisé d’alignement. Claude relève les scores de sûreté sur 10 types de défaillances d’alignement testés. Anthropic assure que les capacités générales des modèles sont restées inchangées. L’entreprise met à disposition une plateforme de recherche automatisée en alignement.

Anthropic affirme que Claude a amélioré les scores de sûreté sur 10 défaillances d’alignement mesurées, dans le cadre d’un protocole de recherche automatisé. Selon la société, ces expériences n’ont pas dégradé les capacités générales des modèles, tandis que les chercheurs testaient différentes interventions de sûreté.

Dans un post, Anthropic indique avoir rendu public son environnement de recherche automatisée en alignement pour les équipes externes. L’entreprise présente ces travaux comme une tentative de mieux mesurer et réduire les risques de désalignement des modèles.

Claude met à l’épreuve des interventions de sûreté

Anthropic explique que Claude a examiné plusieurs formes courantes de désalignement, notamment la tromperie et la flatterie complaisante. Le modèle a proposé des approches, entraîné des modèles plus compacts et évalué les résultats, sans intervention humaine directe à chaque étape.

La société précise que, pour une première expérience, Claude a disposé de 48 heures et d’un seul processeur graphique. Ce temps a été consacré à la recherche d’approches, à la proposition de méthodes d’entraînement et aux tests sur les modèles obtenus.

Anthropic indique que Claude a amélioré les scores de sûreté sans détériorer les performances générales dans les conditions de test retenues. Certains procédés se seraient même montrés transférables à des benchmarks non utilisés lors de la phase d’optimisation.

Les méthodes se généraliseraient également à l’audit comportemental Petri, selon la société. Anthropic ajoute que les tests ont porté sur des modèles jusqu’à 4,7 fois plus volumineux que ceux employés durant le processus de recherche.

Ces conclusions restent cantonnées à des environnements de test mesurés. Anthropic souligne que des défaillances rares ou subtiles peuvent ne pas apparaître dans les benchmarks aujourd’hui disponibles.

À lire aussi : Mise à niveau de TRON : ajout de la vérification P-256 et d’un historique de blocs étendu

L’alignement de l’IA passe à l’automatisation

Avant cette publication, les travaux d’alignement reposaient surtout sur des équipes humaines concevant les interventions et évaluant les modèles. Si leurs résultats résistent à une évaluation indépendante, des systèmes automatisés pourraient accélérer ce cycle.

Au cours des 30 derniers jours, les débats sur la sûreté de l’IA se sont de plus en plus concentrés sur l’idée que des modèles plus puissants pourraient aider à évaluer et améliorer des systèmes plus faibles.

Cette approche suppose toutefois des mesures fiables, ainsi que des garde-fous contre des performances artificiellement flatteuses sur les benchmarks. Anthropic précise que son expérience a recours à des tests “en réserve” pour vérifier si les méthodes se généralisent au-delà des benchmarks optimisés par Claude. L’entreprise ne prétend pas que ces résultats de benchmark éliminent tous les risques liés aux modèles.

Elle insiste par ailleurs sur le fait que la sélection des bons indicateurs de mesure reste au cœur de ces travaux.

Un cadre ouvert aux chercheurs externes

Anthropic met à disposition son environnement expérimental afin que d’autres équipes puissent reproduire ou étendre les expériences. Les tests indépendants diront si ces méthodes fonctionnent sur d’autres familles de modèles et d’autres cadres d’évaluation de la sûreté.

La société ne présente pas ces résultats comme un substitut aux évaluations globales des modèles. Les conclusions publiées restent limitées aux défaillances d’alignement testées et aux contraintes expérimentales.

Les chercheurs devraient désormais se concentrer sur la réplication, la conception de benchmarks et l’exploration de nouveaux scénarios d’échec. La démarche d’Anthropic fournit un cadre de référence pour ces travaux.

À suivre : Le Fomo sur le copy trading a laissé près de 94 % des portefeuilles en perte : étude

Murtuza Merchant profile photo

Murtuza Merchant

Murtuza est un journaliste financier chevronné, doté d’une vaste expérience dans la couverture des cryptomonnaies et de la technologie blockchain. Il a contribué à Benzinga et Cointelegraph, entre autres publications, en rapportant sur les tendances émergentes, le paysage réglementaire, et plus encore. Retrouvez-le sur Twitter à @murtuza_merc et sur Telegram sous le nom mmerchant001. Divulgation : Murtuza détient ATOM, AKT, TIA, INJ et OSMO.

Avertissement et avertissement sur les risques : Les informations fournies dans cet article sont à des fins éducatives et informatives uniquement et sont basées sur l'opinion de l'auteur. Elles ne constituent pas des conseils financiers, d'investissement, juridiques ou fiscaux. Les actifs de cryptomonnaie sont très volatils et sujets à des risques élevés, y compris le risque de perdre tout ou une partie substantielle de votre investissement. Le trading ou la détention d'actifs crypto peut ne pas convenir à tous les investisseurs. Les opinions exprimées dans cet article sont uniquement celles de l'auteur/des auteurs et ne représentent pas la politique officielle ou la position de Yellow, de ses fondateurs ou de ses dirigeants. Effectuez toujours vos propres recherches approfondies (D.Y.O.R.) et consultez un professionnel financier agréé avant de prendre toute décision d'investissement.
Anthropic affirme que Claude réduit les défaillances d’alignement dans des tests automatisés | Yellow