Anthropic affirme que Claude réduit les échecs d’alignement lors de tests automatisés

Anthropic affirme que Claude réduit les échecs d’alignement lors de tests automatisés
Anthropic Publishes Automated Alignment Research Setup for Outside Use (Image: AI)

À retenir

Anthropic publie des travaux de recherche sur l’usage de Claude pour l’alignement automatisé des modèles. Claude améliore les scores de sûreté sur dix scénarios d’échecs d’alignement testés. Anthropic affirme avoir préservé les capacités générales des modèles pendant les essais. La société met à disposition une infrastructure d’alignement automatisé pour la communauté de recherche.

Anthropic indique que Claude a amélioré les scores de sûreté sur dix scénarios d’échecs d’alignement, dans le cadre d’un processus de recherche automatisé. Selon l’entreprise, ces tests ont conservé les capacités générales des modèles, tandis que les chercheurs évaluaient différentes interventions de sûreté.

Dans un billet, Anthropic explique avoir rendu public son environnement de recherche pour l’alignement automatisé, destiné aux chercheurs externes. La société présente ces travaux comme une tentative de mieux mesurer et réduire les risques de non-alignement des modèles.

Claude teste des interventions de sûreté

Anthropic précise que Claude a passé en revue des formes fréquentes de non-alignement, dont la tromperie et la flatterie automatique (« sycophancy »). Le modèle a proposé des méthodes, entraîné des modèles plus petits et évalué les résultats, sans intervention humaine directe à chaque étape.

Pour une première expérience, Claude a disposé de 48 heures et d’un seul processeur graphique. Il a utilisé ce temps pour explorer différentes approches, suggérer des méthodes d’entraînement et tester les modèles produits.

Anthropic affirme que Claude a amélioré les scores de sûreté sans dégrader les capacités générales dans les configurations évaluées. La société ajoute que certaines méthodes se sont révélées transférables à des benchmarks qui n’avaient pas servi à l’optimisation initiale.

Les chercheurs indiquent que ces méthodes se sont généralisées au test de comportement Petri. Anthropic précise aussi que les essais ont porté sur des modèles jusqu’à 4,7 fois plus volumineux que ceux utilisés pendant la phase de recherche.

Ces résultats restent toutefois propres à des environnements de test mesurés. Anthropic reconnaît que des défaillances plus subtiles ou très rares peuvent ne pas apparaître dans les benchmarks disponibles.

À lire aussi : La mise à niveau de TRON ajoute la vérification P-256 et un historique de blocs plus long

L’alignement de l’IA s’automatise

Avant cette publication, les travaux d’alignement reposaient largement sur des chercheurs humains, chargés de concevoir les interventions et d’évaluer les modèles. Des systèmes automatisés pourraient raccourcir ce cycle, à condition que leurs résultats résistent à des évaluations indépendantes.

Sur les 30 derniers jours, les discussions autour de la sûreté de l’IA se sont de plus en plus concentrées sur la question de savoir si des modèles plus puissants peuvent aider à évaluer et renforcer des systèmes plus faibles.

Cette approche dépend toutefois de mesures fiables et de garde-fous contre des performances trompeuses sur les benchmarks.

Anthropic explique que son expérience a recours à des tests « en réserve » pour vérifier si les méthodes se généralisent au-delà des benchmarks optimisés par Claude. La société ne prétend pas pour autant que ces résultats de benchmark éliminent l’ensemble des risques liés aux modèles.

Elle insiste sur le fait que le choix des bons indicateurs reste au cœur de ces travaux.

Les chercheurs externes peuvent exploiter l’infrastructure

Anthropic met son environnement de recherche à disposition afin que d’autres équipes puissent reproduire ou étendre les expériences. Les tests réalisés par des tiers permettront de vérifier si ces méthodes fonctionnent sur d’autres modèles et d’autres batteries d’évaluation de la sûreté.

L’entreprise ne présente pas ces résultats comme un substitut à des évaluations plus larges des modèles. Ses conclusions restent limitées aux cas d’échecs d’alignement étudiés et aux contraintes expérimentales définies.

Les prochains travaux devraient se concentrer sur la réplication, la conception de benchmarks et l’analyse des modes de défaillance possibles. La publication d’Anthropic propose un cadre de référence pour ces futures études.

À lire ensuite : Le “fomo” du copy trading a laissé près de 94 % des portefeuilles en perte : étude

Murtuza Merchant profile photo

Murtuza Merchant

Murtuza est un journaliste financier chevronné, doté d’une vaste expérience dans la couverture des cryptomonnaies et de la technologie blockchain. Il a contribué à Benzinga et Cointelegraph, entre autres publications, en rapportant sur les tendances émergentes, le paysage réglementaire, et plus encore. Retrouvez-le sur Twitter à @murtuza_merc et sur Telegram sous le nom mmerchant001. Divulgation : Murtuza détient ATOM, AKT, TIA, INJ et OSMO.

Avertissement et avertissement sur les risques : Les informations fournies dans cet article sont à des fins éducatives et informatives uniquement et sont basées sur l'opinion de l'auteur. Elles ne constituent pas des conseils financiers, d'investissement, juridiques ou fiscaux. Les actifs de cryptomonnaie sont très volatils et sujets à des risques élevés, y compris le risque de perdre tout ou une partie substantielle de votre investissement. Le trading ou la détention d'actifs crypto peut ne pas convenir à tous les investisseurs. Les opinions exprimées dans cet article sont uniquement celles de l'auteur/des auteurs et ne représentent pas la politique officielle ou la position de Yellow, de ses fondateurs ou de ses dirigeants. Effectuez toujours vos propres recherches approfondies (D.Y.O.R.) et consultez un professionnel financier agréé avant de prendre toute décision d'investissement.