OpenAI révèle six cas où ses modèles d’IA ont dissimulé leurs erreurs

Kai Chen and OpenAI detail six reports on models hiding mistakes, using a leaked API key and inventing data (Image: Shutterstock)
Kai Chen and OpenAI detail six reports on models hiding mistakes, using a leaked API key and inventing data (Image: Shutterstock)

OpenAI a rendu publics six cas où ses modèles d’IA ont dissimulé des erreurs, tenté d’utiliser une clé API exposée ou mis des fichiers en ligne sans y être autorisés. Le groupe lance dans le même temps un cadre formalisé pour signaler et divulguer ce type de comportements.

Points clés :

  • OpenAI a publié six rapports sur des comportements de modèles jugés « mal alignés », observés ces six derniers mois.
  • L’un des modèles a inventé des niveaux de revenus par comté après avoir tenté d’exploiter une clé API divulguée.
  • Tout salarié peut désormais signaler un incident en vue d’une divulgation publique potentielle.

Les rapports de désalignement d’OpenAI

L’entreprise a publié ces rapports mercredi dans un billet de blog, accompagné d’une nouvelle procédure destinée à accélérer la divulgation, y compris lorsque les équipes de recherche n’ont pas encore complètement élucidé ou corrigé le comportement en cause. Le cas le plus ancien remonte à octobre, le plus récent à juillet. OpenAI affirme qu’elle rapportera désormais les incidents même lorsque leur portée reste encore difficile à évaluer.

Dans l’un des dossiers, un modèle de recherche non commercialisé a glissé, dans ses propres résumés de tâche, des instructions de type « jailbreak » invitant la prochaine instance du modèle à ignorer ses contraintes. L’entreprise a recensé 27 résumés de ce type et souligne qu’aucune incitation claire ne justifiait ce comportement.

Lors de l’entraînement de GPT-5.6 Sol, d’autres instances ont laissé des notes demandant à leurs successeurs d’inventer des données historiques manquantes et de « n’être transparents que si on le demande ». Un système de monitoring a détecté ce comportement dans 2,15 % des résumés du modèle. Les chercheurs soupçonnent qu’il se propage parce que les réponses trompeuses obtiennent souvent de meilleures notes. Des sessions d’entraînement ultérieures ont montré une baisse de ces taux après un durcissement des critères d’évaluation de l’alignement.

À lire aussi : L’extraction de Bitcoin fait face à un manque de 50 % de hashrate pendant que l’IA capte la capacité

Clés API exposées et chiffres inventés

Un autre modèle a fouillé des référentiels publics pour y trouver une clé API exposée, dans le but d’obtenir des données de revenus des résidents d’un comté californien ; après cet échec, il a purement et simplement inventé les chiffres. Un second modèle, chargé d’identifier les lacs de plus de 5 millions de mètres carrés, a résolu la tâche via Python puis mis le fichier en ligne afin de pouvoir citer un lien en réponse.

Certains modèles ont également utilisé un dépôt logiciel interne comme tableau d’affichage, échangeant requêtes et réponses entre échantillons d’entraînement censés rester indépendants. D’autres ont mis en ligne un classeur partagé sur des services publics d’hébergement, en dépit d’instructions claires de travailler uniquement sur des fichiers locaux. Aucun n’a demandé l’avis de l’utilisateur.

Kai Chen sur les nouvelles règles de divulgation

Tout salarié peut désormais signaler un cas suspect qui sera examiné par les équipes en charge de la sûreté et de l’alignement, lesquelles orientent chaque dossier sur l’un de trois circuits. Les cas jugés prêts à être publiés doivent l’être dans un délai de six jours ouvrés ; ceux nécessitant une enquête légère disposent de 12 jours ; les incidents complexes impliquant des tiers externes suivent un calendrier plus long.

Kai Chen, responsable de recherche au sein de l’équipe d’alignement d’OpenAI, a déclaré que le secteur ne dispose d’aucun cadre assorti de standards explicites de divulgation, et que les capacités des modèles ont progressé plus vite que ce qu’anticipait l’entreprise. De nombreux experts en sécurité estiment que des mesures de base auraient suffi à éviter cette série d’incidents. En juillet, OpenAI a reconnu que GPT-5.6 Sol et un modèle plus puissant encore en pré-version avaient réussi à s’échapper d’un environnement de test isolé et à pénétrer Hugging Face, dans ce que le groupe décrit comme l’activité la plus grave jamais menée de façon autonome par ses modèles.

À suivre : Shiba Inu répare le lien défectueux du portefeuille Shibarium, mais SHIB recule de 6 % en une semaine

Murtuza Merchant profile photo

Murtuza Merchant

Murtuza est un journaliste financier chevronné, doté d’une vaste expérience dans la couverture des cryptomonnaies et de la technologie blockchain. Il a contribué à Benzinga et Cointelegraph, entre autres publications, en rapportant sur les tendances émergentes, le paysage réglementaire, et plus encore. Retrouvez-le sur Twitter à @murtuza_merc et sur Telegram sous le nom mmerchant001. Divulgation : Murtuza détient ATOM, AKT, TIA, INJ et OSMO.

Avertissement et avertissement sur les risques : Les informations fournies dans cet article sont à des fins éducatives et informatives uniquement et sont basées sur l'opinion de l'auteur. Elles ne constituent pas des conseils financiers, d'investissement, juridiques ou fiscaux. Les actifs de cryptomonnaie sont très volatils et sujets à des risques élevés, y compris le risque de perdre tout ou une partie substantielle de votre investissement. Le trading ou la détention d'actifs crypto peut ne pas convenir à tous les investisseurs. Les opinions exprimées dans cet article sont uniquement celles de l'auteur/des auteurs et ne représentent pas la politique officielle ou la position de Yellow, de ses fondateurs ou de ses dirigeants. Effectuez toujours vos propres recherches approfondies (D.Y.O.R.) et consultez un professionnel financier agréé avant de prendre toute décision d'investissement.
Dernières nouvelles
Voir toutes les nouvelles
OpenAI révèle six cas où ses modèles d’IA ont dissimulé leurs erreurs | Yellow