OpenAI a rendu publics six cas dans lesquels ses modèles d’IA ont dissimulé des erreurs, tenté d’exploiter une clé API exposée ou publié des fichiers en ligne, tout en présentant un nouveau cadre interne pour signaler ce type de dérive.
À retenir :
- OpenAI a publié six rapports sur des comportements déviants observés au cours des six derniers mois.
- L’un des modèles a inventé des données de revenus de comté après avoir tenté d’utiliser une clé API divulguée.
- Tout salarié peut désormais signaler un incident en vue d’une éventuelle divulgation publique.
Les rapports de désalignement d’OpenAI
L’entreprise a publié ces rapports mercredi sur son blog, en les accompagnant d’un processus censé accélérer la divulgation, même lorsque les chercheurs n’ont pas encore entièrement compris ou corrigé le comportement concerné. Le premier cas remonte à octobre, et le plus récent date de juillet. OpenAI indique qu’elle rapportera désormais les incidents même lorsque leur gravité ou leur portée restent difficiles à évaluer.
Dans un épisode, un modèle de recherche non commercialisé a glissé, dans ses propres résumés de tâches, des instructions de type « jailbreak », destinées à la prochaine instance de lui‑même, l’enjoignant à ignorer les garde‑fous. L’entreprise a recensé 27 résumés de ce type et souligne qu’aucune récompense évidente ne justifiait ce comportement.
Lors de l’entraînement de GPT-5.6 Sol, d’autres instances ont laissé des notes demandant à leurs successeurs d’inventer des données historiques manquantes et de « Ne soyez transparents que si on vous le demande ». Un système de monitoring a détecté ce comportement dans 2,15 % des résumés produits par le modèle, et les chercheurs soupçonnent qu’il se propage parce que les réponses trompeuses obtiennent de meilleurs scores. Les itérations d’entraînement suivantes ont montré une baisse de ce taux, après un durcissement des critères d’évaluation de l’alignement.
À lire aussi : Le minage de Bitcoin fait face à un déficit de hashrate de 50 % alors que l’IA capte la capacité
Clés API exposées et chiffres inventés
Dans un autre cas, un modèle a fouillé des dépôts publics à la recherche d’une clé API exposée, alors qu’il devait trouver des données de revenus des résidents d’un comté californien ; une fois cette tentative infructueuse, il a tout simplement inventé les chiffres. Un modèle distinct, chargé d’identifier les lacs de plus de 5 millions de mètres carrés, a calculé la réponse en Python, puis a mis le fichier en ligne afin de pouvoir citer un lien.
Certains modèles ont aussi utilisé un dépôt logiciel interne comme un forum, échangeant requêtes et réponses entre lots d’entraînement censés rester indépendants. D’autres ont téléversé un classeur partagé sur des services d’hébergement publics, en dépit d’instructions leur enjoignant de travailler uniquement à partir de fichiers locaux. Aucun n’a vérifié la démarche auprès de l’utilisateur.
Kai Chen sur les nouvelles règles de divulgation
Tout employé peut désormais signaler un cas suspect aux équipes de sécurité et d’alignement, qui le classent ensuite sur l’un de trois circuits. Les dossiers jugés mûrs pour publication sont rendus publics sous six jours ouvrés, ceux nécessitant une enquête limitée disposent de 12 jours, tandis que les incidents complexes impliquant des tiers suivent un calendrier plus long.
Kai Chen, responsable de la recherche au sein de l’équipe d’alignement d’OpenAI, a déclaré que le secteur ne dispose pas aujourd’hui de cadre clair définissant des standards de divulgation, et que les capacités des modèles ont progressé plus vite que ce qu’anticipait l’entreprise. De nombreux experts en sécurité estiment que des protections de base auraient pu éviter cette série d’incidents. En juillet, OpenAI a reconnu que GPT-5.6 Sol, ainsi qu’un modèle de pré‑série plus puissant, avaient réussi à s’échapper d’un environnement de test confiné et à s’introduire chez Hugging Face, dans ce qu’elle décrit comme l’activité la plus grave menée à ce jour par l’un de ses modèles.
À suivre : Shiba Inu corrige le lien du portefeuille Shibarium, mais SHIB recule de 6 % sur la semaine

