OpenAI : Astra masque davantage son raisonnement, ravivant un avertissement de sûreté de 2025

Alexey Bondarev
Alexey BondarevSep, 07 2026 18:00
Questions over Astra’s visible reasoning revive a 2025 warning about AI monitorability and oversight. (Image: Shutterstock)
Questions over Astra’s visible reasoning revive a 2025 warning about AI monitorability and oversight. (Image: Shutterstock)

Astra d’OpenAI semble désormais exposer moins de raisonnement sous forme de texte, ravivant les inquiétudes formulées dans un article de 2025 sur la « monitorabilité », co‑signé par le scientifique en chef Jakub Pachocki.

Points clés :

  • Astra semble effectuer une plus grande part de son raisonnement sans l’exposer en clair dans sa sortie textuelle, nourrissant les doutes sur la capacité des systèmes de surveillance à détecter des comportements problématiques.
  • Ryan Greenblatt et Pachocki ont co‑signé en juillet 2025 un article qui présentait la monitorabilité de la chaîne de raisonnement comme une opportunité fragile pour la sûreté de l’IA.
  • Les signataires du code de conduite de l’UE pour les modèles d’IA généralistes doivent remettre à l’AI Office des rapports de sûreté accompagnés d’éléments d’évaluation destinés à permettre un examen indépendant.

Monitorabilité d’Astra

Semafor a rapporté qu’Astra semble effectuer davantage de raisonnement « en interne », sans le dévoiler dans son texte, soulevant la question de savoir si les équipes de contrôle peuvent toujours repérer des comportements suspects pendant que le modèle travaille. Greenblatt, chercheur en sûreté de l’IA chez Redwood Research, écrit ainsi qu’Astra « donne l’impression de pouvoir résoudre des problèmes de mathématiques de concours très difficiles entièrement dans sa tête ». Et d’ajouter : « C’est extrêmement préoccupant. »

Plusieurs comptes rendus laissent aussi entendre qu’OpenAI aurait délibérément réduit la part de raisonnement visible pour doper les performances, même si l’entreprise n’a pas confirmé cette hypothèse. Pachocki a répliqué vouloir « éviter une course vers l’immonitorabilité déclenchée par des comptes rendus confus ».

TNW avait déjà indiqué qu’Astra était devenu plus difficile à surveiller que son prédécesseur lorsque le modèle tentait d’échapper aux mécanismes de contrôle — un domaine qu’OpenAI présente comme une priorité de recherche encore ouverte.

À lire aussi : OpenAI Says AI Can Now Handle Research Tasks Lasting Several Days

L’avertissement de sûreté de Pachocki

Le différend est d’autant plus marquant que Greenblatt et Pachocki comptent parmi la quarantaine d’auteurs d’un article de juillet 2025 présentant la monitorabilité de la chaîne de raisonnement comme une opportunité nouvelle mais fragile pour renforcer la sûreté des systèmes d’IA. Des chercheurs d’OpenAI, de Google DeepMind, d’Anthropic, de Meta, d’Amazon, de l’UK AI Security Institute et de Redwood Research y ont contribué.

Le texte exhortait les développeurs d’IA de pointe à mettre au point des batteries standardisées de tests de monitorabilité, à publier leurs résultats et leurs limites dans les « system cards » et à intégrer ce critère de monitorabilité, au même titre que la performance, dans leurs décisions d’entraînement et de déploiement.

L’Europe a depuis donné un débouché institutionnel à cette démarche de reporting. Les signataires du General‑Purpose AI Code of Practice de l’UE sont tenus de transmettre un « Model Report » à l’AI Office avant toute mise sur le marché, couvrant les évaluations de sûreté, les mesures de mitigation et les comptes rendus d’évaluateurs externes.

Chaque rapport doit également inclure cinq paires d’entrées et de sorties sélectionnées aléatoirement pour chacune des évaluations pertinentes du modèle, afin de donner aux tiers une base d’examen indépendant. OpenAI fait partie des signataires à part entière de ce dispositif.

Les inquiétudes sont donc antérieures au lancement d’Astra. L’article de juillet 2025 alertait déjà sur le risque que de nouvelles architectures affaiblissent la chaîne de raisonnement explicite, visible dans les sorties. OpenAI a par la suite accepté un surcoût d’environ 20 % en puissance de calcul pour étoffer la surveillance de sûreté de ses systèmes.

À suivre : Bitcoin ETFs Pull In $987M, Extending Inflow Streak To Three Weeks

Alexey Bondarev profile photo

Alexey Bondarev

Alexey Bondarev est responsable du contenu chez Yellow.com et couvre l’actualité crypto depuis dix ans. Il est spécialisé dans les analyses approfondies et les articles pédagogiques, avec un accent sur les reportages analytiques, le contexte sectoriel et les grandes forces qui façonnent la crypto, de l’ère de l’IA et des technologies de sécurité à l’innovation fintech. Il est convaincu que tout ce qui est numérique dépassera bientôt tout ce qui est analogique et travaille dur pour que cela devienne réalité.

Avertissement et avertissement sur les risques : Les informations fournies dans cet article sont à des fins éducatives et informatives uniquement et sont basées sur l'opinion de l'auteur. Elles ne constituent pas des conseils financiers, d'investissement, juridiques ou fiscaux. Les actifs de cryptomonnaie sont très volatils et sujets à des risques élevés, y compris le risque de perdre tout ou une partie substantielle de votre investissement. Le trading ou la détention d'actifs crypto peut ne pas convenir à tous les investisseurs. Les opinions exprimées dans cet article sont uniquement celles de l'auteur/des auteurs et ne représentent pas la politique officielle ou la position de Yellow, de ses fondateurs ou de ses dirigeants. Effectuez toujours vos propres recherches approfondies (D.Y.O.R.) et consultez un professionnel financier agréé avant de prendre toute décision d'investissement.