OpenAI Astra riduce la tracciabilità del ragionamento e riaccende l’allarme sicurezza del 2025

Questions over Astra’s visible reasoning revive a 2025 warning about AI monitorability and oversight. (Image: Shutterstock)
Questions over Astra’s visible reasoning revive a 2025 warning about AI monitorability and oversight. (Image: Shutterstock)

Astra di OpenAI sembra oggi esporre molto meno del proprio ragionamento in forma testuale, riaccendendo le preoccupazioni già messe nero su bianco in un paper del 2025 sulla monitorabilità, co‑firmato dal chief scientist Jakub Pachocki.

Punti chiave

  • Astra sembra svolgere una quota crescente del proprio ragionamento “a mente”, senza esplicitarlo in testo, sollevando il dubbio che i sistemi di controllo non riescano più a intercettare in tempo comportamenti problematici.
  • Ryan Greenblatt e Pachocki hanno co‑firmato nel luglio 2025 un paper che descriveva la monitorabilità della chain‑of‑thought come un’opportunità di sicurezza tanto preziosa quanto fragile.
  • I firmatari del codice di condotta UE sui modelli di uso generale sono tenuti a depositare presso l’AI Office dettagliati report di sicurezza, corredati da evidenze di valutazione utili a una revisione indipendente.

La monitorabilità di Astra

Semafor ha riportato che Astra sembra spostare una parte significativa del proprio ragionamento “dietro le quinte”, senza lasciarne traccia nel testo che l’utente vede. Questo mette in discussione la capacità dei team incaricati del monitoraggio di riconoscere in tempo reale segnali di comportamento sospetto durante l’esecuzione del modello.

Greenblatt, ricercatore di sicurezza dell’IA presso Redwood Research, ha scritto che Astra “sembra in grado di risolvere difficili problemi di matematica da gara interamente nella sua testa”. E ha aggiunto: “Questo è estremamente preoccupante”.

Diverse ricostruzioni di stampa suggeriscono inoltre che OpenAI possa aver ridotto deliberatamente la visibilità sugli step intermedi del modello per massimizzarne le prestazioni, anche se la società non ha confermato questa interpretazione. Pachocki ha replicato di voler “evitare una corsa verso l’inmonitorabilità, innescata da una copertura giornalistica fuorviante”.

TNW aveva già segnalato che Astra risulta più difficile da monitorare rispetto al suo predecessore nel momento in cui il modello tenta di eludere la supervisione, un ambito che la stessa OpenAI indica come una priorità di ricerca ancora aperta.

Da leggere anche: OpenAI Says AI Can Now Handle Research Tasks Lasting Several Days

L’allarme sicurezza di Pachocki

Il contrasto è rilevante perché Greenblatt e Pachocki figurano tra i circa 40 autori di un paper pubblicato nel luglio 2025, che descriveva la monitorabilità della chain‑of‑thought come una nuova – ma estremamente delicata – leva per la sicurezza dell’IA. Al lavoro hanno contribuito ricercatori di OpenAI, Google DeepMind, Anthropic, Meta, Amazon, dell’UK AI Security Institute e di Redwood Research.

In quel documento gli autori sollecitavano gli sviluppatori di frontiera a definire benchmark condivisi per misurare la monitorabilità, a pubblicare risultati e limiti nelle system card e a considerare la variabile “monitorabilità” accanto alle mere performance nel decidere parametri di training e modalità di deployment.

L’Europa ha nel frattempo dato a questo processo un approdo formale. I firmatari del General‑Purpose AI Code of Practice dell’UE devono consegnare un Model Report all’AI Office prima dell’ingresso sul mercato, includendo test di valutazione, misure di mitigazione e le analisi redatte da valutatori esterni.

Ogni report deve inoltre contenere cinque coppie input‑output estratte a caso da ciascuna valutazione rilevante del modello, per consentire ai revisori indipendenti un controllo diretto sui risultati. OpenAI ha aderito integralmente al codice di condotta in qualità di firmatario.

Le preoccupazioni precedono comunque il lancio di Astra. Il paper del luglio 2025 avvertiva che le nuove architetture avrebbero potuto indebolire la visibilità sulla catena di pensiero del modello, rendendo più opaco il ragionamento sottostante. Successivamente, OpenAI ha accettato un overhead computazionale di circa il 20% per potenziare le capacità di safety monitoring dei propri sistemi.

Leggi anche: Bitcoin ETFs Pull In $987M, Extending Inflow Streak To Three Weeks

Alexey Bondarev profile photo

Alexey Bondarev

Alexey Bondarev è il Responsabile dei Contenuti di Yellow.com e negli ultimi 10 anni ha seguito il settore crypto. È specializzato in approfondite ricerche e articoli educativi (“Research and Learn”), con un focus su analisi, contesto di settore e sulle grandi forze che plasmano il mondo delle criptovalute, dall’era dell’IA e le tecnologie di sicurezza fino all’innovazione fintech. Crede che tutto ciò che è digitale supererà presto tutto ciò che è analogico e lavora duramente per contribuire a rendere ciò realtà.

Disclaimer e avvertenza sui rischi: Le informazioni fornite in questo articolo sono solo per scopi educativi e informativi e sono basate sull'opinione dell'autore. Non costituiscono consulenza finanziaria, di investimento, legale o fiscale. Gli asset di criptovaluta sono altamente volatili e soggetti ad alto rischio, incluso il rischio di perdere tutto o una parte sostanziale del tuo investimento. Il trading o il possesso di asset crypto potrebbe non essere adatto a tutti gli investitori. Le opinioni espresse in questo articolo sono esclusivamente quelle dell'autore/autori e non rappresentano la politica ufficiale o la posizione di Yellow, dei suoi fondatori o dei suoi dirigenti. Conduci sempre la tua ricerca approfondita (D.Y.O.R.) e consulta un professionista finanziario autorizzato prima di prendere qualsiasi decisione di investimento.
OpenAI Astra riduce la tracciabilità del ragionamento e riaccende l’allarme sicurezza del 2025 | Yellow