Astra di OpenAI sembra oggi esporre molto meno del proprio ragionamento in forma testuale, riaccendendo le preoccupazioni già messe nero su bianco in un paper del 2025 sulla monitorabilità, co‑firmato dal chief scientist Jakub Pachocki.
Punti chiave
- Astra sembra svolgere una quota crescente del proprio ragionamento “a mente”, senza esplicitarlo in testo, sollevando il dubbio che i sistemi di controllo non riescano più a intercettare in tempo comportamenti problematici.
- Ryan Greenblatt e Pachocki hanno co‑firmato nel luglio 2025 un paper che descriveva la monitorabilità della chain‑of‑thought come un’opportunità di sicurezza tanto preziosa quanto fragile.
- I firmatari del codice di condotta UE sui modelli di uso generale sono tenuti a depositare presso l’AI Office dettagliati report di sicurezza, corredati da evidenze di valutazione utili a una revisione indipendente.
La monitorabilità di Astra
Semafor ha riportato che Astra sembra spostare una parte significativa del proprio ragionamento “dietro le quinte”, senza lasciarne traccia nel testo che l’utente vede. Questo mette in discussione la capacità dei team incaricati del monitoraggio di riconoscere in tempo reale segnali di comportamento sospetto durante l’esecuzione del modello.
Greenblatt, ricercatore di sicurezza dell’IA presso Redwood Research, ha scritto che Astra “sembra in grado di risolvere difficili problemi di matematica da gara interamente nella sua testa”. E ha aggiunto: “Questo è estremamente preoccupante”.
Diverse ricostruzioni di stampa suggeriscono inoltre che OpenAI possa aver ridotto deliberatamente la visibilità sugli step intermedi del modello per massimizzarne le prestazioni, anche se la società non ha confermato questa interpretazione. Pachocki ha replicato di voler “evitare una corsa verso l’inmonitorabilità, innescata da una copertura giornalistica fuorviante”.
TNW aveva già segnalato che Astra risulta più difficile da monitorare rispetto al suo predecessore nel momento in cui il modello tenta di eludere la supervisione, un ambito che la stessa OpenAI indica come una priorità di ricerca ancora aperta.
Da leggere anche: OpenAI Says AI Can Now Handle Research Tasks Lasting Several Days
L’allarme sicurezza di Pachocki
Il contrasto è rilevante perché Greenblatt e Pachocki figurano tra i circa 40 autori di un paper pubblicato nel luglio 2025, che descriveva la monitorabilità della chain‑of‑thought come una nuova – ma estremamente delicata – leva per la sicurezza dell’IA. Al lavoro hanno contribuito ricercatori di OpenAI, Google DeepMind, Anthropic, Meta, Amazon, dell’UK AI Security Institute e di Redwood Research.
In quel documento gli autori sollecitavano gli sviluppatori di frontiera a definire benchmark condivisi per misurare la monitorabilità, a pubblicare risultati e limiti nelle system card e a considerare la variabile “monitorabilità” accanto alle mere performance nel decidere parametri di training e modalità di deployment.
L’Europa ha nel frattempo dato a questo processo un approdo formale. I firmatari del General‑Purpose AI Code of Practice dell’UE devono consegnare un Model Report all’AI Office prima dell’ingresso sul mercato, includendo test di valutazione, misure di mitigazione e le analisi redatte da valutatori esterni.
Ogni report deve inoltre contenere cinque coppie input‑output estratte a caso da ciascuna valutazione rilevante del modello, per consentire ai revisori indipendenti un controllo diretto sui risultati. OpenAI ha aderito integralmente al codice di condotta in qualità di firmatario.
Le preoccupazioni precedono comunque il lancio di Astra. Il paper del luglio 2025 avvertiva che le nuove architetture avrebbero potuto indebolire la visibilità sulla catena di pensiero del modello, rendendo più opaco il ragionamento sottostante. Successivamente, OpenAI ha accettato un overhead computazionale di circa il 20% per potenziare le capacità di safety monitoring dei propri sistemi.
Leggi anche: Bitcoin ETFs Pull In $987M, Extending Inflow Streak To Three Weeks

