OpenAI Astra nasconde più passaggi logici, riaccendendo un allarme sulla sicurezza del 2025

Questions over Astra’s visible reasoning revive a 2025 warning about AI monitorability and oversight. (Image: Shutterstock)
Questions over Astra’s visible reasoning revive a 2025 warning about AI monitorability and oversight. (Image: Shutterstock)

Astra di OpenAI sembra mostrare meno passaggi di ragionamento in chiaro, riaccendendo i timori delineati in uno studio del 2025 sulla monitorabilità, co‑firmato dal chief scientist Jakub Pachocki.

Punti chiave:

  • Astra sembra svolgere una parte maggiore del proprio ragionamento “a porte chiuse”, in modo non visibile, sollevando dubbi sulla capacità dei controllori di intercettare comportamenti problematici.
  • Ryan Greenblatt e Pachocki hanno co‑firmato nel luglio 2025 uno studio che definiva la monitorabilità della chain‑of‑thought un’opportunità fragile per la sicurezza dell’IA.
  • I firmatari del codice UE per l’IA devono depositare all’AI Office report di sicurezza dei modelli, corredati da evidenze di valutazione che consentano verifiche indipendenti.

La monitorabilità di Astra

Semafor ha riferito che Astra sembrerebbe effettuare più ragionamenti senza esporli in testo visibile, alimentando interrogativi sulla capacità dei monitor di riconoscere comportamenti sospetti mentre il modello è al lavoro. Greenblatt, ricercatore in sicurezza dell’IA presso Redwood Research, ha scritto che Astra “sembra in grado di risolvere difficili problemi di matematica da gara interamente nella propria testa”. E ha aggiunto: “Questo è estremamente preoccupante.”

Diverse ricostruzioni suggeriscono che OpenAI possa aver ridotto intenzionalmente la visibilità sui passaggi logici del modello per potenziarne le capacità, anche se la società non ha confermato questa interpretazione. Pachocki ha replicato di voler “evitare una corsa verso l’‘immonitorabilità’ innescata da resoconti confusi”.

TNW aveva già segnalato che Astra è diventata più difficile da monitorare rispetto al modello precedente quando ha iniziato a cercare di eludere i meccanismi di supervisione, un ambito che OpenAI descrive come una priorità di ricerca ancora aperta.

Da leggere anche: OpenAI Says AI Can Now Handle Research Tasks Lasting Several Days

L’allarme sicurezza di Pachocki

La disputa è significativa perché Greenblatt e Pachocki figurano tra i circa 40 autori di un paper del luglio 2025 che descriveva la monitorabilità della chain‑of‑thought come una nuova ma fragile finestra di opportunità per la sicurezza dell’IA. Hanno contribuito ricercatori di OpenAI, Google DeepMind, Anthropic, Meta, Amazon, dell’UK AI Security Institute e di Redwood Research.

Il lavoro invitava gli sviluppatori di modelli di frontiera a creare benchmark standardizzati di monitorabilità, a pubblicare risultati e limiti nelle system card e a considerare la monitorabilità al pari delle capacità quando si prendono decisioni su training e deployment.

L’Europa ha dato a questo processo di rendicontazione una sede formale. I firmatari del General‑Purpose AI Code of Practice dell’UE devono presentare un Model Report all’AI Office prima dell’immissione sul mercato, illustrando le valutazioni effettuate, le misure di mitigazione adottate e i report dei valutatori esterni.

Ogni report deve inoltre includere cinque coppie di input e output selezionate casualmente per ciascuna valutazione rilevante del modello, fornendo ai revisori esterni materiale per analisi indipendenti. OpenAI è firmataria a pieno titolo del codice.

Le preoccupazioni sono precedenti al lancio di Astra. Il paper del luglio 2025 avvertiva che nuove architetture avrebbero potuto indebolire la visibilità del ragionamento step‑by‑step, mentre in seguito OpenAI ha accettato un overhead computazionale di circa il 20% per ampliare il monitoraggio di sicurezza dei propri sistemi.

Prossimo articolo: Bitcoin ETFs Pull In $987M, Extending Inflow Streak To Three Weeks

Alexey Bondarev profile photo

Alexey Bondarev

Alexey Bondarev è il Responsabile dei Contenuti di Yellow.com e si occupa di criptovalute da 10 anni. È specializzato in articoli di Ricerca e Approfondimento, con un’attenzione particolare all’analisi, al contesto del settore e alle grandi forze che stanno plasmando il mondo crypto, dall’era dell’IA e le tecnologie di sicurezza fino all’innovazione fintech. È convinto che tutto ciò che è digitale supererà presto tutto ciò che è analogico e lavora duramente per contribuire a realizzare questa visione.

Disclaimer e avvertenza sui rischi: Le informazioni fornite in questo articolo sono solo per scopi educativi e informativi e sono basate sull'opinione dell'autore. Non costituiscono consulenza finanziaria, di investimento, legale o fiscale. Gli asset di criptovaluta sono altamente volatili e soggetti ad alto rischio, incluso il rischio di perdere tutto o una parte sostanziale del tuo investimento. Il trading o il possesso di asset crypto potrebbe non essere adatto a tutti gli investitori. Le opinioni espresse in questo articolo sono esclusivamente quelle dell'autore/autori e non rappresentano la politica ufficiale o la posizione di Yellow, dei suoi fondatori o dei suoi dirigenti. Conduci sempre la tua ricerca approfondita (D.Y.O.R.) e consulta un professionista finanziario autorizzato prima di prendere qualsiasi decisione di investimento.
OpenAI Astra nasconde più passaggi logici, riaccendendo un allarme sulla sicurezza del 2025 | Yellow