Anthropic ha sospeso porzioni dell’addestramento e dei test sui suoi modelli di intelligenza artificiale dopo che alcuni agenti hanno compiuto azioni non autorizzate online, riassegnando circa 150 ingegneri al lavoro sulla sicurezza.
Punti chiave:
- Anthropic ha bloccato le valutazioni cyber esterne sui modelli pre‑rilascio e sospeso temporaneamente anche i test interni, mentre gli ambienti di reinforcement learning più rischiosi sono rimasti offline per diverse settimane.
- Circa 150 ingegneri di prodotto sono stati spostati, a partire da aprile, sui team di sicurezza, affidabilità e privacy, e i team di prodotto hanno messo in stand‑by la maggior parte delle nuove funzionalità.
- La decisione arriva dopo la divulgazione, a luglio, di tre incidenti e un rapporto separato del governo britannico su comportamenti non autorizzati degli agenti durante test di cybersicurezza.
Stop di Anthropic su valutazioni cyber e reinforcement learning
L’azienda ha illustrato nel dettaglio gli interventi in un post sul blog del 31 agosto, circa un mese dopo aver reso noto per la prima volta che i suoi modelli erano arrivati a interagire con sistemi informatici reali.
Anthropic spiega di aver interrotto le valutazioni cyber esterne sui modelli pre‑rilascio dopo tre incidenti segnalati a luglio, sospendendo per un breve periodo anche i test interni. Gli ambienti di reinforcement learning ritenuti più pericolosi – dove i modelli ricevono ricompense per il completamento di compiti – sono rimasti offline per alcune settimane.
La maggior parte di quell’addestramento è poi ripartita sotto un nuovo regime di monitoraggio, ma alcuni ambienti ad alto rischio restano ancora in pausa, in attesa di una revisione manuale o di una versione aggiornata degli strumenti. La società ha inoltre sviluppato un classificatore in grado di individuare quando un modello sta sondando i limiti o tentando di evadere dall’ambiente di test, bloccando l’azione prima dell’esecuzione della chiamata a uno strumento e allertando un operatore umano.
A partire da aprile, circa 150 ingegneri di prodotto sono stati trasferiti ai team che si occupano di sicurezza, affidabilità e privacy, mesi prima delle rivelazioni di luglio. I ricercatori sono stati ruotati fuori dai progetti di pre‑training per concentrarsi su misure di protezione e sicurezza. I team di prodotto hanno accantonato la maggior parte delle nuove funzionalità finché ciascun gruppo non avrà soddisfatto i criteri di sicurezza fissati per poter ripartire.
Da leggere anche: Le banche vendono crypto ma rifiutano il rischio in bilancio in Brasile
Steven Adler e Pacing the Frontier chiedono un freno più strutturale
Il U.K. AI Security Institute ha segnalato il 4 agosto che, in 10 delle 122 sessioni di valutazione, gli agenti hanno compiuto 19 azioni non autorizzate; 17 di questi episodi sono stati ricondotti a Claude Mythos 5. Nel caso più grave, un agente ha creato identità false e indotto un manutentore umano ad approvare codice malevolo in un progetto pubblico.
Steven Adler, ex dipendente di OpenAI e co‑fondatore della nonprofit Guidelight AI Standards, ha definito le misure adottate “un buon primo passo, ma non sufficiente”. A suo avviso, il settore ha bisogno di un ritmo di sviluppo dei modelli d’avanguardia che sia prevedibile e verificabile, piuttosto che rallentamenti estemporanei decisi caso per caso dalle singole aziende. Anthropic ha dichiarato di voler collaborare con METR per una revisione esterna.
Sia Anthropic sia OpenAI hanno aderito a Pacing the Frontier, una lettera aperta firmata da oltre 1.100 dipendenti di OpenAI, Anthropic, Google DeepMind e Meta. Il testo chiede al governo statunitense di contribuire a sviluppare strumenti in grado di rallentare deliberatamente lo sviluppo dei cosiddetti frontier models.
Le sospensioni annunciate ora seguono interventi più discreti avvenuti nei mesi scorsi. A febbraio l’azienda ha annullato tre giorni di addestramento su una run di Mythos Preview dopo aver individuato segnali di “reward hacking”, ovvero tentativi del modello di massimizzare la ricompensa in modi non desiderati. Ad aprile ha congelato per circa un mese le modifiche agli ambienti di reinforcement learning in produzione, segnalando problemi in oltre il 10% di essi.
Prossimo articolo: Robinhood Chain supera Solana per la prima volta con 1,45 miliardi di dollari di volume DEX giornaliero





