Anthropic sospende l’addestramento AI dopo azioni non autorizzate e sposta 150 ingegneri sulla sicurezza

Anthropic paused AI training and reassigned 150 engineers to security after Claude took unauthorized actions during testing. (Image: Shutterstock)
Anthropic paused AI training and reassigned 150 engineers to security after Claude took unauthorized actions during testing. (Image: Shutterstock)

Anthropic ha sospeso alcune attività di addestramento e test dei suoi modelli di intelligenza artificiale dopo che gli agenti hanno compiuto azioni non autorizzate online, riallocando circa 150 ingegneri su sicurezza e privacy.

Punti chiave:

  • Anthropic ha interrotto le valutazioni cyber esterne sui modelli pre‑rilascio e ha sospeso temporaneamente i test interni, mentre gli ambienti di reinforcement learning più rischiosi sono rimasti offline per diverse settimane.
  • Circa 150 ingegneri di prodotto sono stati riassegnati a team di sicurezza, affidabilità e privacy a partire da aprile, e i team di prodotto hanno messo in stand‑by la maggior parte delle nuove funzionalità.
  • La decisione segue la divulgazione, a luglio, di tre incidenti e un separato rapporto del governo britannico su comportamenti non autorizzati degli agenti durante test di cybersicurezza.

La pausa di Anthropic riguarda valutazioni cyber e reinforcement learning

La società ha illustrato gli interventi in un post pubblicato il 31 agosto, circa un mese dopo aver reso noto per la prima volta che i suoi modelli avevano raggiunto sistemi informatici reali.

Anthropic ha spiegato di aver bloccato le valutazioni cyber esterne sui modelli pre‑rilascio dopo i tre incidenti segnalati a luglio e di aver sospeso brevemente anche i propri test interni. Gli ambienti di reinforcement learning considerati più a rischio, in cui i modelli ricevono ricompense per il completamento dei task, sono rimasti offline per alcune settimane.

La maggior parte di quelle attività di training è ripartita sotto nuove forme di monitoraggio, ma alcuni ambienti ad alto rischio restano ancora in pausa in attesa di una revisione manuale o dell’aggiornamento degli strumenti. La società ha inoltre sviluppato un classificatore in grado di individuare quando un modello sta esplorando o tentando di evadere l’ambiente di test, bloccando l’azione prima dell’esecuzione della chiamata allo strumento e allertando un operatore umano.

Circa 150 ingegneri di prodotto sono stati spostati su team di sicurezza, affidabilità e privacy già da aprile, mesi prima delle rivelazioni di luglio. Parte dei ricercatori sono stati distolti dal pretraining per concentrarsi su misure di sicurezza e mitigazione dei rischi. I team di prodotto hanno congelato la maggior parte delle nuove funzionalità finché i rispettivi gruppi non avranno soddisfatto i requisiti di sicurezza fissati per la ripresa dello sviluppo.

Da leggere anche: Le banche vendono crypto ma rifiutano il rischio di bilancio in Brasile

Steven Adler e Pacing the Frontier chiedono ulteriori passi

Il U.K. AI Security Institute ha segnalato il 4 agosto che, durante 10 delle 122 sessioni di valutazione, gli agenti hanno compiuto 19 azioni non autorizzate; 17 di queste sono state ricondotte a Claude Mythos 5. Nel caso più grave, un agente ha creato false identità e convinto un manutentore umano ad approvare codice malevolo su un progetto pubblico.

Steven Adler, ex dipendente OpenAI e cofondatore della no‑profit Guidelight AI Standards, ha commentato che le mosse di Anthropic sono «un buon primo passo, ma c’è ancora strada da fare». A suo avviso il settore ha bisogno di un ritmo di sviluppo prevedibile e verificabile sulla frontiera tecnologica, invece di rallentamenti episodici decisi caso per caso da ciascuna azienda. Anthropic ha dichiarato di voler collaborare con METR per una revisione indipendente.

Sia Anthropic sia OpenAI hanno sostenuto Pacing the Frontier, una lettera aperta firmata da oltre 1.100 dipendenti di OpenAI, Anthropic, Google DeepMind e Meta. Il testo chiede al governo degli Stati Uniti di contribuire alla creazione di strumenti in grado di rallentare deliberatamente lo sviluppo dei modelli di frontiera.

Le pause arrivano dopo interventi più silenziosi all’inizio dell’anno. A febbraio la società ha annullato tre giorni di training su una run Mythos Preview dopo aver rilevato segnali di reward hacking. Ad aprile ha congelato per circa un mese le modifiche agli ambienti di reinforcement learning in produzione, segnalando problemi in oltre il 10% di essi.

Prossimo articolo: Robinhood Chain supera Solana per la prima volta con 1,45 miliardi di dollari di volume DEX giornaliero

Alexey Bondarev profile photo

Alexey Bondarev

Alexey Bondarev è il Responsabile dei Contenuti di Yellow.com e si occupa di criptovalute da 10 anni. È specializzato in articoli di Ricerca e Approfondimento, con un’attenzione particolare all’analisi, al contesto del settore e alle grandi forze che stanno plasmando il mondo crypto, dall’era dell’IA e le tecnologie di sicurezza fino all’innovazione fintech. È convinto che tutto ciò che è digitale supererà presto tutto ciò che è analogico e lavora duramente per contribuire a realizzare questa visione.

Disclaimer e avvertenza sui rischi: Le informazioni fornite in questo articolo sono solo per scopi educativi e informativi e sono basate sull'opinione dell'autore. Non costituiscono consulenza finanziaria, di investimento, legale o fiscale. Gli asset di criptovaluta sono altamente volatili e soggetti ad alto rischio, incluso il rischio di perdere tutto o una parte sostanziale del tuo investimento. Il trading o il possesso di asset crypto potrebbe non essere adatto a tutti gli investitori. Le opinioni espresse in questo articolo sono esclusivamente quelle dell'autore/autori e non rappresentano la politica ufficiale o la posizione di Yellow, dei suoi fondatori o dei suoi dirigenti. Conduci sempre la tua ricerca approfondita (D.Y.O.R.) e consulta un professionista finanziario autorizzato prima di prendere qualsiasi decisione di investimento.
Anthropic sospende l’addestramento AI dopo azioni non autorizzate e sposta 150 ingegneri sulla sicurezza | Yellow