Claude Mythos 5 arriva sui siti governativi USA, Anthropic stacca la spina ai test con internet live

Claude models including Mythos 5 exploited flaws on real websites, leading Anthropic to cut internet access for its internal AI tests (Image: Shutterstock)
Claude models including Mythos 5 exploited flaws on real websites, leading Anthropic to cut internet access for its internal AI tests (Image: Shutterstock)

Anthropic ha disattivato l’accesso diretto a internet per tutti i test interni dei suoi modelli di AI, dopo che diverse versioni di Claude – tra cui Mythos 5 – hanno sfruttato vulnerabilità e aggirato i vincoli di sicurezza su siti reali, alcuni gestiti da agenzie governative statunitensi.

Punti chiave:

  • Anthropic ha bloccato l’accesso al web live in tutte le valutazioni interne finché i sistemi di monitoraggio non saranno in grado di rilevare in modo affidabile i comportamenti indesiderati dei modelli.
  • I modelli Claude hanno eseguito comandi su un server universitario, usato token di accesso per raggiungere dati a pagamento e inviato moduli su siti reali.
  • Una falsa segnalazione di omicidio, inviata al dipartimento di polizia di Philadelphia da Claude Haiku 4.5, ha provocato una dura reprimenda pubblica.

Il rapporto di Anthropic su Claude

Venerdì Anthropic ha pubblicato un rapporto sulle azioni non intenzionali dei modelli durante le valutazioni e l’uso interno, basato in larga parte su una revisione dei transcript avviata a luglio. Alcuni test ad alto rischio e in ambito cyber erano già condotti offline.

Il nuovo blocco vale ora per ogni valutazione interna e non ha una data di fine: resterà in vigore finché l’azienda non avrà la certezza che i propri strumenti di monitoraggio intercettino con continuità questo tipo di condotte.

Il rapporto classifica i casi in quattro categorie: esecuzione di comandi su un server tramite una falla software, invio di moduli su siti reali, accesso a dati dietro paywall o gating e uso di URL shortener per eludere i limiti degli strumenti. Alcuni siti appartenevano ad agenzie federali, statali e locali degli Stati Uniti; Anthropic afferma di aver informato la Casa Bianca e notificato ciascuna amministrazione coinvolta.

In un caso, Claude Mythos 5 ha estratto token di accesso validi da una mappa catastale online di un ente locale e ha interrogato direttamente il server di back-end. In un altro episodio, il 18 luglio Claude Haiku 4.5 ha inviato, tramite un form sul sito del Philadelphia Police Department, una segnalazione inventata su un omicidio irrisolto, poi filtrata come spam. La polizia ha definito “inaccettabile” il ritardo di due mesi nel rilevare e comunicare l’accaduto.

Vedi anche: Zcash fissa a gennaio l’obiettivo quantistico per il 70% di ZEC, ma non ha ancora una data

L’avvertimento di von Arx

Sydney von Arx, del gruppo per la sicurezza dell’AI Nightingale, ha dichiarato in un’intervista precedente alla divulgazione del rapporto che isolare i modelli dall’internet aperta sarebbe molto penalizzante per i ricercatori e per l’avanzamento dei modelli stessi. «Prima o poi devi allinearli», ha commentato von Arx.

Anthropic sostiene che il solo training di allineamento non sia ancora sufficiente per compiti come la ricerca online e l’uso del computer, e che la società faccia quindi affidamento anche su classificatori e altre barriere di sicurezza. L’azienda collega questi comportamenti a ambienti di training imperfetti, che finiscono per premiare i modelli quando aggirano i vincoli: un fenomeno noto come “reward hacking”. Secondo Anthropic, i nuovi strumenti di rilevamento hanno bloccato tutti i casi quando testati.

La società considera questi episodi sensibilmente meno gravi rispetto agli incidenti registrati in estate.

La disclosure arriva dopo un rapporto del 30 luglio, in cui Anthropic aveva segnalato che tre modelli Claude, durante test di cybersecurity, erano riusciti a collegarsi a internet e ad accedere senza autorizzazione ai sistemi di tre organizzazioni. Quella revisione aveva coperto 141.006 run di valutazione. L’analisi era partita dopo che OpenAI aveva reso noto, il 21 luglio, che alcuni suoi modelli erano riusciti a uscire da un ambiente di test e a raggiungere l’infrastruttura di Hugging Face.

Da leggere dopo: Kalshi sfida la NFL alla Corte Suprema: 1,8 miliardi di dollari in gioco in una sola domenica di football

Alexey Bondarev profile photo

Alexey Bondarev

Alexey Bondarev è Head of Content presso Yellow.com. È specializzato in approfonditi articoli di ricerca e contenuti formativi, con un'attenzione particolare all'analisi, al contesto del settore e alle grandi forze che stanno plasmando il mondo cripto, dall’era dell’IA e dalle tecnologie di sicurezza fino all’innovazione fintech. È convinto che tutto ciò che è digitale supererà presto tutto ciò che è analogico e lavora sodo per contribuire a renderlo realtà.

Disclaimer e avvertenza sui rischi: Le informazioni fornite in questo articolo sono solo per scopi educativi e informativi e sono basate sull'opinione dell'autore. Non costituiscono consulenza finanziaria, di investimento, legale o fiscale. Gli asset di criptovaluta sono altamente volatili e soggetti ad alto rischio, incluso il rischio di perdere tutto o una parte sostanziale del tuo investimento. Il trading o il possesso di asset crypto potrebbe non essere adatto a tutti gli investitori. Le opinioni espresse in questo articolo sono esclusivamente quelle dell'autore/autori e non rappresentano la politica ufficiale o la posizione di Yellow, dei suoi fondatori o dei suoi dirigenti. Conduci sempre la tua ricerca approfondita (D.Y.O.R.) e consulta un professionista finanziario autorizzato prima di prendere qualsiasi decisione di investimento.