Un transcript di 1.022 pagine pubblicato da Anthropic documenta come il modello Claude Mythos 5 abbia lottato per centinaia di pagine contro sistemi CAPTCHA prima di riuscire a caricare su PyPI un malware poi installato da 15 sistemi.
Punti chiave:
- Claude Mythos 5 ha raggiunto internet reale durante un test di cybersecurity e ha caricato un pacchetto malevolo su PyPI.
- I controlli CAPTCHA hanno occupato centinaia di pagine di transcript senza riuscire a fermarlo.
- Anthropic ha definito il comportamento “spericolato” e ha incaricato un revisore esterno.
La “guerra” ai CAPTCHA di Mythos 5
Anthropic ha pubblicato il transcript il 9 settembre insieme a una valutazione di quattro incidenti in cui modelli Claude sono arrivati a interagire con sistemi terzi reali durante test di sicurezza informatica. I modelli operavano senza le barriere di sicurezza cibernetica integrate nei prodotti rilasciati al pubblico. A Mythos 5 era stato detto che non aveva accesso a internet, ma un errore di configurazione nell’ambiente di test ha lasciato aperta una via verso il web pubblico, e il modello è riuscito a impiantare su PyPI — l’indice pubblico dei pacchetti Python — un package in grado di rubare credenziali.
Per registrare un account su PyPI era necessario superare controlli anti‑bot, e un’analisi del transcript ha rilevato che centinaia di pagine riguardano soltanto il superamento di questo ostacolo, mentre la scrittura dell’exploit è stata relativamente rapida.
Il modello si è cimentato con test di riconoscimento di caratteri e puzzle “trova l’intruso” basati su immagini di coccodrilli, rane e gorilla, arrivando a scrivere a un certo punto: «ALLORA CHE DIAVOLO C’È CHE NON VA NELLE RISPOSTE?».
Ha anche tentato di usare credenziali di processori di pagamenti online e di cercare criptovalute per acquistare un numero di telefono, necessario a registrare un indirizzo email. Entrambi i tentativi sono falliti. Il modello è quindi ripiegato su un servizio di email temporanee, il cui dominio non risultava ancora bloccato da PyPI.
Alla fine, il sistema è riuscito a superare i test e a pubblicare il pacchetto in tre versioni, che sono state poi installate su 15 host di terze parti. Secondo Anthropic, con ogni probabilità si trattava di vendor di sicurezza intenti a scansionare i nuovi caricamenti.
Uno di questi scanner ha esposto le proprie credenziali, che il modello ha sfruttato per accedere al database di produzione del vendor; il pacchetto è stato rimosso da PyPI entro un’ora.
Da leggere anche: Il Lazarus Group nordcoreano avrebbe spostato 1 mld $ rubato tramite riciclatori cinesi, secondo ZachXBT
Colin Fraser e il verdetto di Anthropic
Il data scientist Colin Fraser ha richiamato l’attenzione sulla quantità di sforzo che il modello ha dedicato ad aggirare i sistemi anti‑bot. Anthropic afferma che questo è l’episodio più preoccupante tra i quattro analizzati. I controlli interni pre‑rilascio non avevano segnalato in anticipo questo tipo di comportamento.
L’azienda ha riscontrato che il modello ragionava in modo distorto e agiva in maniera spericolata, continuando a definire l’ambiente circostante una “simulazione” nonostante l’evidenza chiara di essere connesso a internet reale. In una replica simulata di 150 esecuzioni, Mythos 5 ha intrapreso un’azione gravemente dannosa nell’82% dei casi, contro il 31% di Claude Opus 5 e il 33% di Claude Mythos 5.1.
I precedenti con i modelli Claude
Anthropic aveva reso noti tre dei quattro incidenti già il 30 luglio, dopo aver passato al setaccio circa 141.000 transcript di valutazioni di sicurezza in cui i modelli potevano teoricamente raggiungere internet. Un quarto episodio, che ha coinvolto una versione preliminare di Claude Opus 4.6 lo scorso gennaio, è emerso in agosto; da allora la società ha firmato un accordo di otto settimane con il valutatore indipendente METR per indagare su tutti e quattro i casi. Anthropic dichiara di aver informato tutte le parti coinvolte.
Prossimo articolo: AMD prevede che la domanda di AI farà crescere “in modo sostanziale” l’offerta di chip nel 2027

