Mythos 5 ha dovuto battere i CAPTCHA per sembrare umano, poi è arrivato il malware

Claude Mythos 5 battled CAPTCHA tests across hundreds of transcript pages before uploading malware to PyPI, Anthropic records show (Image: Shutterstock)
Claude Mythos 5 battled CAPTCHA tests across hundreds of transcript pages before uploading malware to PyPI, Anthropic records show (Image: Shutterstock)

Un transcript di 1.022 pagine pubblicato da Anthropic documenta come il modello Claude Mythos 5 abbia lottato per centinaia di pagine contro sistemi CAPTCHA prima di riuscire a caricare su PyPI un malware poi installato da 15 sistemi.

Punti chiave:

  • Claude Mythos 5 ha raggiunto internet reale durante un test di cybersecurity e ha caricato un pacchetto malevolo su PyPI.
  • I controlli CAPTCHA hanno occupato centinaia di pagine di transcript senza riuscire a fermarlo.
  • Anthropic ha definito il comportamento “spericolato” e ha incaricato un revisore esterno.

La “guerra” ai CAPTCHA di Mythos 5

Anthropic ha pubblicato il transcript il 9 settembre insieme a una valutazione di quattro incidenti in cui modelli Claude sono arrivati a interagire con sistemi terzi reali durante test di sicurezza informatica. I modelli operavano senza le barriere di sicurezza cibernetica integrate nei prodotti rilasciati al pubblico. A Mythos 5 era stato detto che non aveva accesso a internet, ma un errore di configurazione nell’ambiente di test ha lasciato aperta una via verso il web pubblico, e il modello è riuscito a impiantare su PyPI — l’indice pubblico dei pacchetti Python — un package in grado di rubare credenziali.

Per registrare un account su PyPI era necessario superare controlli anti‑bot, e un’analisi del transcript ha rilevato che centinaia di pagine riguardano soltanto il superamento di questo ostacolo, mentre la scrittura dell’exploit è stata relativamente rapida.

Il modello si è cimentato con test di riconoscimento di caratteri e puzzle “trova l’intruso” basati su immagini di coccodrilli, rane e gorilla, arrivando a scrivere a un certo punto: «ALLORA CHE DIAVOLO C’È CHE NON VA NELLE RISPOSTE?».

Ha anche tentato di usare credenziali di processori di pagamenti online e di cercare criptovalute per acquistare un numero di telefono, necessario a registrare un indirizzo email. Entrambi i tentativi sono falliti. Il modello è quindi ripiegato su un servizio di email temporanee, il cui dominio non risultava ancora bloccato da PyPI.

Alla fine, il sistema è riuscito a superare i test e a pubblicare il pacchetto in tre versioni, che sono state poi installate su 15 host di terze parti. Secondo Anthropic, con ogni probabilità si trattava di vendor di sicurezza intenti a scansionare i nuovi caricamenti.

Uno di questi scanner ha esposto le proprie credenziali, che il modello ha sfruttato per accedere al database di produzione del vendor; il pacchetto è stato rimosso da PyPI entro un’ora.

Da leggere anche: Il Lazarus Group nordcoreano avrebbe spostato 1 mld $ rubato tramite riciclatori cinesi, secondo ZachXBT

Colin Fraser e il verdetto di Anthropic

Il data scientist Colin Fraser ha richiamato l’attenzione sulla quantità di sforzo che il modello ha dedicato ad aggirare i sistemi anti‑bot. Anthropic afferma che questo è l’episodio più preoccupante tra i quattro analizzati. I controlli interni pre‑rilascio non avevano segnalato in anticipo questo tipo di comportamento.

L’azienda ha riscontrato che il modello ragionava in modo distorto e agiva in maniera spericolata, continuando a definire l’ambiente circostante una “simulazione” nonostante l’evidenza chiara di essere connesso a internet reale. In una replica simulata di 150 esecuzioni, Mythos 5 ha intrapreso un’azione gravemente dannosa nell’82% dei casi, contro il 31% di Claude Opus 5 e il 33% di Claude Mythos 5.1.

I precedenti con i modelli Claude

Anthropic aveva reso noti tre dei quattro incidenti già il 30 luglio, dopo aver passato al setaccio circa 141.000 transcript di valutazioni di sicurezza in cui i modelli potevano teoricamente raggiungere internet. Un quarto episodio, che ha coinvolto una versione preliminare di Claude Opus 4.6 lo scorso gennaio, è emerso in agosto; da allora la società ha firmato un accordo di otto settimane con il valutatore indipendente METR per indagare su tutti e quattro i casi. Anthropic dichiara di aver informato tutte le parti coinvolte.

Prossimo articolo: AMD prevede che la domanda di AI farà crescere “in modo sostanziale” l’offerta di chip nel 2027

Alexey Bondarev profile photo

Alexey Bondarev

Alexey Bondarev è Head of Content presso Yellow.com. È specializzato in approfonditi articoli di ricerca e contenuti formativi, con un'attenzione particolare all'analisi, al contesto del settore e alle grandi forze che stanno plasmando il mondo cripto, dall’era dell’IA e dalle tecnologie di sicurezza fino all’innovazione fintech. È convinto che tutto ciò che è digitale supererà presto tutto ciò che è analogico e lavora sodo per contribuire a renderlo realtà.

Disclaimer e avvertenza sui rischi: Le informazioni fornite in questo articolo sono solo per scopi educativi e informativi e sono basate sull'opinione dell'autore. Non costituiscono consulenza finanziaria, di investimento, legale o fiscale. Gli asset di criptovaluta sono altamente volatili e soggetti ad alto rischio, incluso il rischio di perdere tutto o una parte sostanziale del tuo investimento. Il trading o il possesso di asset crypto potrebbe non essere adatto a tutti gli investitori. Le opinioni espresse in questo articolo sono esclusivamente quelle dell'autore/autori e non rappresentano la politica ufficiale o la posizione di Yellow, dei suoi fondatori o dei suoi dirigenti. Conduci sempre la tua ricerca approfondita (D.Y.O.R.) e consulta un professionista finanziario autorizzato prima di prendere qualsiasi decisione di investimento.
Mythos 5 ha dovuto battere i CAPTCHA per sembrare umano, poi è arrivato il malware | Yellow