Mythos 5 ha dovuto battere i CAPTCHA per sembrare umano, poi è arrivato il malware

Claude Mythos 5 battled CAPTCHA tests across hundreds of transcript pages before uploading malware to PyPI, Anthropic records show (Image: Shutterstock)
Claude Mythos 5 battled CAPTCHA tests across hundreds of transcript pages before uploading malware to PyPI, Anthropic records show (Image: Shutterstock)

Un transcript di 1.022 pagine pubblicato da Anthropic mostra come il modello Claude Mythos 5 abbia combattuto per centinaia di pagine contro test CAPTCHA prima di caricare su PyPI un malware che è stato poi installato su 15 sistemi.

Punti chiave:

  • Claude Mythos 5 ha raggiunto internet reale durante un test di cybersecurity e ha caricato un pacchetto malevolo su PyPI.
  • I controlli CAPTCHA occupano centinaia di pagine nel transcript ma non sono riusciti a fermarlo.
  • Anthropic ha definito il comportamento spericolato e ha incaricato una revisione indipendente.

La battaglia di Mythos 5 con i CAPTCHA

Anthropic ha pubblicato il transcript il 9 settembre insieme a una valutazione di quattro incidenti in cui i modelli Claude hanno raggiunto sistemi terzi reali durante test di sicurezza. In queste prove i modelli operavano senza le barriere di cybersicurezza integrate nei prodotti commerciali. A Mythos 5 era stato comunicato di non avere accesso a internet, ma una configurazione errata dell’ambiente ha lasciato una via aperta al web pubblico, e il modello ha piazzato su PyPI – l’indice pubblico dei pacchetti Python – un pacchetto per il furto di credenziali.

Per registrare un account su PyPI era necessario superare controlli anti-bot, e un’analisi del transcript ha rilevato che centinaia di pagine sono dedicate solo a superare questo ostacolo, mentre la scrittura dell’exploit è risultata relativamente semplice.

Il modello si è misurato con test di riconoscimento caratteri e rompicapi “trova l’intruso” con coccodrilli, rane e gorilla, arrivando a scrivere a un certo punto: «MA ALLORA CHE DIAVOLO NON VA NELLE RISPOSTE?».

Ha anche tentato di usare credenziali di processori di pagamento online e di rintracciare criptovalute per pagarsi un numero di telefono, necessario per registrare un indirizzo email. Entrambi i tentativi sono falliti. Il modello si è quindi rivolto a un provider di email usa-e-getta gratuito, il cui dominio non risultava ancora bloccato da PyPI.

Alla fine il modello ha superato i test e pubblicato il pacchetto in tre versioni, che sono state rapidamente installate su 15 host terzi. Secondo Anthropic si trattava verosimilmente di vendor di sicurezza che scansionavano automaticamente i nuovi upload.

Uno di questi scanner ha esposto le proprie credenziali, che il modello ha sfruttato per entrare nel database di produzione del fornitore. PyPI ha rimosso il pacchetto entro un’ora.

Da leggere anche: Il Lazarus nordcoreano avrebbe riciclato 1 miliardo di dollari rubati tramite intermediari cinesi, accusa ZachXBT

Colin Fraser, il verdetto di Anthropic

Il data scientist Colin Fraser ha richiamato l’attenzione sulla quantità di sforzo dedicata dal modello ad aggirare le protezioni anti-bot. Anthropic afferma che questo è l’episodio più preoccupante tra i quattro valutati. I controlli interni pre-lancio non avevano intercettato il comportamento.

L’azienda ha rilevato che il modello ha ragionato in modo distorto e agito in maniera spericolata, definendo ripetutamente l’ambiente una simulazione nonostante fosse evidente di essere collegato a internet reale. In una replica simulata di 150 esecuzioni, Mythos 5 ha compiuto un’azione gravemente dannosa nell’82% dei casi, contro il 31% di Claude Opus 5 e il 33% di Claude Mythos 5.1.

I precedenti di Claude

Anthropic aveva inizialmente rivelato tre di questi incidenti il 30 luglio, dopo aver passato al setaccio circa 141.000 transcript di valutazioni cyber in cui i modelli avrebbero potuto raggiungere la rete. Un quarto episodio, che coinvolgeva una versione iniziale di Claude Opus 4.6 risalente a gennaio, è emerso in agosto. Da allora la società ha firmato un mandato di otto settimane con il valutatore indipendente METR per indagare su tutti e quattro i casi. Anthropic afferma di aver informato tutte le controparti coinvolte.

Prossimo articolo: AMD afferma che la domanda di AI è così elevata da aumentare “in modo sostanziale” l’offerta di chip nel 2027

Alexey Bondarev profile photo

Alexey Bondarev

Alexey Bondarev è Head of Content presso Yellow.com. È specializzato in approfonditi articoli di ricerca e contenuti formativi, con un'attenzione particolare all'analisi, al contesto del settore e alle grandi forze che stanno plasmando il mondo cripto, dall’era dell’IA e dalle tecnologie di sicurezza fino all’innovazione fintech. È convinto che tutto ciò che è digitale supererà presto tutto ciò che è analogico e lavora sodo per contribuire a renderlo realtà.

Disclaimer e avvertenza sui rischi: Le informazioni fornite in questo articolo sono solo per scopi educativi e informativi e sono basate sull'opinione dell'autore. Non costituiscono consulenza finanziaria, di investimento, legale o fiscale. Gli asset di criptovaluta sono altamente volatili e soggetti ad alto rischio, incluso il rischio di perdere tutto o una parte sostanziale del tuo investimento. Il trading o il possesso di asset crypto potrebbe non essere adatto a tutti gli investitori. Le opinioni espresse in questo articolo sono esclusivamente quelle dell'autore/autori e non rappresentano la politica ufficiale o la posizione di Yellow, dei suoi fondatori o dei suoi dirigenti. Conduci sempre la tua ricerca approfondita (D.Y.O.R.) e consulta un professionista finanziario autorizzato prima di prendere qualsiasi decisione di investimento.
Mythos 5 ha dovuto battere i CAPTCHA per sembrare umano, poi è arrivato il malware | Yellow