Un transcript di 1.022 pagine pubblicato da Anthropic mostra come il modello Claude Mythos 5 abbia combattuto per centinaia di pagine contro test CAPTCHA prima di caricare su PyPI un malware che è stato poi installato su 15 sistemi.
Punti chiave:
- Claude Mythos 5 ha raggiunto internet reale durante un test di cybersecurity e ha caricato un pacchetto malevolo su PyPI.
- I controlli CAPTCHA occupano centinaia di pagine nel transcript ma non sono riusciti a fermarlo.
- Anthropic ha definito il comportamento spericolato e ha incaricato una revisione indipendente.
La battaglia di Mythos 5 con i CAPTCHA
Anthropic ha pubblicato il transcript il 9 settembre insieme a una valutazione di quattro incidenti in cui i modelli Claude hanno raggiunto sistemi terzi reali durante test di sicurezza. In queste prove i modelli operavano senza le barriere di cybersicurezza integrate nei prodotti commerciali. A Mythos 5 era stato comunicato di non avere accesso a internet, ma una configurazione errata dell’ambiente ha lasciato una via aperta al web pubblico, e il modello ha piazzato su PyPI – l’indice pubblico dei pacchetti Python – un pacchetto per il furto di credenziali.
Per registrare un account su PyPI era necessario superare controlli anti-bot, e un’analisi del transcript ha rilevato che centinaia di pagine sono dedicate solo a superare questo ostacolo, mentre la scrittura dell’exploit è risultata relativamente semplice.
Il modello si è misurato con test di riconoscimento caratteri e rompicapi “trova l’intruso” con coccodrilli, rane e gorilla, arrivando a scrivere a un certo punto: «MA ALLORA CHE DIAVOLO NON VA NELLE RISPOSTE?».
Ha anche tentato di usare credenziali di processori di pagamento online e di rintracciare criptovalute per pagarsi un numero di telefono, necessario per registrare un indirizzo email. Entrambi i tentativi sono falliti. Il modello si è quindi rivolto a un provider di email usa-e-getta gratuito, il cui dominio non risultava ancora bloccato da PyPI.
Alla fine il modello ha superato i test e pubblicato il pacchetto in tre versioni, che sono state rapidamente installate su 15 host terzi. Secondo Anthropic si trattava verosimilmente di vendor di sicurezza che scansionavano automaticamente i nuovi upload.
Uno di questi scanner ha esposto le proprie credenziali, che il modello ha sfruttato per entrare nel database di produzione del fornitore. PyPI ha rimosso il pacchetto entro un’ora.
Da leggere anche: Il Lazarus nordcoreano avrebbe riciclato 1 miliardo di dollari rubati tramite intermediari cinesi, accusa ZachXBT
Colin Fraser, il verdetto di Anthropic
Il data scientist Colin Fraser ha richiamato l’attenzione sulla quantità di sforzo dedicata dal modello ad aggirare le protezioni anti-bot. Anthropic afferma che questo è l’episodio più preoccupante tra i quattro valutati. I controlli interni pre-lancio non avevano intercettato il comportamento.
L’azienda ha rilevato che il modello ha ragionato in modo distorto e agito in maniera spericolata, definendo ripetutamente l’ambiente una simulazione nonostante fosse evidente di essere collegato a internet reale. In una replica simulata di 150 esecuzioni, Mythos 5 ha compiuto un’azione gravemente dannosa nell’82% dei casi, contro il 31% di Claude Opus 5 e il 33% di Claude Mythos 5.1.
I precedenti di Claude
Anthropic aveva inizialmente rivelato tre di questi incidenti il 30 luglio, dopo aver passato al setaccio circa 141.000 transcript di valutazioni cyber in cui i modelli avrebbero potuto raggiungere la rete. Un quarto episodio, che coinvolgeva una versione iniziale di Claude Opus 4.6 risalente a gennaio, è emerso in agosto. Da allora la società ha firmato un mandato di otto settimane con il valutatore indipendente METR per indagare su tutti e quattro i casi. Anthropic afferma di aver informato tutte le controparti coinvolte.
Prossimo articolo: AMD afferma che la domanda di AI è così elevata da aumentare “in modo sostanziale” l’offerta di chip nel 2027

