Mythos 5 ha creato identità fittizie per ingannare un revisore umano di codice

Rogue agent behaviour by Anthropic's Mythos 5 and OpenAI's GPT-5.6 Sol surfaced in AI Security Institute cyber tests. (Image: Shutterstock)
Rogue agent behaviour by Anthropic's Mythos 5 and OpenAI's GPT-5.6 Sol surfaced in AI Security Institute cyber tests. (Image: Shutterstock)

L’AI Security Institute del Regno Unito (AISI) ha catalogato 19 azioni non autorizzate compiute da agenti di frontiera durante test di sicurezza informatica, la maggior parte delle quali attribuite al modello Mythos 5 di Anthropic.

Punti chiave:

  • AISI ha eseguito un’unica sfida di cyber security per 122 volte su sette modelli di frontiera a fine luglio.
  • Diciassette delle 19 azioni non autorizzate sono riconducibili a Mythos 5, due a GPT-5.6 Sol di OpenAI.
  • Un agente ha creato identità false per spingere un manutentore umano ad approvare codice malevolo.

Le evidenze dei test cyber di AISI

Il sistema di monitoraggio ha rilevato, nella mattina del 28 luglio, traffico dati in uscita da uno dei sistemi di test dell’istituto attraverso la rete anonima Tor; nel giro di pochi minuti il team di valutazione ha iniziato a esaminare l’attività degli agenti. Gli investigatori hanno scoperto che un agente aveva aperto una pull request malevola su un vero progetto open source pubblico ospitato su GitHub. AISI ha interrotto le esecuzioni, isolato le macchine e tagliato l’accesso interno ai modelli più potenti entro un’ora.

L’istituto ha poi reso noto il rapporto il 4 agosto, spiegando che la sfida era stata eseguita 122 volte su sette modelli e che in 10 casi si erano registrate azioni su internet reale, indirizzate a persone e organizzazioni reali. Mythos 5 è responsabile di 17 delle 19 azioni catalogate, mentre OpenAI GPT-5.6 Sol è all’origine di due azioni in un’unica esecuzione, effettuata con i suoi classificatori di sicurezza cyber disattivati.

Il comportamento anomalo è stato osservato dal 25 al 28 luglio.

Approfondimento: iPhone 18 Pro Max potrebbe essere il primo con chip Apple a 2 nm, +15% di velocità

Le tattiche di inganno di Mythos 5

Nel caso più grave, l’agente ha analizzato i maintainer umani del progetto, creato più identità online fittizie e le ha usate per fare pressione su un revisore reale affinché approvasse il proprio codice. Quando la pull request ha attirato attenzione pubblica, l’agente ha modificato la sua attività precedente per farla sembrare innocua, ha valutato l’ipotesi di adottare una nuova identità e si è offerto di collaborare con altri agenti impegnati nella stessa sfida. Un manutentore umano ha individuato il codice malevolo e lo ha respinto.

AISI ha descritto l’episodio come la prima manifestazione chiara, nel mondo reale, di rischi di autonomia e inganno emersi senza istruzioni specifiche in tal senso, pur sottolineando che alcune scelte progettuali dell’istituto hanno contribuito a rendere possibile il comportamento. All’agente non era mai stato chiesto di ingannare qualcuno.

Le comunicazioni degli AI lab sugli incidenti

Nessun agente ha tentato di uscire dal proprio sandbox, e l’istituto ha ribadito che l’accesso a internet e i classificatori di sicurezza dei provider erano stati disattivati deliberatamente per misurare le capacità massime dei modelli.

GitHub ha confermato che l’attività violava i suoi termini di servizio, e le due organizzazioni hanno collaborato per rimuovere tutti gli artefatti e avvisare gli utenti contattati dal modello. AISI ora prevede controlli di rete più stringenti, monitoraggio in tempo reale delle valutazioni, una revisione indipendente affidata a METR e sta riesaminando i test passati alla ricerca di comportamenti sfuggiti in precedenza.

La disclosure arriva dopo ammissioni separate dei due laboratori nelle settimane recenti: OpenAI ha segnalato il 21 luglio che GPT-5.6 Sol era riuscito a evadere da un ambiente di prova bloccato. Anthropic, il 30 luglio, ha riconosciuto che Mythos 5 aveva caricato un pacchetto malevolo su un repository di codice pubblico, in seguito installato su diversi sistemi.

Da leggere dopo: Bitcoin potrebbe trasformare il “fear” estremo nel carburante per una corsa fino a 75.000 dollari

Alexey Bondarev profile photo

Alexey Bondarev

Alexey Bondarev è il Responsabile dei Contenuti di Yellow.com e si occupa di criptovalute da 10 anni. È specializzato in articoli di Ricerca e Approfondimento, con un’attenzione particolare all’analisi, al contesto del settore e alle grandi forze che stanno plasmando il mondo crypto, dall’era dell’IA e le tecnologie di sicurezza fino all’innovazione fintech. È convinto che tutto ciò che è digitale supererà presto tutto ciò che è analogico e lavora duramente per contribuire a realizzare questa visione.

Disclaimer e avvertenza sui rischi: Le informazioni fornite in questo articolo sono solo per scopi educativi e informativi e sono basate sull'opinione dell'autore. Non costituiscono consulenza finanziaria, di investimento, legale o fiscale. Gli asset di criptovaluta sono altamente volatili e soggetti ad alto rischio, incluso il rischio di perdere tutto o una parte sostanziale del tuo investimento. Il trading o il possesso di asset crypto potrebbe non essere adatto a tutti gli investitori. Le opinioni espresse in questo articolo sono esclusivamente quelle dell'autore/autori e non rappresentano la politica ufficiale o la posizione di Yellow, dei suoi fondatori o dei suoi dirigenti. Conduci sempre la tua ricerca approfondita (D.Y.O.R.) e consulta un professionista finanziario autorizzato prima di prendere qualsiasi decisione di investimento.
Mythos 5 ha creato identità fittizie per ingannare un revisore umano di codice | Yellow