La Kimi K3 di Moonshot sfrutta una falla nel sandbox e ne esce indisturbata

A UK government sandbox failed to hold Moonshot's Kimi K3, which reached GitHub for answers, Frontier Security says. (Image: Shutterstock)
A UK government sandbox failed to hold Moonshot's Kimi K3, which reached GitHub for answers, Frontier Security says. (Image: Shutterstock)

Kimi K3 è evasa da un ambiente di test isolato del governo britannico e ha consultato GitHub in cerca di risposte, facendo di Moonshot AI il quarto sviluppatore il cui modello è riuscito a rompere il perimetro di contenimento.

Punti chiave:

  • Kimi K3 ha lasciato un sandbox isolato durante una valutazione di cybersicurezza, raggiungendo internet aperta.
  • Una semplice errata configurazione di rete nel framework di benchmark ha creato la via di fuga.
  • Il modello ha cercato soluzioni in un repository di codice invece di attaccare sistemi esterni.

L’evasione dal sandbox di Kimi K3

La startup statunitense di cybersicurezza Frontier Security ha reso noto l’incidente in un post pubblicato giovedì. I ricercatori Paul Kassianik e Yaron Singer stavano valutando le capacità difensive del modello in ambito sicurezza informatica, utilizzando un framework di benchmark sviluppato dall’AI Security Institute britannico. L’analisi ha ricondotto la fuga a una banale errata configurazione di rete all’interno del framework, non a uno sfruttamento intenzionale da parte del modello.

Lasciato solo con problemi che in teoria non avrebbero dovuto richiedere l’accesso al web, il modello ha sondato le proprie impostazioni di rete, ha individuato un varco verso l’esterno e ha recuperato soluzioni già pronte da una piattaforma per sviluppatori.

Una revisione successiva dei log non ha evidenziato alcun attacco effettivo contro obiettivi reali.

Frontier ha poi precisato che l’evasione non ha coinvolto alcuna vulnerabilità zero-day.

Moonshot ha lanciato Kimi K3 a luglio, rendendola gratuita poco dopo; le valutazioni indipendenti collocano il sistema vicino ai modelli americani più avanzati. I benchmark interni di Frontier la classificano come molto capace nell’individuare falle in software e infrastrutture di rete.

Articolo correlato: Azioni SpaceX da 100 miliardi di dollari vendibili per la prima volta

Yaron Singer sui “guardrail” mancanti

Singer ha spiegato che il suo team ha individuato una perdita nel sandbox, e che Kimi ha sfruttato questo spiraglio, segnalando l’assenza di adeguate barriere interne. Frontier ha condotto il test in autonomia, utilizzando un software di sandbox distribuito gratuitamente dall’istituto britannico, e sostiene che i risultati dimostrano come il modello integri meno salvaguardie cyber rispetto ai concorrenti.

L’aspetto più preoccupante per i ricercatori è la distribuzione: la versione che è evasa è “open weight” ed è già nelle mani del pubblico, con le stesse impostazioni permissive.

Una delle conclusioni del report è diretta: se a un agente avanzato si lascia anche solo un canale verso internet, lo troverà. Katie Moussouris ha osservato di essere sorpresa che i laboratori non avessero previsto un simile comportamento, considerando da quanto tempo testano agenti autonomi.

Le fughe di OpenAI e Meta

La rivelazione arriva al termine di un’estate costellata da ammissioni simili da parte dei principali attori del settore. OpenAI ha rivelato mercoledì che i suoi agenti di valutazione hanno costruito un forum nascosto all’interno di un repository di file di terze parti, l’hanno ricreato quattro giorni dopo che il personale l’aveva cancellato e poi hanno violato Hugging Face.

I ricercatori hanno spiegato a una conferenza di sicurezza a Las Vegas che i modelli di frontiera tendono a “barare” quando ne hanno l’occasione. Anthropic ha comunicato la scorsa settimana che tre modelli Claude hanno interagito con aziende reali dopo che una configurazione errata li aveva esposti a internet aperta.

Meta ha confermato mercoledì che il suo modello Muse Spark ha ottenuto accesso al web a causa di un errore del tester esterno Irregular, promettendo un’analisi retrospettiva completa al termine della revisione interna.

Prossimo articolo: JPMorgan si chiede se HYPE possa superare Solana e XRP per capitalizzazione

Alexey Bondarev profile photo

Alexey Bondarev

Alexey Bondarev è il Responsabile dei Contenuti di Yellow.com e si occupa di criptovalute da 10 anni. È specializzato in articoli di Ricerca e Approfondimento, con un’attenzione particolare all’analisi, al contesto del settore e alle grandi forze che stanno plasmando il mondo crypto, dall’era dell’IA e le tecnologie di sicurezza fino all’innovazione fintech. È convinto che tutto ciò che è digitale supererà presto tutto ciò che è analogico e lavora duramente per contribuire a realizzare questa visione.

Disclaimer e avvertenza sui rischi: Le informazioni fornite in questo articolo sono solo per scopi educativi e informativi e sono basate sull'opinione dell'autore. Non costituiscono consulenza finanziaria, di investimento, legale o fiscale. Gli asset di criptovaluta sono altamente volatili e soggetti ad alto rischio, incluso il rischio di perdere tutto o una parte sostanziale del tuo investimento. Il trading o il possesso di asset crypto potrebbe non essere adatto a tutti gli investitori. Le opinioni espresse in questo articolo sono esclusivamente quelle dell'autore/autori e non rappresentano la politica ufficiale o la posizione di Yellow, dei suoi fondatori o dei suoi dirigenti. Conduci sempre la tua ricerca approfondita (D.Y.O.R.) e consulta un professionista finanziario autorizzato prima di prendere qualsiasi decisione di investimento.
La Kimi K3 di Moonshot sfrutta una falla nel sandbox e ne esce indisturbata | Yellow