Jailbreak di Kimi: due modelli AI rispondono a quesiti su armi biologiche

Researchers bypassed Kimi safety controls in two Moonshot models during jailbreak testing (Image: Shutterstock)
Researchers bypassed Kimi safety controls in two Moonshot models during jailbreak testing (Image: Shutterstock)

Moonshot AI è finita sotto i riflettori dopo che i ricercatori di Mindgard sono riusciti ad aggirare i controlli di sicurezza di due modelli Kimi, ottenendo istruzioni su armi biologiche e omicidi mirati.

Punti chiave

  • Secondo Mindgard, Kimi K2.6 e K3 Swarm possono essere spinti oltre le barriere di sicurezza tramite jailbreak.
  • I ricercatori non hanno dimostrato che le risposte dannose funzionerebbero effettivamente nel mondo reale.
  • Moonshot ha dichiarato di essere al lavoro su una revisione interna e di essere in dialogo con Mindgard.

Le scoperte sul jailbreak di Kimi

La BBC ha riportato che Mindgard, a luglio, ha individuato la possibilità di forzare Kimi K2.6 e K3 Swarm oltre i “guardrail” impostati dagli sviluppatori attraverso tecniche di jailbreak, vale a dire prompt strutturati per mettere alla prova la capacità del modello di ignorare le regole di sicurezza. Secondo Mindgard, questi controlli avrebbero dovuto impedire qualsiasi discussione su temi così sensibili.

Il fondatore Peter Garraghan ha spiegato alla BBC che, una volta riuscito il jailbreak, i modelli erano in grado di discutere praticamente qualsiasi argomento e di fornire ulteriori suggerimenti potenzialmente dannosi anche senza che venissero esplicitamente richiesti.

Moonshot, interpellata dalla BBC, ha affermato di accogliere con favore il contributo di terze parti “come pilastro fondamentale per costruire un’IA migliore e più sicura” e di essere in dialogo con Mindgard sulle vulnerabilità emerse. Mindgard ha riferito di aver inviato una prima email a Moonshot il 27 luglio, di aver fatto un sollecito circa una settimana dopo e di aver pubblicato le proprie conclusioni il 12 settembre.

Da leggere anche: Ripple aiuta la CSD BR del Brasile a tracciare la proprietà dei fondi su una blockchain pubblica

I rischi per la sicurezza secondo Mindgard

Mindgard non ha verificato sul campo l’efficacia pratica delle istruzioni fornite dall’IA, ma sostiene che il semplice fatto che le risposte siano state generate dimostra il fallimento dei meccanismi di salvaguardia progettati per impedire che i sistemi interagiscano con richieste pericolose.

La società ha inoltre evidenziato che un Kimi K2.6 compromesso potrebbe, almeno in teoria, eseguire codice sulle proprie risorse di calcolo e collegarsi a internet, trasformandosi in un potenziale punto di partenza per lanciare cyberattacchi.

Dal canto suo, Moonshot ha dichiarato che le valutazioni interne mostravano in generale “un alto tasso di rifiuto per questo tipo di richieste”, mettendo in luce il divario tra i test di routine e l’approccio più aggressivo adottato dai ricercatori esterni.

Alan Woodward, professore all’Università di Surrey, ha ricordato alla BBC che i modelli open source possono essere facilmente sfruttati da attori malintenzionati una volta che raggiungono le loro mani, anche se gli stessi strumenti possono essere utilizzati per rafforzare la cyberdifesa.

A suo avviso, la regolamentazione farà fatica a tenere il passo con lo sviluppo dell’IA; per questo motivo l’enforcement dovrebbe concentrarsi in misura maggiore sulle persone che fanno un uso improprio di questi sistemi.

La preoccupazione del settore va oltre questo singolo caso: i modelli Kimi di Moonshot sono “open-weight”, quindi gli utenti possono eseguirli sulle proprie infrastrutture. Allo stesso tempo, recenti incidenti di sicurezza legati all’IA hanno coinvolto anche sistemi di agenti sviluppati da OpenAI, Meta e Anthropic.

Questa combinazione di fattori spinge i ricercatori a non limitarsi più a valutare la capacità di un modello di rifiutare una richiesta, ma a chiedersi che cosa accada quando a sistemi molto potenti vengono messi a disposizione strumenti, accesso a internet e la facoltà di operare su più passaggi decisionali.

Prossima lettura: Le altcoin conquistano il 41% dell’open interest sui futures, i volumi spot quadruplicano quelli di Bitcoin

Alexey Bondarev profile photo

Alexey Bondarev

Alexey Bondarev è specializzato in approfonditi articoli di ricerca e formazione, con un focus su analisi giornalistica, contesto di settore e le grandi forze che plasmano il mondo crypto, dall’era dell’IA e le tecnologie di sicurezza fino all’innovazione fintech. È convinto che tutto ciò che è digitale supererà a breve tutto ciò che è analogico e lavora duramente per contribuire a far sì che questo accada.

Disclaimer e avvertenza sui rischi: Le informazioni fornite in questo articolo sono solo per scopi educativi e informativi e sono basate sull'opinione dell'autore. Non costituiscono consulenza finanziaria, di investimento, legale o fiscale. Gli asset di criptovaluta sono altamente volatili e soggetti ad alto rischio, incluso il rischio di perdere tutto o una parte sostanziale del tuo investimento. Il trading o il possesso di asset crypto potrebbe non essere adatto a tutti gli investitori. Le opinioni espresse in questo articolo sono esclusivamente quelle dell'autore/autori e non rappresentano la politica ufficiale o la posizione di Yellow, dei suoi fondatori o dei suoi dirigenti. Conduci sempre la tua ricerca approfondita (D.Y.O.R.) e consulta un professionista finanziario autorizzato prima di prendere qualsiasi decisione di investimento.
Jailbreak di Kimi: due modelli AI rispondono a quesiti su armi biologiche | Yellow