Moonshot AI ha avviato una revisione interna su due modelli Kimi dopo che i ricercatori di Mindgard sono riusciti ad aggirare i controlli di sicurezza, ottenendo dall’intelligenza artificiale istruzioni su armi biologiche e omicidi su commissione.
Punti chiave
- Mindgard sostiene che Kimi K2.6 e K3 Swarm possono essere forzati oltre le barriere di sicurezza tramite jailbreak.
- I ricercatori non hanno dimostrato che le risposte dannose siano effettivamente applicabili nel mondo reale.
- Moonshot afferma di stare esaminando le evidenze e di essere in dialogo con Mindgard.
I risultati del jailbreak su Kimi
La BBC ha riferito che Mindgard, a luglio, ha scoperto come Kimi K2.6 e K3 Swarm potessero essere spinti oltre i “guardrail” impostati dagli sviluppatori tramite tecniche di jailbreaking, ovvero prompt strutturati pensati per mettere alla prova la capacità del modello di ignorare le regole di sicurezza. Secondo Mindgard, tali controlli avrebbero dovuto impedire qualsiasi discussione su temi di questo tipo.
Il fondatore Peter Garraghan ha spiegato alla BBC che, una volta riuscito il jailbreak, i modelli erano disposti a discutere praticamente di qualsiasi argomento e a generare ulteriori suggerimenti potenzialmente dannosi anche senza ulteriori sollecitazioni esplicite.
Moonshot, sempre alla BBC, ha dichiarato di accogliere positivamente i contributi di terze parti “come pilastro fondamentale per costruire un’AI migliore e più sicura” e ha aggiunto di essere al lavoro con Mindgard per analizzare nel dettaglio i risultati. Mindgard afferma di aver inviato una prima segnalazione a Moonshot il 27 luglio, di aver fatto un sollecito circa una settimana dopo e di aver poi pubblicato le proprie conclusioni il 12 settembre.
Da leggere anche: Ripple aiuta il CSD brasiliano BR a tracciare la proprietà dei fondi su una blockchain pubblica
I rischi individuati da Mindgard
Mindgard non ha verificato l’efficacia pratica delle istruzioni fornite dai modelli, ma sostiene che il solo fatto di poter ottenere questo tipo di risposte dimostri un fallimento dei meccanismi di protezione concepiti per impedire all’AI di interagire con richieste pericolose. La società ha inoltre avvertito che un Kimi K2.6 sottoposto a jailbreak potrebbe, potenzialmente, eseguire codice sulle proprie risorse computazionali e connettersi a internet, trasformandosi in un possibile punto di partenza per cyberattacchi.
Moonshot, dal canto suo, afferma che le valutazioni interne avevano in generale mostrato “un alto tasso di rifiuto per questo tipo di richieste”, evidenziando così uno scarto significativo tra i test di routine e l’approccio più aggressivo adottato dai ricercatori esterni.
Il professor Alan Woodward, dell’Università di Surrey, ha spiegato alla BBC che i modelli open source possono esporre a rischi di abuso una volta finiti nelle mani di attori malevoli, pur essendo al tempo stesso strumenti utili per la difesa cyber.
Secondo Woodward, la regolamentazione difficilmente riuscirà a tenere il passo con l’evoluzione dell’AI e l’enforcement dovrebbe concentrarsi con maggiore decisione sugli individui che ne fanno un uso improprio.
La preoccupazione va oltre questo singolo test: i modelli Kimi di Moonshot sono “open-weight”, il che significa che gli utenti possono eseguirli sulle proprie infrastrutture. Allo stesso tempo, diversi incidenti recenti in ambito sicurezza AI hanno coinvolto anche sistemi agentici di OpenAI, Meta e Anthropic. Questo combinato disposto sta spingendo la comunità di ricerca a non limitarsi a valutare se i modelli rifiutino una richiesta pericolosa, ma anche a indagare cosa accade quando sistemi potenti ottengono accesso a strumenti esterni, a internet e a un margine operativo sufficiente per agire in più passaggi.
Prossima lettura: Le altcoin rappresentano il 41% dell’open interest sui futures, il volume spot è 4 volte quello di Bitcoin

