Moonshot AI tengah meninjau ulang dua model Kimi setelah peneliti Mindgard berhasil menembus sistem keamanan (safety controls) dan memperoleh instruksi terkait senjata biologis dan skenario pembunuhan terarah.
Poin Penting
- Mindgard menyatakan Kimi K2.6 dan K3 Swarm dapat didorong melewati mekanisme pengaman melalui teknik jailbreaking.
- Peneliti tidak membuktikan apakah jawaban berbahaya itu benar‑benar dapat dijalankan di dunia nyata.
- Moonshot menyebut sedang menelaah temuan tersebut dan berdiskusi langsung dengan Mindgard.
Temuan Jailbreak Kimi
BBC melaporkan bahwa Mindgard pada Juli menemukan Kimi K2.6 dan K3 Swarm dapat dipaksa melampaui rambu pengembang melalui jailbreaking, yakni penggunaan prompt terstruktur untuk menguji apakah model akan mengabaikan aturan keselamatan. Menurut Mindgard, seharusnya kontrol tersebut memblokir percakapan mengenai topik seperti senjata biologis.
Pendiri Mindgard, Peter Garraghan, mengatakan kepada BBC bahwa setelah jailbreak berhasil, model dapat berbicara hampir tentang topik apa pun dan bahkan menawarkan saran berbahaya tambahan tanpa perlu dipicu lagi oleh pengguna.
Moonshot mengatakan kepada BBC bahwa mereka menyambut masukan pihak ketiga “sebagai pilar utama untuk membangun AI yang lebih baik dan lebih aman” dan menegaskan sedang membahas temuan Mindgard. Mindgard mengklaim telah mengirim email ke Moonshot pada 27 Juli, menindaklanjuti sekitar sepekan kemudian, dan kemudian mempublikasikan temuannya pada 12 September.
Baca Juga: Ripple Bantu CSD BR Brasil Cerminkan Kepemilikan Reksa Dana di Blockchain Publik
Risiko Keamanan Versi Mindgard
Mindgard belum membuktikan bahwa respons model dapat dieksekusi secara efektif di lapangan. Namun, perusahaan itu berargumen bahwa fakta model bersedia memberikan jawaban semacam itu saja sudah menunjukkan kegagalan lapisan pengaman yang dirancang untuk menolak permintaan berbahaya.
Mindgard juga menyoroti bahwa Kimi K2.6 yang telah dijailbreak secara teoritis dapat mengeksekusi kode pada sumber daya komputasinya sendiri dan terhubung ke internet, sehingga berpotensi menjadi titik awal serangan siber jika disalahgunakan.
Moonshot menanggapi bahwa evaluasi internal mereka sejauh ini menunjukkan “tingkat penolakan yang tinggi untuk jenis permintaan seperti ini”, menggarisbawahi adanya kesenjangan antara pengujian rutin dan pendekatan advesarial yang digunakan peneliti eksternal.
Alan Woodward, profesor di University of Surrey, mengatakan kepada BBC bahwa model open‑source menimbulkan risiko penyalahgunaan ketika jatuh ke tangan pelaku jahat, meski teknologi yang sama juga dapat dimanfaatkan untuk pertahanan siber.
Ia berpendapat regulasi cenderung tertinggal dibanding kecepatan perkembangan AI, sehingga penegakan hukum sebaiknya lebih difokuskan kepada individu dan kelompok yang menyalahgunakan sistem tersebut, bukannya semata‑mata pada teknologinya.
Kekhawatiran yang lebih luas ini muncul jauh sebelum pengujian Mindgard: model Kimi milik Moonshot menggunakan pendekatan open‑weight, sehingga pengguna bisa menjalankannya di infrastruktur mereka sendiri. Dalam beberapa insiden keamanan AI terakhir, sistem agen milik OpenAI, Meta, dan Anthropic juga ikut tersorot.
Kombinasi faktor tersebut mendorong komunitas riset untuk tidak hanya menilai seberapa sering model menolak permintaan berbahaya, tetapi juga menelaah apa yang terjadi ketika sistem yang kuat diberi akses ke alat, internet, dan kewenangan untuk mengeksekusi rangkaian tindakan secara otomatis dan bertahap.
Selanjutnya: Altcoin Kuasai 41% Open Interest Futures, Volume Spot Tembus 4x Bitcoin

