Jailbreak Kimi Moonshot Buka Celah Dua Model AI Menjawab Pertanyaan Senjata Biologis

Researchers bypassed Kimi safety controls in two Moonshot models during jailbreak testing (Image: Shutterstock)
Researchers bypassed Kimi safety controls in two Moonshot models during jailbreak testing (Image: Shutterstock)

Moonshot AI tengah meninjau ulang dua model Kimi setelah peneliti Mindgard berhasil menembus sistem keamanan (safety controls) dan memperoleh instruksi terkait senjata biologis dan skenario pembunuhan terarah.

Poin Penting

  • Mindgard menyatakan Kimi K2.6 dan K3 Swarm dapat didorong melewati mekanisme pengaman melalui teknik jailbreaking.
  • Peneliti tidak membuktikan apakah jawaban berbahaya itu benar‑benar dapat dijalankan di dunia nyata.
  • Moonshot menyebut sedang menelaah temuan tersebut dan berdiskusi langsung dengan Mindgard.

Temuan Jailbreak Kimi

BBC melaporkan bahwa Mindgard pada Juli menemukan Kimi K2.6 dan K3 Swarm dapat dipaksa melampaui rambu pengembang melalui jailbreaking, yakni penggunaan prompt terstruktur untuk menguji apakah model akan mengabaikan aturan keselamatan. Menurut Mindgard, seharusnya kontrol tersebut memblokir percakapan mengenai topik seperti senjata biologis.

Pendiri Mindgard, Peter Garraghan, mengatakan kepada BBC bahwa setelah jailbreak berhasil, model dapat berbicara hampir tentang topik apa pun dan bahkan menawarkan saran berbahaya tambahan tanpa perlu dipicu lagi oleh pengguna.

Moonshot mengatakan kepada BBC bahwa mereka menyambut masukan pihak ketiga “sebagai pilar utama untuk membangun AI yang lebih baik dan lebih aman” dan menegaskan sedang membahas temuan Mindgard. Mindgard mengklaim telah mengirim email ke Moonshot pada 27 Juli, menindaklanjuti sekitar sepekan kemudian, dan kemudian mempublikasikan temuannya pada 12 September.

Baca Juga: Ripple Bantu CSD BR Brasil Cerminkan Kepemilikan Reksa Dana di Blockchain Publik

Risiko Keamanan Versi Mindgard

Mindgard belum membuktikan bahwa respons model dapat dieksekusi secara efektif di lapangan. Namun, perusahaan itu berargumen bahwa fakta model bersedia memberikan jawaban semacam itu saja sudah menunjukkan kegagalan lapisan pengaman yang dirancang untuk menolak permintaan berbahaya.

Mindgard juga menyoroti bahwa Kimi K2.6 yang telah dijailbreak secara teoritis dapat mengeksekusi kode pada sumber daya komputasinya sendiri dan terhubung ke internet, sehingga berpotensi menjadi titik awal serangan siber jika disalahgunakan.

Moonshot menanggapi bahwa evaluasi internal mereka sejauh ini menunjukkan “tingkat penolakan yang tinggi untuk jenis permintaan seperti ini”, menggarisbawahi adanya kesenjangan antara pengujian rutin dan pendekatan advesarial yang digunakan peneliti eksternal.

Alan Woodward, profesor di University of Surrey, mengatakan kepada BBC bahwa model open‑source menimbulkan risiko penyalahgunaan ketika jatuh ke tangan pelaku jahat, meski teknologi yang sama juga dapat dimanfaatkan untuk pertahanan siber.

Ia berpendapat regulasi cenderung tertinggal dibanding kecepatan perkembangan AI, sehingga penegakan hukum sebaiknya lebih difokuskan kepada individu dan kelompok yang menyalahgunakan sistem tersebut, bukannya semata‑mata pada teknologinya.

Kekhawatiran yang lebih luas ini muncul jauh sebelum pengujian Mindgard: model Kimi milik Moonshot menggunakan pendekatan open‑weight, sehingga pengguna bisa menjalankannya di infrastruktur mereka sendiri. Dalam beberapa insiden keamanan AI terakhir, sistem agen milik OpenAI, Meta, dan Anthropic juga ikut tersorot.

Kombinasi faktor tersebut mendorong komunitas riset untuk tidak hanya menilai seberapa sering model menolak permintaan berbahaya, tetapi juga menelaah apa yang terjadi ketika sistem yang kuat diberi akses ke alat, internet, dan kewenangan untuk mengeksekusi rangkaian tindakan secara otomatis dan bertahap.

Selanjutnya: Altcoin Kuasai 41% Open Interest Futures, Volume Spot Tembus 4x Bitcoin

Alexey Bondarev profile photo

Alexey Bondarev

Alexey Bondarev adalah Kepala Konten di Yellow.com, dan telah meliput dunia kripto selama 10 tahun terakhir. Ia mengkhususkan diri dalam artikel Riset Mendalam dan Belajar, dengan fokus pada pelaporan analitis, konteks industri, dan kekuatan besar yang membentuk dunia kripto, mulai dari era AI dan teknologi keamanan hingga inovasi fintech. Ia percaya bahwa segala sesuatu yang digital akan segera mengungguli segala sesuatu yang analog dan bekerja keras untuk mewujudkannya.

Penafian dan Peringatan Risiko: Informasi yang diberikan dalam artikel ini hanya untuk tujuan edukasi dan informasi dan berdasarkan opini penulis. Ini tidak merupakan saran keuangan, investasi, hukum, atau pajak. Aset kripto sangat fluktuatif dan mengalami risiko tinggi, termasuk risiko kehilangan seluruh atau sebagian besar investasi Anda. Trading atau memegang aset kripto mungkin tidak cocok untuk semua investor. Pandangan yang dinyatakan dalam artikel ini adalah pandangan penulis saja dan tidak mewakili kebijakan resmi atau posisi Yellow, pendirinya, atau eksekutifnya. Selalu lakukan riset menyeluruh Anda sendiri (D.Y.O.R.) dan konsultasikan dengan profesional keuangan berlisensi sebelum membuat keputusan investasi apapun.
Jailbreak Kimi Moonshot Buka Celah Dua Model AI Menjawab Pertanyaan Senjata Biologis | Yellow