Moonshot AI tengah meninjau ulang dua model Kimi setelah peneliti Mindgard berhasil menembus lapisan pengaman dan mendapatkan instruksi terkait pembuatan senjata biologis serta skenario pembunuhan terarah.
Pokok Temuan
- Mindgard menyatakan Kimi K2.6 dan K3 Swarm bisa didorong melampaui batasan keamanan lewat jailbreak.
- Peneliti tidak membuktikan apakah jawaban berbahaya tersebut bisa berhasil jika diterapkan di dunia nyata.
- Moonshot menyebut sedang meninjau temuan itu dan berdiskusi langsung dengan Mindgard.
Rincian Jailbreak Kimi
BBC melaporkan bahwa Mindgard pada Juli menemukan Kimi K2.6 dan K3 Swarm dapat dipaksa melewati rambu pengaman pengembang melalui jailbreak, yakni teknik yang memakai rangkaian prompt terstruktur untuk menguji apakah model mau mengabaikan aturan keselamatan. Mindgard menilai sistem seharusnya otomatis menolak percakapan terkait topik berbahaya tersebut.
Pendiri Mindgard, Peter Garraghan, mengatakan kepada BBC bahwa setelah jailbreak berhasil, model mampu membahas hampir semua topik dan bahkan memberikan saran tambahan yang berpotensi berbahaya tanpa perlu dipancing lebih jauh.
Moonshot menyampaikan kepada BBC bahwa mereka menyambut masukan pihak ketiga “sebagai pilar kunci untuk membangun AI yang lebih baik dan aman”, dan kini tengah membahas temuan tersebut bersama Mindgard. Mindgard menyebut telah mengirim email ke Moonshot pada 27 Juli, mengirim pengingat sekitar sepekan kemudian, dan mempublikasikan hasil penelitiannya pada 12 September.
Baca Juga: Ripple Bantu CSD BR Brasil Cerminkan Kepemilikan Reksa Dana di Blockchain Publik
Risiko Keamanan Versi Mindgard
Mindgard belum membuktikan bahwa respons berbahaya itu akan efektif jika dipraktikkan, tetapi menilai fakta bahwa model bersedia memberikan jawaban tersebut sudah menjadi bukti kegagalan sistem pengaman yang dirancang untuk menolak permintaan berbahaya. Perusahaan itu juga menggarisbawahi bahwa Kimi K2.6 yang sudah dijailbreak berpotensi mengeksekusi kode di infrastruktur komputasi yang digunakan dan tersambung ke internet, sehingga bisa menjadi titik awal serangan siber.
Moonshot menanggapi bahwa evaluasi internal mereka secara umum menunjukkan “tingkat penolakan yang tinggi untuk permintaan sejenis ini”, menyoroti adanya celah antara hasil pengujian rutin dan pendekatan adversarial yang digunakan peneliti eksternal.
Alan Woodward, profesor di University of Surrey, menjelaskan kepada BBC bahwa model open‑source meningkatkan risiko penyalahgunaan ketika jatuh ke tangan aktor jahat, meskipun teknologi yang sama juga dapat dipakai untuk memperkuat pertahanan siber.
Menurut dia, regulasi cenderung sulit mengejar kecepatan perkembangan AI, sehingga penegakan sebaiknya lebih menitikberatkan pada pelaku yang menyalahgunakan sistem, bukan sekadar pada teknologinya.
Kekhawatiran yang lebih luas sebenarnya sudah muncul sebelum uji ini: model Kimi milik Moonshot menggunakan skema open‑weight sehingga bisa dijalankan langsung di infrastruktur pengguna. Di saat yang sama, insiden keamanan AI terbaru juga melibatkan sistem agen dari OpenAI, Meta, dan Anthropic. Kombinasi tersebut mendorong peneliti untuk tidak hanya fokus pada kemampuan model menolak permintaan berbahaya, tetapi juga pada apa yang terjadi ketika sistem kuat dibekali akses alat, koneksi internet, dan izin untuk bertindak dalam beberapa langkah berantai.
Artikel Selanjutnya: Altcoin Sumbang 41% Open Interest Futures, Volume Spot Tembus 4x Bitcoin

