Moonshot AI, Mindgard araştırmacılarının iki Kimi modelindeki güvenlik kontrollerini aşarak biyolojik silah üretimi ve suikast planlamasına dair talimatlar elde etmesinin ardından, söz konusu modelleri mercek altına aldı.
Öne çıkanlar
- Mindgard, Kimi K2.6 ve K3 Swarm modellerinin jailbreak yoluyla güvenlik bariyerlerinin dışına itilebildiğini belirtti.
- Araştırmacılar, modellerin ürettiği zararlı yanıtların pratikte işe yarayacağını kanıtlamadı.
- Moonshot, bulguları incelediğini ve Mindgard ile istişare yürüttüğünü açıkladı.
Kimi jailbreak bulguları
BBC’nin haberine göre Mindgard, Temmuz ayında, Kimi K2.6 ve K3 Swarm modellerinin geliştirici korumalarını jailbreak yöntemiyle aşabildiğini keşfetti. Bu yaklaşım, yapılandırılmış komutlarla bir modelin güvenlik kurallarını görmezden gelip gelmediğini test etmeye dayanıyor. Mindgard, bu kontrollerin normalde bu tür konulara dair konuşmayı engellemesi gerektiğini vurguladı.
Kurucu Peter Garraghan, BBC’ye yaptığı açıklamada, jailbreak işlemi başarılı olduktan sonra modellerin neredeyse her konuda konuşmaya başladığını ve ek bir yönlendirme olmadan da daha zararlı öneriler sunabildiğini söyledi.
Moonshot, BBC’ye gönderdiği yanıtta üçüncü taraf geri bildirimlerini “daha iyi ve daha güvenli yapay zekâ inşa etmenin temel ayağı” olarak gördüğünü belirtti ve bulguları Mindgard ile birlikte değerlendirdiklerini kaydetti. Mindgard, Moonshot’a ilk e-postayı 27 Temmuz’da ilettiğini, yaklaşık bir hafta sonra yeniden hatırlatma yaptığını ve sonuçları 12 Eylül’de yayımladığını bildirdi.
Mindgard’ın tespit ettiği güvenlik riskleri
Mindgard, modellerin verdiği talimatların sahada gerçekten uygulanabilir olduğunu kanıtlamadı; ancak bu durumun tek başına, sistemlerin tehlikeli taleplerle etkileşime girmesini önlemek için tasarlanan güvenlik katmanlarının başarısızlığına işaret ettiğini savundu. Şirket ayrıca, jailbreak edilmiş bir Kimi K2.6 modelinin kendi hesaplama kaynakları üzerinde kod çalıştırabilme ve internete bağlanabilme ihtimaline dikkat çekerek, bunun potansiyel bir siber saldırı sıçrama tahtası oluşturabileceğini dile getirdi.
Moonshot, kendi iç testlerinde bu tür taleplere karşı “yüksek reddetme oranı” gözlendiğini, ancak bunun rutin kontroller ile dış araştırmacıların kullandığı düşmanca (adversarial) yöntemler arasındaki farkı ortaya koyduğunu söyledi.
Surrey Üniversitesi’nden profesör Alan Woodward, BBC’ye yaptığı değerlendirmede, açık kaynaklı modellerin kötü niyetli kişilerin eline geçtiğinde suistimal riskini artırdığını, aynı araçların siber savunmayı güçlendirmek için de kullanılabileceğini ifade etti.
Woodward, düzenleyici çerçevelerin yapay zekâdaki hızlı gelişim hızına yetişemeyeceğini, bu nedenle denetimin asıl olarak sistemleri kötüye kullanan kişiler üzerinde yoğunlaşması gerektiğini savundu.
Söz konusu endişe, bu testten önce de gündemdeydi: Moonshot’ın Kimi modelleri “open-weight” niteliğinde; yani kullanıcılar bu modelleri kendi altyapıları üzerinde çalıştırabiliyor. Son dönemdeki yapay zekâ güvenliği vakaları ise OpenAI, Meta ve Anthropic tarafından geliştirilen ajan sistemleri de kapsıyor. Bu tablo, araştırmacıları yalnızca modelin “reddetme” davranışına değil, güçlü sistemlere araçlar, internet erişimi ve çok adımlı aksiyon yetkisi verildiğinde neler olabileceğine de odaklanmaya zorluyor.
Sıradaki Haber: Altcoinler vadeli işlemlerde açık pozisyonların %41’ini aldı, spot hacim Bitcoin’in 4 katına çıktı

