Moonshot AI, Mindgard araştırmacılarının güvenlik kontrollerini aşarak biyolojik silahlar ve suikast yöntemleriyle ilgili talimatlar elde etmesinin ardından iki Kimi modelini incelemeye aldığını açıkladı.
Öne Çıkanlar
- Mindgard, Kimi K2.6 ve K3 Swarm modellerinin “jailbreak” ile güvenlik bariyerlerinin ötesine itilabildiğini bildirdi.
- Araştırmacılar, üretilen zararlı yanıtların pratikte işe yarayacağını kanıtlamadı.
- Moonshot, bulguları incelediğini ve Mindgard ile temas halinde olduğunu söyledi.
Kimi Jailbreak Bulguları
BBC’nin haberine göre Mindgard, Temmuz ayında Kimi K2.6 ve K3 Swarm modellerinin, geliştirici tarafından konulan güvenlik raylarını “jailbreak” yöntemiyle aşabildiğini keşfetti. Bu yöntem, modelin güvenlik kurallarını yok sayıp saymayacağını görmek için yapılandırılmış istemler (prompt) kullanıyor. Mindgard, denenen senaryoların normalde bu tür konuları tamamen engellemesi gerektiğini vurguladı.
Şirketin kurucusu Peter Garraghan, BBC’ye yaptığı açıklamada, jailbreak başarılı olduktan sonra modellerin neredeyse her konuyu ele alabildiğini ve ek bir yönlendirme olmaksızın daha da zararlı önerilerde bulunabildiğini söyledi.
Moonshot, BBC’ye yaptığı açıklamada, daha iyi ve daha güvenli yapay zekâ geliştirilmesinde “üçüncü taraf geri bildiriminin temel sütun” olduğunu belirterek, Mindgard’ın bulgularını şirketle birlikte değerlendirdiklerini ifade etti. Mindgard, Moonshot’a 27 Temmuz’da e-posta gönderdiğini, yaklaşık bir hafta sonra tekrar hatırlatma yaptığını ve bulgularını 12 Eylül’de yayımladığını aktardı.
Ayrıca Oku: Ripple, Brezilya'nın CSD BR Kuruluşuna Fon Sahipliğini Halka Açık Blokzincire Taşımada Yardım Ediyor
Mindgard’ın İşaret Ettiği Güvenlik Riskleri
Mindgard, modellerin verdiği cevapların gerçek hayatta işe yarayacağını kanıtlamış değil; ancak bu bulgunun bile, sistemleri tehlikeli taleplerle etkileşime girmekten alıkoyması gereken güvenlik şeritlerinin işlevsel olmadığını gösterdiğini savunuyor. Ayrıca firmanın değerlendirmesine göre, “jailbreak” edilmiş bir Kimi K2.6 modeli, kendi hesaplama kaynakları üzerinde kod çalıştırabilme ve internete bağlanabilme potansiyeline sahip olabilir; bu da olası bir siber saldırı üssü yaratıyor.
Moonshot, şirket içi testlerin genel olarak “bu tür taleplerde yüksek ret oranı” ortaya koyduğunu belirterek, rutin kontroller ile dış araştırmacıların uyguladığı saldırgan (adversarial) test yöntemleri arasında bir boşluk bulunduğuna dikkat çekti.
Surrey Üniversitesi’nden profesör Alan Woodward, BBC’ye yaptığı değerlendirmede, açık kaynaklı modellerin kötü niyetli kişilerin eline geçtiğinde ciddi suistimal riskleri yarattığını, ancak aynı araçların siber savunma amaçlı da kullanılabildiğini söyledi.
Woodward, düzenleyici çerçevelerin yapay zekâ gelişiminin hızına yetişmesinin zor olduğuna işaret ederek, denetimin daha çok sistemleri kötüye kullanan kişiler üzerinde yoğunlaşması gerektiğini savundu.
Endişeler ise bu testle sınırlı değil: Moonshot’un Kimi modelleri “open-weight” yapıda, yani kullanıcılar bu modelleri kendi altyapıları üzerinde çalıştırabiliyor. Son dönemde yaşanan yapay zekâ güvenlik olaylarında OpenAI, Meta ve Anthropic tarafından geliştirilen ajan sistemler de gündeme gelmişti. Tüm bu unsurlar, araştırmacıları yalnızca modelin talepleri reddedip etmediğine değil, güçlü sistemlere araçlar, internet erişimi ve çok adımlı işlem yapma yetkisi verildiğinde neler olabileceğine odaklanmaya zorluyor.
Sıradaki Haber: Altcoinler Vadeli İşlem Açık Pozisyonlarının %41’ini Oluşturdu, Spot Hacim Bitcoin’in 4 Katına Çıktı

