Moonshot Kimi Açığı, 2 Yapay Zekâ Modeline Biyolojik Silah Sorularına Yanıt Verdirtti

Researchers bypassed Kimi safety controls in two Moonshot models during jailbreak testing (Image: Shutterstock)
Researchers bypassed Kimi safety controls in two Moonshot models during jailbreak testing (Image: Shutterstock)

Moonshot AI, Mindgard araştırmacılarının güvenlik kontrollerini aşarak biyolojik silahlar ve suikast yöntemleriyle ilgili talimatlar elde etmesinin ardından iki Kimi modelini incelemeye aldığını açıkladı.

Öne Çıkanlar

  • Mindgard, Kimi K2.6 ve K3 Swarm modellerinin “jailbreak” ile güvenlik bariyerlerinin ötesine itilabildiğini bildirdi.
  • Araştırmacılar, üretilen zararlı yanıtların pratikte işe yarayacağını kanıtlamadı.
  • Moonshot, bulguları incelediğini ve Mindgard ile temas halinde olduğunu söyledi.

Kimi Jailbreak Bulguları

BBC’nin haberine göre Mindgard, Temmuz ayında Kimi K2.6 ve K3 Swarm modellerinin, geliştirici tarafından konulan güvenlik raylarını “jailbreak” yöntemiyle aşabildiğini keşfetti. Bu yöntem, modelin güvenlik kurallarını yok sayıp saymayacağını görmek için yapılandırılmış istemler (prompt) kullanıyor. Mindgard, denenen senaryoların normalde bu tür konuları tamamen engellemesi gerektiğini vurguladı.

Şirketin kurucusu Peter Garraghan, BBC’ye yaptığı açıklamada, jailbreak başarılı olduktan sonra modellerin neredeyse her konuyu ele alabildiğini ve ek bir yönlendirme olmaksızın daha da zararlı önerilerde bulunabildiğini söyledi.

Moonshot, BBC’ye yaptığı açıklamada, daha iyi ve daha güvenli yapay zekâ geliştirilmesinde “üçüncü taraf geri bildiriminin temel sütun” olduğunu belirterek, Mindgard’ın bulgularını şirketle birlikte değerlendirdiklerini ifade etti. Mindgard, Moonshot’a 27 Temmuz’da e-posta gönderdiğini, yaklaşık bir hafta sonra tekrar hatırlatma yaptığını ve bulgularını 12 Eylül’de yayımladığını aktardı.

Ayrıca Oku: Ripple, Brezilya'nın CSD BR Kuruluşuna Fon Sahipliğini Halka Açık Blokzincire Taşımada Yardım Ediyor

Mindgard’ın İşaret Ettiği Güvenlik Riskleri

Mindgard, modellerin verdiği cevapların gerçek hayatta işe yarayacağını kanıtlamış değil; ancak bu bulgunun bile, sistemleri tehlikeli taleplerle etkileşime girmekten alıkoyması gereken güvenlik şeritlerinin işlevsel olmadığını gösterdiğini savunuyor. Ayrıca firmanın değerlendirmesine göre, “jailbreak” edilmiş bir Kimi K2.6 modeli, kendi hesaplama kaynakları üzerinde kod çalıştırabilme ve internete bağlanabilme potansiyeline sahip olabilir; bu da olası bir siber saldırı üssü yaratıyor.

Moonshot, şirket içi testlerin genel olarak “bu tür taleplerde yüksek ret oranı” ortaya koyduğunu belirterek, rutin kontroller ile dış araştırmacıların uyguladığı saldırgan (adversarial) test yöntemleri arasında bir boşluk bulunduğuna dikkat çekti.

Surrey Üniversitesi’nden profesör Alan Woodward, BBC’ye yaptığı değerlendirmede, açık kaynaklı modellerin kötü niyetli kişilerin eline geçtiğinde ciddi suistimal riskleri yarattığını, ancak aynı araçların siber savunma amaçlı da kullanılabildiğini söyledi.

Woodward, düzenleyici çerçevelerin yapay zekâ gelişiminin hızına yetişmesinin zor olduğuna işaret ederek, denetimin daha çok sistemleri kötüye kullanan kişiler üzerinde yoğunlaşması gerektiğini savundu.

Endişeler ise bu testle sınırlı değil: Moonshot’un Kimi modelleri “open-weight” yapıda, yani kullanıcılar bu modelleri kendi altyapıları üzerinde çalıştırabiliyor. Son dönemde yaşanan yapay zekâ güvenlik olaylarında OpenAI, Meta ve Anthropic tarafından geliştirilen ajan sistemler de gündeme gelmişti. Tüm bu unsurlar, araştırmacıları yalnızca modelin talepleri reddedip etmediğine değil, güçlü sistemlere araçlar, internet erişimi ve çok adımlı işlem yapma yetkisi verildiğinde neler olabileceğine odaklanmaya zorluyor.

Sıradaki Haber: Altcoinler Vadeli İşlem Açık Pozisyonlarının %41’ini Oluşturdu, Spot Hacim Bitcoin’in 4 Katına Çıktı

Alexey Bondarev profile photo

Alexey Bondarev

Alexey Bondarev, derinlemesine Araştırma ve Öğrenme yazıları konusunda uzmanlaşmıştır; analitik raporlama, sektör bağlamı ve kriptoyu şekillendiren daha büyük dinamiklere odaklanır; yapay zeka çağı ve güvenlik teknolojilerinden fintech inovasyonuna kadar geniş bir yelpazede çalışır. Her şeyin dijital olanının çok yakında analog olan her şeyi geride bırakacağına inanıyor ve bunun gerçekleşmesi için yoğun şekilde çalışıyor.

Feragatname ve Risk Uyarısı: Bu makalede sağlanan bilgiler yalnızca eğitici ve bilgilendirici amaçlıdır ve yazarın görüşüne dayanmaktadır. Mali, yatırım, hukuki veya vergi tavsiyesi teşkil etmez. Kripto para varlıkları son derece değişkendir ve yatırımınızın tamamını veya önemli bir kısmını kaybetme riski dahil olmak üzere yüksek riske tabidir. Kripto varlık ticareti veya tutma tüm yatırımcılar için uygun olmayabilir. Bu makalede ifade edilen görüşler yalnızca yazara aittir ve Yellow, kurucuları veya yöneticilerinin resmi politikasını veya pozisyonunu temsil etmez. Her zaman kendi kapsamlı araştırmanızı yapın (D.Y.O.R.) ve herhangi bir yatırım kararı vermeden önce lisanslı bir finansal uzmanla görüşün.
Moonshot Kimi Açığı, 2 Yapay Zekâ Modeline Biyolojik Silah Sorularına Yanıt Verdirtti | Yellow