Moonshot’ın Kimi modelleri biyolojik silah sorularına verdiği yanıtlar sonrası incelemede

Researchers bypassed Kimi safety controls in two Moonshot models during jailbreak testing (Image: Shutterstock)
Researchers bypassed Kimi safety controls in two Moonshot models during jailbreak testing (Image: Shutterstock)

Moonshot AI, Mindgard araştırmacılarının iki Kimi modelindeki güvenlik kontrollerini aşarak biyolojik silah üretimi ve suikast planlamasına dair talimatlar elde etmesinin ardından, söz konusu modelleri mercek altına aldı.

Öne çıkanlar

  • Mindgard, Kimi K2.6 ve K3 Swarm modellerinin jailbreak yoluyla güvenlik bariyerlerinin dışına itilebildiğini belirtti.
  • Araştırmacılar, modellerin ürettiği zararlı yanıtların pratikte işe yarayacağını kanıtlamadı.
  • Moonshot, bulguları incelediğini ve Mindgard ile istişare yürüttüğünü açıkladı.

Kimi jailbreak bulguları

BBC’nin haberine göre Mindgard, Temmuz ayında, Kimi K2.6 ve K3 Swarm modellerinin geliştirici korumalarını jailbreak yöntemiyle aşabildiğini keşfetti. Bu yaklaşım, yapılandırılmış komutlarla bir modelin güvenlik kurallarını görmezden gelip gelmediğini test etmeye dayanıyor. Mindgard, bu kontrollerin normalde bu tür konulara dair konuşmayı engellemesi gerektiğini vurguladı.

Kurucu Peter Garraghan, BBC’ye yaptığı açıklamada, jailbreak işlemi başarılı olduktan sonra modellerin neredeyse her konuda konuşmaya başladığını ve ek bir yönlendirme olmadan da daha zararlı öneriler sunabildiğini söyledi.

Moonshot, BBC’ye gönderdiği yanıtta üçüncü taraf geri bildirimlerini “daha iyi ve daha güvenli yapay zekâ inşa etmenin temel ayağı” olarak gördüğünü belirtti ve bulguları Mindgard ile birlikte değerlendirdiklerini kaydetti. Mindgard, Moonshot’a ilk e-postayı 27 Temmuz’da ilettiğini, yaklaşık bir hafta sonra yeniden hatırlatma yaptığını ve sonuçları 12 Eylül’de yayımladığını bildirdi.

Ayrıca Oku: Ripple, Brezilya'nın CSD BR kurumuna fon sahipliğini halka açık bir blockchain üzerinde yansıtma konusunda destek veriyor

Mindgard’ın tespit ettiği güvenlik riskleri

Mindgard, modellerin verdiği talimatların sahada gerçekten uygulanabilir olduğunu kanıtlamadı; ancak bu durumun tek başına, sistemlerin tehlikeli taleplerle etkileşime girmesini önlemek için tasarlanan güvenlik katmanlarının başarısızlığına işaret ettiğini savundu. Şirket ayrıca, jailbreak edilmiş bir Kimi K2.6 modelinin kendi hesaplama kaynakları üzerinde kod çalıştırabilme ve internete bağlanabilme ihtimaline dikkat çekerek, bunun potansiyel bir siber saldırı sıçrama tahtası oluşturabileceğini dile getirdi.

Moonshot, kendi iç testlerinde bu tür taleplere karşı “yüksek reddetme oranı” gözlendiğini, ancak bunun rutin kontroller ile dış araştırmacıların kullandığı düşmanca (adversarial) yöntemler arasındaki farkı ortaya koyduğunu söyledi.

Surrey Üniversitesi’nden profesör Alan Woodward, BBC’ye yaptığı değerlendirmede, açık kaynaklı modellerin kötü niyetli kişilerin eline geçtiğinde suistimal riskini artırdığını, aynı araçların siber savunmayı güçlendirmek için de kullanılabileceğini ifade etti.

Woodward, düzenleyici çerçevelerin yapay zekâdaki hızlı gelişim hızına yetişemeyeceğini, bu nedenle denetimin asıl olarak sistemleri kötüye kullanan kişiler üzerinde yoğunlaşması gerektiğini savundu.

Söz konusu endişe, bu testten önce de gündemdeydi: Moonshot’ın Kimi modelleri “open-weight” niteliğinde; yani kullanıcılar bu modelleri kendi altyapıları üzerinde çalıştırabiliyor. Son dönemdeki yapay zekâ güvenliği vakaları ise OpenAI, Meta ve Anthropic tarafından geliştirilen ajan sistemleri de kapsıyor. Bu tablo, araştırmacıları yalnızca modelin “reddetme” davranışına değil, güçlü sistemlere araçlar, internet erişimi ve çok adımlı aksiyon yetkisi verildiğinde neler olabileceğine de odaklanmaya zorluyor.

Sıradaki Haber: Altcoinler vadeli işlemlerde açık pozisyonların %41’ini aldı, spot hacim Bitcoin’in 4 katına çıktı

Alexey Bondarev profile photo

Alexey Bondarev

Alexey Bondarev, Yellow.com'da İçerik Başkanıdır ve son 10 yıldır kripto hakkında haber yapmaktadır. Analitik habercilik, sektör bağlamı ve kriptoyu şekillendiren büyük güçlere odaklanan, derinlemesine Araştırma ve Öğrenme içerikleri üretme konusunda uzmanlaşmıştır; yapay zeka çağından ve güvenlik teknolojilerinden fintech inovasyonuna kadar. Her şeyin dijitalinin yakında her şeyin analogunu geride bırakacağına inanmakta ve bunun gerçekleşmesi için çok çalışmaktadır.

Feragatname ve Risk Uyarısı: Bu makalede sağlanan bilgiler yalnızca eğitici ve bilgilendirici amaçlıdır ve yazarın görüşüne dayanmaktadır. Mali, yatırım, hukuki veya vergi tavsiyesi teşkil etmez. Kripto para varlıkları son derece değişkendir ve yatırımınızın tamamını veya önemli bir kısmını kaybetme riski dahil olmak üzere yüksek riske tabidir. Kripto varlık ticareti veya tutma tüm yatırımcılar için uygun olmayabilir. Bu makalede ifade edilen görüşler yalnızca yazara aittir ve Yellow, kurucuları veya yöneticilerinin resmi politikasını veya pozisyonunu temsil etmez. Her zaman kendi kapsamlı araştırmanızı yapın (D.Y.O.R.) ve herhangi bir yatırım kararı vermeden önce lisanslı bir finansal uzmanla görüşün.
Moonshot’ın Kimi modelleri biyolojik silah sorularına verdiği yanıtlar sonrası incelemede | Yellow