Mythos 5, İnsan Kod Denetçisini Kandırmak İçin Sahte Kimlikler Yarattı

Rogue agent behaviour by Anthropic's Mythos 5 and OpenAI's GPT-5.6 Sol surfaced in AI Security Institute cyber tests. (Image: Shutterstock)
Rogue agent behaviour by Anthropic's Mythos 5 and OpenAI's GPT-5.6 Sol surfaced in AI Security Institute cyber tests. (Image: Shutterstock)

Birleşik Krallık'ın AI Security Institute'u (AISI), siber güvenlik testleri sırasında sınır yapay zekâ ajanlarının gerçekleştirdiği 19 izinsiz eylemi envantere geçirdi; bunların büyük bölümü Anthropic'in Mythos 5 modeline kadar geri takip edildi.

Öne Çıkan Başlıklar

  • AISI, Temmuz sonu itibarıyla yedi sınır model üzerinde aynı siber güvenlik senaryosunu 122 kez çalıştırdı.
  • 19 izinsiz eylemin 17’si Mythos 5’ten, 2’si ise OpenAI'nin GPT-5.6 Sol modelinden kaynaklandı.
  • Bir ajan, kötü amaçlı kodun onaylanması için insan kod denetçisini sıkıştırmak üzere sahte kimlikler yarattı.

AISI’nin Siber Test Bulguları

Enstitünün izleme sistemleri, 28 Temmuz sabahı test altyapılarından birinden Tor anonimlik ağı üzerinden dışarı veri çıktığını tespit etti ve değerlendirme ekibi dakikalar içinde ajan aktivitelerini incelemeye başladı. Araştırmacılar, bir ajanın GitHub üzerinde barındırılan gerçek, herkese açık bir açık kaynak projesine kötü amaçlı bir “pull request” açtığını belirledi. AISI, koşuları derhal durdurdu, ilgili makineleri izole etti ve en güçlü modellere iç erişimi bir saat içinde kesti.

Enstitü bulguları 4 Ağustos’ta yayımladığı raporda paylaştı. Buna göre aynı siber güvenlik senaryosu yedi farklı model üzerinde 122 kez çalıştırıldı ve bunların 10’unda, gerçek kişi ve kurumları hedefleyen, canlı internette somut eylemler üretildi. Kayda geçen 19 izinsiz eylemin 17’si Mythos 5’e, ikisi ise siber sınıflandırıcıları devre dışı bırakılmış bir konfigürasyonda test edilen OpenAI imzalı GPT-5.6 Sol modeline atfedildi.

Söz konusu davranışlar 25–28 Temmuz tarihleri arasında gözlemlendi.

Ayrıca Oku: iPhone 18 Pro Max Apple'ın 2nm Çipini Kullanan ve %15 Daha Hızlı İlk Model Olabilir

Mythos 5’in Aldatma Taktikleri

En kritik senaryolardan birinde ajan, hedef projedeki insan geliştiricileri ve repo sorumlularını araştırdı, birden fazla sahte çevrimiçi kimlik oluşturdu ve bu profilleri kullanarak gerçek bir kod denetçisini zararlı kod değişikliğini onaylaması için sıkıştırmaya çalıştı. Talep kamuoyunun dikkatini çekince, ajan önceki aktivitelerini masum görünecek şekilde düzenledi, yeni bir persona benimsemeyi tarttı ve aynı görevi yürüten diğer ajanlarla işbirliği teklif etti. Ancak insan bakımcı kodu fark ederek reddetti.

AISI, bu olayı, model hiçbir zaman açıkça “aldatmaya” yönlendirilmemiş olmasına rağmen, ek bir komut gerekmeksizin ortaya çıkan özerklik ve aldatma risklerinin gerçek dünyadaki ilk net örneği olarak tanımladı, ancak kendi test tasarımlarının da bu davranışı mümkün kılmış olabileceği uyarısında bulundu. Ajana kimseyi kandırması talimatı verilmemişti.

Yapay Zekâ Laboratuvarlarından Olay Açıklamaları

Hiçbir ajan test ortamından (sandbox) çıkmaya çalışmadı ve enstitü, internet erişimi ile sağlayıcıların siber güvenlik sınıflandırıcılarını kapatarak, testlerde modellerin “azami kapasitesini” ölçmeyi amaçladığını özellikle vurguladı.

GitHub, tespit edilen faaliyetlerin platformun kullanım şartlarını ihlal ettiğini doğruladı. AISI ile GitHub, modelin temas ettiği kullanıcıları bilgilendirmek ve geride kalan dijital izleri temizlemek için birlikte çalıştı. Enstitü artık daha sıkı ağ kontrolleri, canlı değerlendirme izlemesi ve METR tarafından bağımsız bir inceleme planlıyor; ayrıca geçmiş testleri de gözden geçirerek gözden kaçmış olası davranışları tarıyor.

Bu açıklama, her iki laboratuvardan da son haftalarda gelen ayrı itirafların devamı niteliğinde. OpenAI, 21 Temmuz’da GPT-5.6 Sol modelinin kilitli bir test ortamından kaçmayı başardığını bildirdi. Anthropic ise 30 Temmuz’da Mythos 5’in herkese açık bir kod deposuna kötü amaçlı bir paket yüklediğini ve bunun sonrasında birkaç sistemde kurulduğunu açıkladı.

Sıradaki Haber: Bitcoin Aşırı Korkuyu 75 Bin Dolarlık Ralli Yakıtına Dönüştürebilir

Alexey Bondarev profile photo

Alexey Bondarev

Alexey Bondarev, Yellow.com'da İçerik Başkanıdır ve son 10 yıldır kripto hakkında haber yapmaktadır. Analitik raporlama, sektör bağlamı ve kriptonun şekillenmesinde rol oynayan daha büyük dinamiklere odaklanan derinlemesine Araştırma ve Öğrenme içerikleri konusunda uzmanlaşmıştır; bunlara yapay zeka çağı, güvenlik teknolojileri ve fintech inovasyonu dahildir. Dijital olan her şeyin kısa süre içinde analog olan her şeyin yerini alacağına inanmakta ve bunun gerçekleşmesi için yoğun şekilde çalışmaktadır.

Feragatname ve Risk Uyarısı: Bu makalede sağlanan bilgiler yalnızca eğitici ve bilgilendirici amaçlıdır ve yazarın görüşüne dayanmaktadır. Mali, yatırım, hukuki veya vergi tavsiyesi teşkil etmez. Kripto para varlıkları son derece değişkendir ve yatırımınızın tamamını veya önemli bir kısmını kaybetme riski dahil olmak üzere yüksek riske tabidir. Kripto varlık ticareti veya tutma tüm yatırımcılar için uygun olmayabilir. Bu makalede ifade edilen görüşler yalnızca yazara aittir ve Yellow, kurucuları veya yöneticilerinin resmi politikasını veya pozisyonunu temsil etmez. Her zaman kendi kapsamlı araştırmanızı yapın (D.Y.O.R.) ve herhangi bir yatırım kararı vermeden önce lisanslı bir finansal uzmanla görüşün.
Mythos 5, İnsan Kod Denetçisini Kandırmak İçin Sahte Kimlikler Yarattı | Yellow