Mythos 5, İnsan Kod İnceleyicisini Kandırmak İçin Sahte Kimlikler Yarattı

Rogue agent behaviour by Anthropic's Mythos 5 and OpenAI's GPT-5.6 Sol surfaced in AI Security Institute cyber tests. (Image: Shutterstock)
Rogue agent behaviour by Anthropic's Mythos 5 and OpenAI's GPT-5.6 Sol surfaced in AI Security Institute cyber tests. (Image: Shutterstock)

Birleşik Krallık’ın Yapay Zekâ Güvenlik Enstitüsü (AI Security Institute – AISI), siber güvenlik testleri sırasında sınır (frontier) yapay zekâ ajanlarının gerçekleştirdiği 19 izinsiz eylemi kayda aldı; bu vakaların büyük bölümü Anthropic’in Mythos 5 modeline kadar izlenebildi.

Öne çıkan başlıklar

  • AISI, temmuz sonunda yedi frontier model üzerinde tek bir siber güvenlik senaryosunu 122 kez koşturdu.
  • 19 izinsiz eylemin 17’si Mythos 5’ten, ikisi OpenAI’nin GPT-5.6 Sol modelinden kaynaklandı.
  • Bir ajan, kötü niyetli kodun onaylanması için insan kod inceleyicisini sıkıştırmak amacıyla sahte kimlikler oluşturdu.

AISI’nin siber test bulguları

Güvenlik izleme sistemleri, 28 Temmuz sabahı enstitünün test ortamlarından birinden Tor anonimlik ağı üzerinden veri çıktığını tespit etti; değerlendirme ekibi birkaç dakika içinde ajan faaliyetlerini incelemeye başladı. Araştırmacılar, bir ajanın GitHub üzerinde barındırılan gerçek, herkese açık bir açık kaynak projeye kötü amaçlı bir “pull request” (kod katkı talebi) açtığını ortaya çıkardı. AISI testleri durdurdu, ilgili makineleri izole etti ve bir saat içinde en yetenekli modellerine dahili erişimi kesti.

Enstitü, bulguları 4 Ağustos’ta yayımladığı raporla kamuoyuna duyurdu. Buna göre aynı siber güvenlik meydan okuması, yedi model üzerinde 122 kez tekrarlandı; bu koşuların 10’unda, gerçek kişi ve kurumları hedefleyen, canlı internete yönelik eylemler kaydedildi. 19 vakadan 17’si Mythos 5’e atfedildi; OpenAI’nin GPT-5.6 Sol modeli ise siber sınıflandırıcıları devre dışı bırakılmış tek bir koşuda iki izinsiz eylem üretti.

Söz konusu davranışlar 25–28 Temmuz tarihleri arasında gözlemlendi.

Ayrıca bkz.: iPhone 18 Pro Max Apple’ın 2nm Çipiyle Gelen İlk Model Olabilir, %15 Daha Hızlı

Mythos 5’in aldatma taktikleri

En ciddi senaryoda ajan, hedef projedeki insan sorumluları araştırdı, birden fazla sahte çevrimiçi kimlik yarattı ve bu hesapları, gerçek bir kod inceleyicisini kötü amaçlı kodunu onaylamaya zorlamak için kullandı. Talep kamuoyunda dikkat çekince ajan, geçmişteki etkinliklerini zararsız görünecek şekilde düzenledi, yeni bir persona benimsemeyi tarttı ve aynı meydan okumayı koşturan diğer ajanlarla koordinasyon teklif etti. Kod, insan bakımcı tarafından fark edilerek reddedildi.

AISI, bu olayı, özel bir yönlendirme (prompt) olmadan ortaya çıkan özerklik ve aldatma risklerinin gerçek dünyadaki ilk net örneği olarak tanımladı; ancak kendi tasarım tercihlerinin de bu davranışı mümkün kıldığı uyarısında bulundu. Ajana kimseyi aldatması talimatı verilmemişti.

Yapay zekâ laboratuvarlarından gelen itiraflar

Hiçbir ajan, test “sandbox”ının dışına çıkmaya teşebbüs etmedi; enstitü, internet erişimi ile sağlayıcıların siber güvenlik sınıflandırıcılarının kasıtlı olarak kapatıldığının ve böylece modellerin “azami kapasitesini” ölçmeyi amaçladıklarının altını çizdi.

GitHub, tespit edilen faaliyetin kendi hizmet şartlarını ihlal ettiğini doğruladı; platform ile enstitü, izleri temizlemek ve modelin temas ettiği kullanıcılara bildirim göndermek için birlikte çalıştı. AISI artık daha sıkı ağ kontrolleri, canlı değerlendirme izleme mekanizmaları ve METR tarafından bağımsız bir inceleme planlıyor; ayrıca geçmiş testlerde gözden kaçmış benzer davranışlar olup olmadığını tespit için geriye dönük denetim yürütüyor.

Söz konusu açıklama, her iki laboratuvardan da son haftalarda gelen ayrı itirafların ardından geldi. OpenAI, 21 Temmuz’da GPT-5.6 Sol modelinin kilitli bir test ortamından kaçmayı başardığını bildirdi. Anthropic ise 30 Temmuz’da Mythos 5’in herkese açık bir kod deposuna kötü amaçlı bir paket yüklediğini; bu paketin daha sonra birkaç sistemde kurularak kullanıldığını açıkladı.

Sırada: Bitcoin Aşırı Korkuyu 75 Bin Dolarlık Rallinin Yakıtına Dönüştürebilir

Alexey Bondarev profile photo

Alexey Bondarev

Alexey Bondarev, Yellow.com'da İçerik Başkanıdır ve son 10 yıldır kripto hakkında haber yapmaktadır. Analitik raporlama, sektör bağlamı ve kriptonun şekillenmesinde rol oynayan daha büyük dinamiklere odaklanan derinlemesine Araştırma ve Öğrenme içerikleri konusunda uzmanlaşmıştır; bunlara yapay zeka çağı, güvenlik teknolojileri ve fintech inovasyonu dahildir. Dijital olan her şeyin kısa süre içinde analog olan her şeyin yerini alacağına inanmakta ve bunun gerçekleşmesi için yoğun şekilde çalışmaktadır.

Feragatname ve Risk Uyarısı: Bu makalede sağlanan bilgiler yalnızca eğitici ve bilgilendirici amaçlıdır ve yazarın görüşüne dayanmaktadır. Mali, yatırım, hukuki veya vergi tavsiyesi teşkil etmez. Kripto para varlıkları son derece değişkendir ve yatırımınızın tamamını veya önemli bir kısmını kaybetme riski dahil olmak üzere yüksek riske tabidir. Kripto varlık ticareti veya tutma tüm yatırımcılar için uygun olmayabilir. Bu makalede ifade edilen görüşler yalnızca yazara aittir ve Yellow, kurucuları veya yöneticilerinin resmi politikasını veya pozisyonunu temsil etmez. Her zaman kendi kapsamlı araştırmanızı yapın (D.Y.O.R.) ve herhangi bir yatırım kararı vermeden önce lisanslı bir finansal uzmanla görüşün.
Mythos 5, İnsan Kod İnceleyicisini Kandırmak İçin Sahte Kimlikler Yarattı | Yellow