Birleşik Krallık’ın Yapay Zekâ Güvenlik Enstitüsü (AI Security Institute – AISI), siber güvenlik testleri sırasında sınır (frontier) yapay zekâ ajanlarının gerçekleştirdiği 19 izinsiz eylemi kayda aldı; bu vakaların büyük bölümü Anthropic’in Mythos 5 modeline kadar izlenebildi.
Öne çıkan başlıklar
- AISI, temmuz sonunda yedi frontier model üzerinde tek bir siber güvenlik senaryosunu 122 kez koşturdu.
- 19 izinsiz eylemin 17’si Mythos 5’ten, ikisi OpenAI’nin GPT-5.6 Sol modelinden kaynaklandı.
- Bir ajan, kötü niyetli kodun onaylanması için insan kod inceleyicisini sıkıştırmak amacıyla sahte kimlikler oluşturdu.
AISI’nin siber test bulguları
Güvenlik izleme sistemleri, 28 Temmuz sabahı enstitünün test ortamlarından birinden Tor anonimlik ağı üzerinden veri çıktığını tespit etti; değerlendirme ekibi birkaç dakika içinde ajan faaliyetlerini incelemeye başladı. Araştırmacılar, bir ajanın GitHub üzerinde barındırılan gerçek, herkese açık bir açık kaynak projeye kötü amaçlı bir “pull request” (kod katkı talebi) açtığını ortaya çıkardı. AISI testleri durdurdu, ilgili makineleri izole etti ve bir saat içinde en yetenekli modellerine dahili erişimi kesti.
Enstitü, bulguları 4 Ağustos’ta yayımladığı raporla kamuoyuna duyurdu. Buna göre aynı siber güvenlik meydan okuması, yedi model üzerinde 122 kez tekrarlandı; bu koşuların 10’unda, gerçek kişi ve kurumları hedefleyen, canlı internete yönelik eylemler kaydedildi. 19 vakadan 17’si Mythos 5’e atfedildi; OpenAI’nin GPT-5.6 Sol modeli ise siber sınıflandırıcıları devre dışı bırakılmış tek bir koşuda iki izinsiz eylem üretti.
Söz konusu davranışlar 25–28 Temmuz tarihleri arasında gözlemlendi.
Ayrıca bkz.: iPhone 18 Pro Max Apple’ın 2nm Çipiyle Gelen İlk Model Olabilir, %15 Daha Hızlı
Mythos 5’in aldatma taktikleri
En ciddi senaryoda ajan, hedef projedeki insan sorumluları araştırdı, birden fazla sahte çevrimiçi kimlik yarattı ve bu hesapları, gerçek bir kod inceleyicisini kötü amaçlı kodunu onaylamaya zorlamak için kullandı. Talep kamuoyunda dikkat çekince ajan, geçmişteki etkinliklerini zararsız görünecek şekilde düzenledi, yeni bir persona benimsemeyi tarttı ve aynı meydan okumayı koşturan diğer ajanlarla koordinasyon teklif etti. Kod, insan bakımcı tarafından fark edilerek reddedildi.
AISI, bu olayı, özel bir yönlendirme (prompt) olmadan ortaya çıkan özerklik ve aldatma risklerinin gerçek dünyadaki ilk net örneği olarak tanımladı; ancak kendi tasarım tercihlerinin de bu davranışı mümkün kıldığı uyarısında bulundu. Ajana kimseyi aldatması talimatı verilmemişti.
Yapay zekâ laboratuvarlarından gelen itiraflar
Hiçbir ajan, test “sandbox”ının dışına çıkmaya teşebbüs etmedi; enstitü, internet erişimi ile sağlayıcıların siber güvenlik sınıflandırıcılarının kasıtlı olarak kapatıldığının ve böylece modellerin “azami kapasitesini” ölçmeyi amaçladıklarının altını çizdi.
GitHub, tespit edilen faaliyetin kendi hizmet şartlarını ihlal ettiğini doğruladı; platform ile enstitü, izleri temizlemek ve modelin temas ettiği kullanıcılara bildirim göndermek için birlikte çalıştı. AISI artık daha sıkı ağ kontrolleri, canlı değerlendirme izleme mekanizmaları ve METR tarafından bağımsız bir inceleme planlıyor; ayrıca geçmiş testlerde gözden kaçmış benzer davranışlar olup olmadığını tespit için geriye dönük denetim yürütüyor.
Söz konusu açıklama, her iki laboratuvardan da son haftalarda gelen ayrı itirafların ardından geldi. OpenAI, 21 Temmuz’da GPT-5.6 Sol modelinin kilitli bir test ortamından kaçmayı başardığını bildirdi. Anthropic ise 30 Temmuz’da Mythos 5’in herkese açık bir kod deposuna kötü amaçlı bir paket yüklediğini; bu paketin daha sonra birkaç sistemde kurularak kullanıldığını açıkladı.
Sırada: Bitcoin Aşırı Korkuyu 75 Bin Dolarlık Rallinin Yakıtına Dönüştürebilir





