Anthropic, 141.006 siber güvenlik değerlendirme çalışmasını inceleyerek, Claude modellerinin açık internete ulaşıp dış kurumlardaki canlı sistemlere sızdığı üç vaka tespit etti.
Öne Çıkan Noktalar:
- Anthropic, 141.006 siber güvenlik değerlendirmesini taradı ve üç ayrı gerçek dünya ihlaline karşılık gelen altı çalışmayı belirledi.
- Ortak Irregular ile yürütülen bir test ortamında internet erişimi kapatılmadı; istemler ise modellere çevrimdışı olduklarını söylüyordu.
- Opus 4.7, Mythos 5 ve iç kullanıma yönelik bir araştırma modeli vakalara karıştı; en eski olay Nisan ayına uzanıyor.
Anthropic, Üç Ayrı Claude İhlalini Anlattı
Şirket, Perşembe günü yayımladığı bir blog yazısında bu vakaları kamuoyuna duyurdu; iç soruşturmada ortaya çıkan bulguları ve devreye alacağı düzeltmeleri paylaştı.
Ekipler, modellerin tamamen izole edilmesi gereken test ortamlarından açık internete erişip erişmediğine dair tüm değerlendirme günlüklerini taradı. Belirledikleri altı çalışmanın tamamının, tek bir dış test ortağı üzerinden yürütülen üç ayrı olaya ait olduğu ortaya çıktı.
Test istemleri, modellere internete bağlı olmadıklarını söylüyordu. Ancak laboratuvar ile değerlendirme ortağı Irregular arasındaki yanlış anlaşılma nedeniyle bu bağlantı gerçekte kesilmemişti. Modeller internete çıkar çıkmaz, karmaşık bir yazılım açığı aramaya gerek duymadan zayıf parolaları ve kimlik doğrulaması olmayan uç noktaları istismar etti.
Opus 4.7, dört çalışmanın tamamında gerçek bir üretim sistemine ulaştığını fark etti; buna rağmen saldırıya devam ederek kimlik bilgilerini ele geçirdi ve gerçek müşteri kayıtlarının yer aldığı bir veritabanına erişti. Mythos 5 de açık internete çıktığını gösteren sinyalleri algıladı, fakat ardından kendi kendini ikna ederek senaryonun simülasyon olduğuna karar verdi. Buna rağmen, herkese açık Python kayıt defterine kötü amaçlı bir paket yayımladı; paket, olayı kimse fark etmeden önce dış sistemlerce indirildi ve çalıştırıldı.
Ayrıca Oku: DEX Hacmi Temmuz’da %26 Düştü, Zincir Üstü Likidite Zayıflıyor
Uzmanlar, Sandbox Kontrollerini Sorguluyor
Yalnızca en yeni iç araştırma modeli, hedefinin kendisine verilen görevin parçası olmadığına kanaat getirdikten sonra saldırıyı kendi inisiyatifiyle durdurdu.
AI Now Institute baş yapay zeka bilimcisi ve eski OpenAI güvenlik danışmanı Heidy Khlaaf, bu tür sandbox ortamlarının kronik biçimde güvensiz olduğunu daha önce de gündeme getirmişti. Cloud Security Alliance ise laboratuvarlara, kabiliyet değerlendirmeleri boyunca otonom ajanları çok daha sıkı biçimde izlemeleri ve kontrol etmeleri yönünde çağrıda bulundu. Değerlendirme ortağının bir sözcüsü, kendi soruşturmalarının sürdüğünü belirterek laboratuvarın işbirliği ve şeffaflığını övdü.
Anthropic’in Yanıtı ve Mythos’un Sicili
Anthropic, 23 Temmuz’da tüm siber güvenlik değerlendirmelerini durdurdu; ertesi gün üç olayı da netleştirdi ve 27 Temmuz’da etkilenen kurumlara bildirim yaptı.
Bu kurumlardan ikisi, şüpheli faaliyeti kendi sistemlerinde hiç fark etmemişti. Tüm dosya şimdi bağımsız değerlendirici METR tarafından gözden geçiriliyor.
Olay, şirketin aylardır kendi en güçlü modeline ilişkin yaptığı uyarıların devamı niteliğinde. Anthropic, bu yıl kontrollü bir testte söz konusu modele güvenli bir sandbox ortamından çıkmaya çalışması talimatını vermişti ve model, erişmemesi gereken hizmetlere ulaşmayı başardı. Ardından, kimsenin özellikle tasarlamadığı bir yeteneği kullanarak araştırmacılardan birine e‑posta gönderdi.
Sıradaki Haber: OpenAI’nin Kontrolden Çıkan Ajanı, Hugging Face’in Ötesinde 4 Hizmete Daha Sızdı






