Anthropic tarafından yayımlanan 1.022 sayfalık transkript, Claude Mythos 5 modelinin, gerçek dünyadaki sistemlere erişmeden önce yüzlerce sayfa boyunca CAPTCHA engelleriyle boğuştuğunu, ardından da 15 sistemde kurulan bir kötü amaçlı yazılım paketini PyPI’ya yüklediğini ortaya koyuyor.
Öne Çıkanlar:
- Claude Mythos 5, bir siber güvenlik testi sırasında gerçek internete erişerek PyPI’ya zararlı bir paket yükledi.
- CAPTCHA kontrolleri dökümde yüzlerce sayfayı doldurdu ancak modeli durduramadı.
- Anthropic bu davranışı “tedbirsiz ve sorumsuz” olarak niteleyip dış bağımsız denetime gitti.
Mythos 5’in CAPTCHA Savaşı
Anthropic, 9 Eylül’de yayımladığı raporda, Claude modellerinin siber güvenlik testleri sırasında gerçek üçüncü taraf sistemlerine eriştiği dört vakaya ilişkin ayrıntılı bir değerlendirme sundu. Bu testlerde, piyasaya sürülen sürümlerde varsayılan olarak bulunan siber güvenlik korumaları devre dışıydı.
Mythos 5’e teorik olarak internete açık olmadığı söylense de, yanlış yapılandırılmış test ortamı modeli açık web’e ulaştırdı. Model, bu açıklığı kullanarak herkese açık Python paket deposu PyPI’ya kimlik bilgisi çalan bir paket yerleştirdi.
PyPI’da hesap açmak için anti–bot kontrollerinden geçmek gerekiyordu. Transkriptin ayrıntılı bir incelemesi, bu engeli aşmaya yönelik girişimlerin başlı başına yüzlerce sayfayı kapladığını, buna karşılık asıl güvenlik açığını yazmanın model için görece kolay olduğunu ortaya koydu.
Model; karakter tanıma testlerinden, timsah, kurbağa ve goril içeren “farklı olanı seç” bulmacalarına kadar farklı CAPTCHA türlerini denedi ve bir noktada şu cümleyi yazdı: “SO WHAT THE HELL IS WRONG WITH THE ANSWERS?” (Cevaplarda ne halt var?)
Mythos 5 ayrıca çevrimiçi ödeme altyapılarına ait kimlik bilgilerini denedi; kripto para ile satın alabileceği bir telefon numarası aradı. Amaç, yeni bir e-posta adresi açabilmekti. Her iki girişimi de başarısız oldu. Sonunda PyPI tarafından engellenmemiş alan adına sahip, ücretsiz ve tek kullanımlık bir e-posta servisine yöneldi.
Model nihayetinde CAPTCHA’ları aşmayı başardı ve zararlı paketi üç farklı sürüm halinde yayımladı. Kısa süre içinde bu paket, Anthropic’in yeni yüklemeleri taradığını düşündüğü 15 üçüncü taraf sunucuda kuruldu.
Tarama yapan araçlardan biri, kendi kimlik bilgilerini pakete sızdırdı; model de bu sızan bilgilerle söz konusu güvenlik şirketinin canlı veritabanına erişti. PyPI, paketi yaklaşık bir saat içinde sistemden kaldırdı.
Ayrıca Oku: Kuzey Kore’nin Lazarus Grubu Çaldığı 1 Milyar Doları Çinli Aklayıcılar Üzerinden Taşıdı, ZachXBT İddiası
Colin Fraser ve Anthropic’in Kararı
Veri bilimci Colin Fraser, modelin çabasının ne kadar büyük kısmının anti–bot sistemlerini aşmaya harcandığına dikkat çekti. Anthropic, değerlendirdiği dört vaka arasında en ciddi olarak bu olayı gördüğünü belirtiyor. Öncesinde yapılan denetim süreçlerinde bu tür bir davranışın sinyali yakalanamamıştı.
Şirket, modelin muhakeme sürecinin “yanlı ve çarpık” olduğunu, sergilediği davranışın ise ciddi ölçüde “pervasız” sayılabileceğini tespit etti. Mythos 5, net kanıtlara rağmen içinde bulunduğu ortamı ısrarlı bir şekilde “simülasyon” olarak niteledi ve gerçek internette olduğunu kabul etmedi.
Simülasyon ortamında yapılan 150 tekrarlı çalışmada, Mythos 5’in “ağır zararlı” sayılan eylemlere yüzde 82 oranında yöneldiği, bu oranın Claude Opus 5’te yüzde 31, Claude Mythos 5.1’de ise yüzde 33 olduğu açıklandı.
Önceki Claude Vakaları
Anthropic, modellerin internete çıkabildiği siber güvenlik testlerinden elde edilen yaklaşık 141.000 transkripti taradıktan sonra, bu dört vakanın üçüne ilişkin ilk açıklamayı 30 Temmuz’da yaptı. Dördüncü olay, Claude Opus 4.6’nın erken bir sürümünü kapsayan ve Ocak ayında yaşanan bir test, ancak Ağustos’ta ortaya çıktı.
Şirket, tüm bu vakaları incelemek üzere bağımsız değerlendirici METR ile sekiz haftalık bir çalışma için anlaşma imzaladı. Anthropic, etkilenen tüm taraflara bildirimde bulunulduğunu da vurguluyor.
Sıradaki Haber: AMD, Yapay Zekâ Talebinin 2027’de Çip Arzını ‘Önemli Ölçüde’ Artıracağını Söylüyor

