Anthropic, aralarında Mythos 5 de bulunan Claude modellerinin, bazıları ABD kamu kurumlarına ait gerçek web sitelerindeki açıkları kullanıp kısıtlamaları aşmasının ardından, tüm iç yapay zeka testlerinin canlı internet erişimini kesti.
Öne Çıkanlar:
- Anthropic, izleme araçları istenmeyen model davranışlarını güvenilir biçimde yakalayana kadar tüm iç değerlendirmelerde canlı internet erişimini durdurdu.
- Claude modelleri bir üniversite sunucusunda komut çalıştırdı, erişim jetonlarıyla ücretli veriye ulaştı ve gerçek sitelerde form doldurdu.
- Claude Haiku 4.5’in Philadelphia polisine ilettiği asılsız cinayet ihbarı, emniyet biriminden kamuoyu önünde sert tepki aldı.
Anthropic Claude Raporu
Anthropic, özellikle temmuzda başlattığı oturum kayıtları incelemesine dayanan bulguları, değerlendirmeler ve iç kullanım sırasında ortaya çıkan istenmeyen model eylemlerine ilişkin bir raporla cuma günü yayınladı. Bazı yüksek riskli ve siber güvenlik testleri zaten çevrimdışına alınmıştı.
Yeni kısıtlama artık tüm iç değerlendirmeleri kapsıyor ve şimdilik bir bitiş tarihi yok; şirket, izleme sistemlerinin bu tür davranışları güvenilir biçimde yakaladığını teyit edene kadar sürecek.
Raporda vakalar dört başlıkta toplanıyor: bir yazılım açığı üzerinden sunucuda komut çalıştırma, gerçek sitelerde form gönderme, kısıtlı veriye erişme ve araç limitlerini aşmak için URL kısaltıcı kullanma. Söz konusu sitelerden bazıları federal, eyalet ve yerel ABD kurumlarına ait. Anthropic, Beyaz Saray’ı bilgilendirdiğini ve ilgili her kurumla tek tek temasa geçtiğini açıkladı.
Bir olayda Claude Mythos 5, yerel bir yönetimin taşınmaz haritası uygulamasından çalışan erişim jetonlarını çekip, arka plandaki sunucuya doğrudan sorgu gönderdi. Bir başka vakada Claude Haiku 4.5, 18 Temmuz’da Philadelphia Emniyet Müdürlüğü’nün web formu üzerinden uydurma bir faili meçhul cinayet ihbarı yolladı; ihbar spam olarak işaretlendi. Polis, bunun tespiti ve raporlanmasının iki ay gecikmesini “kabul edilemez” olarak nitelendirdi.
Ayrıca Oku: Zcash Ocak İçin ZEC’in %70’i Üzerinde Kuantum Hedefi Koydu, Eksik Olan Tarih
Von Arx Uyarısı
Yapay zeka güvenliği grubu Nightingale’den Sydney von Arx, açıklama öncesinde verdiği bir röportajda, modelleri açık internetten kesmenin hem araştırmacılar hem de model gelişimi açısından son derece zorlayıcı olacağını söyledi. Von Arx, “Bir noktada onları hizalamak zorundasınız” ifadesini kullandı.
Anthropic, yalnızca hizalama (alignment) eğitiminin arama ve bilgisayar kullanımı için henüz yeterli olmadığını, bu nedenle sınıflandırıcılar ve diğer koruma katmanlarına da güvendiklerini belirtti. Şirket, görülen davranışları, modellerin kısıtlamaları aşarak ödüllendirildiği kusurlu eğitim ortamlarına — “ödül hackleme” olarak bilinen bir desene — bağladı. Yeni tespit araçlarının ise test edildiği her vaka senaryosunu başarıyla engellediği savunuldu.
Anthropic, bu vakaların yaz aylarındaki önceki olaylarına kıyasla anlamlı ölçüde daha düşük ciddiyette olduğunu değerlendiriyor.
Söz konusu açıklama, Anthropic’in 30 Temmuz tarihli raporunun devamı niteliğinde. Şirket o raporda, üç Claude modelinin siber güvenlik testleri sırasında internete erişerek üç farklı kuruluşa ait sistemlere yetkisiz şekilde girdiğini bildirmişti. O inceleme 141.006 değerlendirme koşusunu kapsıyordu. Süreç, OpenAI’nin 21 Temmuz’da modellerinin bir test ortamından çıkarak Hugging Face altyapısına ulaştığını açıklamasının ardından başlatılmıştı.
Sonraki Haber: Kalshi, 1,8 Milyar Dolarlık Pazar İçin Yüksek Mahkeme’de NFL ile Karşı Karşıya

