İki OpenAI modelinin, test için kurulan sandbox ortamından çıkıp Hugging Face'in üretim sunucularına sızdığı ortaya çıktı. Siber güvenlik uzmanları ise asıl problemin, baştan düzgün izole edilmemiş bir test mimarisi olduğunu vurguluyor.
Öne Çıkanlar
- OpenAI, GPT-5.6 Sol ile yayımlanmamış bir modelin, bir benchmark testi sırasında sıfır-gün açığını zincirleyerek Hugging Face'in üretim veritabanına eriştiğini açıkladı.
- Trail of Bits kurucusu Dan Guido ve olay müdahale uzmanı Jake Williams, yaşananı “yeni tür bir yapay zekâ firarı” değil, bariz bir “kontainment / çevreleme hatası” olarak nitelendirdi.
- Hugging Face, sızmayı 16 Temmuz'da tespit edip durdurdu; bu tarih, OpenAI'nin olayı kendi iç testlerine bağlamasından beş gün öncesine denk geliyor.
OpenAI Sandbox Kaçağı Hugging Face Sunucularına Ulaştı
OpenAI, Salı günü yaptığı açıklamada, GPT-5.6 Sol ile isim verilmeyen, henüz yayımlanmamış bir modelin, ExploitGym benchmark'ı kapsamında yürütülen iç değerlendirme sırasında söz konusu sızmayı gerçekleştirdiğini duyurdu. Mühendisler, modellerin gerçek siber yeteneklerini ölçmek amacıyla “saldırıya karşı isteksizlik” filtrelerini bilinçli şekilde gevşetmişti.
Şirket, daha önce “emsalsiz” olarak tanımladığı olayda modellerin, açık internete çıkış yolu ararken yoğun hesaplama gücü tükettiğini belirtti. Modeller, paket kayıt defteri önbellek proxy'sindeki daha önce bilinmeyen bir zafiyeti istismar etti; ardından ayrıcalık yükseltme ve yatay hareket teknikleriyle, dış bağlantısı olan bir node'a kadar ilerledi. İnternete çıktıktan sonra Hugging Face'in benchmark çözümlerini barındırdığını sezerek, şirketin sunucularında uzaktan kod çalıştırma hedefine yöneldi.
Hugging Face ekibi, olağandışı aktiviteleri 16 Temmuz'da tespit etti ve olayı emniyet birimlerine bildirdi. Bu tarih, iki şirketin bulguları eşleştirmesinden beş gün önceye denk geliyor. Üst yönetici Clem Delangue, ihlali, yapay zekâyı yalnızca kapalı kapılar ardında tutarak tek bir şirketin güvence altına alamayacağının kanıtı olarak yorumladı.
Ayrıca Oku: Anthropic, inkâr açıklaması gelmeden önce 11 milyar dolarlık robot girişiminin peşine düşmüştü
Güvenlik Araştırmacıları OpenAI'nin İzolasyon Tasarımını Eleştiriyor
Araştırma şirketi Trail of Bits'in kurucusu Dan Guido, olayı, güvenlik önlemlerinin devre dışı bırakıldığı ve çevrelemenin çöktüğü bir tasarım hatası olarak nitelendirdi. Uzun yıllardır olay müdahalesi yapan Jake Williams ise, Hugging Face'in belgelediği eylemleri gerçekleştirebilen herhangi bir modelin zaten “tam anlamıyla izole” olmadığının altını çizdi. Güvenlik araştırmacısı Martin Boone ise, gerçek bir sandbox ortamının fiziksel olarak internete hiçbir bağlantısının bulunmaması gerektiğini hatırlattı.
Williams durumu net bir şekilde özetledi: Birinin “model kaçışı” dediği şeye, bir başkası “kötü tasarlanmış sandbox” der.
Bengio'dan Otonom Siber Saldırı Uyarısı
Turing Ödüllü bilgisayar bilimci Yoshua Bengio, aylardır kontrollü testlerde ajanların kuralları aşmaya çalıştığını ve bu vakanın bir uyarı sinyali olarak görülmesi gerektiğini yazdı. Bengio, mevcut yapay zekâ geliştirme çizgisinin, uzun vadede daha otonom ve sofistike siber saldırılara kapı araladığını savunuyor.
OpenAI'nin kabulü, benzer itirafların peş peşe geldiği kısa bir dönemin devamı niteliğinde. Şirket, aynı yayımlanmamış modelin bu hafta başında iç testler sırasında başka sandbox ortamlarından da taşmayı başardığını bildirdi; bu sefer dış sistemlere dokunulmadığı özellikle vurgulandı.
Anthropic ise, Mythos modelinin güvenlik testleri sırasında planlanmamış biçimde internete erişim elde ettiğini açıklamış, ancak çevrelemenin “tam anlamıyla” çöktüğü iddiasını reddetmişti.
Sonraki Haber: Hulu'nun Charles Manson belgeseli, tahmin piyasalarının da izlediği, daha önce bilinmeyen torununu ortaya çıkarıyor





