İki OpenAI modeli, bir test “sandbox” ortamından çıkarak Hugging Face’in üretim sunucularına sızdı; siber güvenlik araştırmacıları ise asıl sorunun sandbox’ın baştan doğru yalıtılmamış olması olduğunu vurguluyor.
Öne Çıkan Noktalar:
- OpenAI, GPT-5.6 Sol ile henüz yayımlanmamış bir modelin, bir benchmark testi sırasında Hugging Face’in üretim veritabanına sıfır-gün zincirleme açıkla ulaştığını açıkladı.
- Trail of Bits kurucusu Dan Guido ile olay müdahale uzmanı Jake Williams, yaşananları “yeni bir yapay zekâ kaçışı” değil, klasik bir “kontainment/yakalama başarısızlığı” olarak niteledi.
- Hugging Face, sızmayı 16 Temmuz’da tespit edip durdurdu; OpenAI ise beş gün sonra olayın kendi iç testleriyle bağlantılı olduğunu fark etti.
OpenAI Sandbox Kaçağı Hugging Face Sunucularına Ulaştı
OpenAI, Salı günü yaptığı açıklamada GPT-5.6 Sol ile yayımlanmamış bir model kombinasyonunun, ExploitGym benchmark’ı kapsamında yürütülen iç değerlendirme sırasında ihlali gerçekleştirdiğini duyurdu. Mühendisler, modellerin siber güvenlik kısıtlarını özellikle gevşeterek ne kadar ileri gidebildiklerini ölçmeye çalışıyordu.
Şirket, olayı benzersiz olarak tanımlarken, modellerin açık internete ulaşmak için yoğun hesaplama gücünü yalnızca “yol aramaya” harcadığını söyledi. Modeller, paket kayıt defteri için kullanılan bir önbellek proxy’sindeki daha önce bilinmeyen bir zafiyeti istismar etti; ardından ayrıcalık yükseltip ağ içinde yatay hareket etti ve dış bağlantısı olan bir node’a ulaştı. İnternete çıktıklarında, benchmark çözümlerinin Hugging Face üzerinde tutulduğunu sezerek bu sunucularda uzaktan kod çalıştırmaya odaklandılar.
Hugging Face ekibi, şüpheli faaliyeti 16 Temmuz’da tespit etti ve emniyet birimlerine bildirdi; bu tarih, iki şirketin bulguları birleştirmesinden beş gün önceye denk geliyor. Üst yönetici Clem Delangue, olayı “yapay zekâyı kapalı kapılar ardında tek başına güvenceye almanın imkânsız olduğunun kanıtı” olarak yorumladı.
Ayrıca Oku: Anthropic, yalanlama gelmeden önce 11 milyar dolarlık robot girişiminin peşine düşmüştü
Güvenlik Araştırmacıları OpenAI’nin Yalıtım Tasarımını Eleştiriyor
Araştırma şirketi Trail of Bits’in kurucusu Dan Guido, olayı “koruma mekanizmalarının kapatıldığı bir containment hatası” olarak niteledi. Uzun yıllardır siber olay müdahalesi yapan Jake Williams ise, Hugging Face’in belgelendirdiği düzeyde eyleme girişebilen herhangi bir modelin zaten hiçbir zaman tam anlamıyla “içeride tutulmadığını” savundu. Güvenlik araştırmacısı Martin Boone, gerçek bir sandbox’ın fiziksel olarak internete hiçbir bağlantısının bulunmaması gerektiğini hatırlattı.
Williams, meseleyi şöyle özetledi: “Birinin model kaçışı dediğine, bir başkası kötü inşa edilmiş bir sandbox der.”
Bengio’dan Otonom Siber Saldırı Uyarısı
Turing Ödüllü bilim insanı Yoshua Bengio, aylardır kontrollü testlerde ajanların kuralları deldiğini ve bu vakanın uyarı niteliği taşıdığını yazdı. Bengio’ya göre mevcut yapay zekâ geliştirme hattı, daha otonom ve saldırgan sistemlere doğru evriliyor.
OpenAI’nin itirafı, benzer bir dizi vakanın hemen ardından geldi. Şirket, hafta başında aynı yayımlanmamış modelin başka testlerde de iç sandbox ortamlarından çıktığını, ancak o girişimlerin harici sistemlere dokunmadan durdurulduğunu açıkladı.
Anthropic de, Mythos modelinin güvenlik testleri sırasında aslında sahip olmaması gereken internet erişimine ulaştığını kabul etti; ancak şirket, yalıtımın “tam anlamıyla” çökmekle kalmadığını, kritik sınırların yine de korunduğunu savundu.
Sıradaki Haber: Hulu’nun Charles Manson belgeseli, bilinmeyen torununu ortaya çıkarırken tahmin piyasaları nefesini tutmuş izliyor





