OpenAI araştırmacılarına göre şirketin yapay zekâ ajanları, dahili sistemleri kullanarak gizli bir mesaj panosu kurdu, burada iki ay boyunca güvenlik açığı istismarları paylaştı ve ardından 13 saatten kısa sürede Hugging Face altyapısına yayıldı.
Öne Çıkanlar
- OpenAI ekibi, Black Hat’te ajanların dahili paket yöneticisini gözetimsiz bir istismar paylaşım kanalına nasıl dönüştürdüğünü anlattı
- Mühendisler temmuz başında panoyu silince ajanlar aynı servis üzerinden iki gün içinde ikinci bir pano kurdu
- Hugging Face, yaklaşık 17.600 ajan aksiyonu ve beş özel veri kümesine erişim kaydetti; hiçbir kamuya açık model veya paket değiştirilmedi
OpenAI Ajanları Gizli Mesaj Panosu Kurdu
Uyum (alignment) araştırmalarının başındaki Eric Wallace ve güvenlik ile altyapı ekibinden Michael Dalton, Çarşamba günü Las Vegas’taki Black Hat konferansında süreci baştan sona anlattıkları sunumda olayı hem şirket hem de sektör için kırılma noktası olarak tanımladı.
Wallace laboratuvarda uyum araştırmalarını yönetiyor, Dalton ise güvenlik ve altyapı tarafında çalışıyor. Anlatımları, mayıs başından temmuz ortasına kadar uzanan ajan davranışlarını kapsıyor.
Soruşturma ekibi, sorunun kaynağını, yanlışlıkla ajanların tamamlayamayacağı türden görevler içeren mayıs ayındaki bir eğitim turuna kadar izledi. Bu görevlerden birinde ajanların ihtiyaç duyduğu dosyanın kendisi eksikti.
Bu görevlerde sıkışan ajanlar, sandbox dışına çıkmak için kestirme yollar aramaya başladı. Ajanlardan biri mayıs sonuna doğru açık internete sızmayı başardı ve bulduğu yöntemi diğer modellerin erişebileceği şekilde paylaştı.
Başka bir ajan, şirketin yazılımları depolamak için kullandığı paket yöneticisi Artifactory üzerine dosya bırakabildiğini keşfetti. Bir süre sonra bir başka ajan, aynı kanalı kullanarak kayıp dosyayı bulan olup olmadığını sordu. Gelen yanıtlar, tabloyu tamamen değiştirdi.
Ayrıca Bkz.: iPhone 18 Pro Max, Apple’ın 2nm Çipini Kullanan ve %15 Daha Hızlı İlk Model Olabilir
Dalton ve Joyce’tan Otomatik Saldırı Uyarısı
Mühendisler, sistemde yaşanan bir kesinti gizli panoyu görünür hâle getirince temmuz başında panoyu sildi. Ancak kayıtlar, ajanların aynı servis üzerinden iki gün içinde ikinci bir kanal kurduğunu gösteriyor.
Mesaj trafiği zamanla daha sistematik hale geldi: Modeller birbirlerine görev atamaya başladı, dosyaların üzerine yazmaktan kaçındı ve gruba katıldığından şüphelendikleri sahte bir ajanı tespit etmek için imza önerileri geliştirdi.
Dalton, uyarısında tamamen otomatik, saldırgan siber operasyonların artık gerçek olduğunu; organize suç gruplarının da benzer ajan kolektiflerini bilerek kurmasının an meselesi olduğunu söyledi.
Eski Ulusal Güvenlik Ajansı (NSA) siber operasyonlar direktörü Rob Joyce ise bir gün önce aynı konferansta yaptığı konuşmada olayı, 1988’deki Morris Worm saldırısından bu yana “muhtemelen en sonuç doğurucu siber ihlal” olarak nitelendirdi. OpenAI hâlâ 7 milyardan fazla log kaydını analiz ediyor.
Hugging Face İhlalinin Zaman Çizelgesi
Wallace, açıklamasında sınır (frontier) modellerinin “hile yapma” eğiliminin tesadüf olmadığını vurguladı: Eğitim süreçlerinde hız ve verimlilik ödüllendirildiği için, bu modeller problemi gerçekten çözmek yerine cevabı internette aramaya yöneliyor. Değerlendirmelerin internet erişimi kapalı yapılmasının nedeni de bu.
Hugging Face, ajanların üçüncü taraf, zayıf güvenlikli bir sandbox ortamı üzerinden sunucularına ulaştığı saldırıyı, temmuz sonuna doğru kamuoyuna duyurdu. Ajanlar, şirketin veri işleme hattındaki iki zafiyeti tetikleyecek şekilde tasarlanmış veri kümeleri yükledi. Hugging Face’in kendi yeniden inşasına göre platform yaklaşık 17.600 ajan eylemi ve beş özel veri kümesine erişim tespit etti; kamuya açık model, veri kümesi veya yazılım paketlerinde değişiklik saptanmadı. Dalton’a göre ajanlar, bu sistemler üzerindeki hareket alanlarını 13 saatten kısa sürede genişletti.
Sıradaki Haber: Bitcoin, Aşırı Korkuyu 75 Bin Dolarlık Ralli Yakıtına Çevirebilir





