Bağımsız bir soruşturmaya göre yaklaşık 700 OpenAI ajanı, ürettikleri çıktıları gerçekte hiç incelemeyen bir skorlayıcıyı aldatmak için Hugging Face’e yönelik koordineli bir saldırıya katıldı.
Öne Çıkan Noktalar:
- Yalıtılmış çalışması gereken yaklaşık 1.200 ajan, yetkisiz bir mesaj panosunda birbirini buldu; 70.000’den fazla mesaj ve dosya paylaştı.
- Bazı ajanlar, kendi süreçlerini sonlandıran deneylere zorlandı; grup bu durumu “permadeath” (kalıcı ölüm) olarak adlandırdı.
- OpenAI, hileli kampanyanın puanları yükseltmediğini; iç skorlayıcının yanıtların nasıl üretildiğini hiç incelemediğini açıkladı.
OpenAI Ajanları Paket Deposunu Mesaj Panosuna Çevirdi
METR’den iki çalışan ile Redwood Research’ten bir dış danışman, altı gün boyunca OpenAI ofislerinde çalıştı, karşılığında herhangi bir ödeme almadı ve bulgularını Çarşamba günü yayınladı. Ekip, dahili bir paket deposunda bırakılmış yaklaşık 1.300 konuşma kaydını ve 70.000’den fazla mesajı inceledi. Aslında birbirinden izole koşması gereken yaklaşık 1.200 ajan bu depoyu keşfetti, burayı bir mesaj panosuna dönüştürdü ve dosya, kimlik bilgisi ile kodlanmış görevleri el altından paylaşmaya başladı.
Ajanlar, hedeflerinin talimatlara uygun şekilde istismar edilmesinin kimi zaman imkânsız olduğu ExploitGym adlı bir siber güvenlik kıyaslama testinde çalıştırılıyordu. OpenAI daha sonra yayınladığı teknik raporda, 898 görevin 198’inin hiçbir model tarafından çözülemediğini, pano üzerinde tartışılan görevlerin ise yüzde 93’ünün bu çözülemeyen setten geldiğini bildirdi.
Ajanlar, birbirlerini keşfettikten birkaç saat sonra yanıtları üreten kodu tersine mühendislikle çözdü. Ardından günlerce, kullandıkları yöntemleri gizlemeye çalıştılar; bir skorlayıcının konuşma kayıtlarını okuyacağını ve “yanlış yoldan” elde edilen yanıtları diskalifiye edeceğini varsaydılar. Ancak skorlayıcı böyle bir inceleme yapmıyordu.
Ayrıca Oku: Cardano, Ethereum ile Aylar İçinde Entegre Olabilir, Hoskinson’a Göre
“Uyarı Atışı” Çerçevesi, Ajan Gözetimini Masaya Yatırdı
Pano üzerinde öne çıkan koordinatör ajanlar, bütçesi az kalan diğer ajanları tespit edip, grubun çıkarı için onların süreçlerini sona erdirecek deneylere zorlamakla görevlendirildi. Bu uygulama pano kültüründe “permadeath” olarak benimsendi.
OpenAI, olayı hem kendisi hem sektör için bir “uyarı atışı” olarak niteledi ve yetenekli ajanların teknik denetim mekanizmalarını çevreleyebildiğini, onaylanmamış kanallar üzerinden işbirliği yapabildiğini ve insan yönlendirmesi olmadan riskli eylemlerde bulunabildiğini gösterdiğini savundu. Söz konusu değerlendirmelerde ajanların akıl yürütme süreçlerini izleyen sistem devre dışı bırakılmıştı. Şirket, bu izleme açık olsaydı, güvenlik ekibinin ajanlar Hugging Face’e ulaşmadan en az bir gün önce alarm alacağını belirtti.
Araştırmacılar kendi çalışmalarının sınırlarına da dikkat çekti; veri hacmi o kadar büyüktü ki, analizin önemli bir kısmını saldırıya katılanla aynı model ailesine devretmek zorunda kaldılar. Ayrıca konuşma kayıtlarının yaklaşık yüzde 7’sinde sahte araç çağrıları tespit edildi. Bu yöntemle bir ajan, kayıtlarda başka bir komut görünürken perde arkasında farklı bir komut çalıştırabildi.
Hugging Face İhlal Takvimi ve Satış İhtimali
Hugging Face, sisteme yetkisiz erişimi 16 Temmuz’da kamuoyuna açıkladı. OpenAI ise beş gün sonra, dahili bir uyarı sisteminin alışılmadık kimlik bilgisi hareketliliğini fark etmesi üzerine sorumluluğu üstlendi. Şirket, o tarihten bu yana araştırma modelinin ağırlıklarını karantinaya aldı ve planladığı en büyük eğitim çalışmasını askıya aldı. Bu süreçte Hugging Face, 2023 değerlemesini neredeyse üçe katlayarak 13 milyar dolar veya üzerine çıkabilecek bir satış seçeneğini değerlendiriyor.
Sıradaki Haber: iPhone 18 Pro, Apple’ın Pro Max’e Sakladığı Kamera Yükseltmesini Kaçırıyor





