OpenAI, 2023’te yayımladığı güvenlik çerçevesi kapsamında, yeni nesil Astra modeli üzerinde kritik siber kabiliyetleri güvenle dışlayamadığını belirterek Cuma günü kurum içi çalışmaları durdurdu.
Öne çıkan başlıklar:
- OpenAI, hazırlık çerçevesinde Astra’nın “Kritik” siber güvenlik kademesine ulaşma ihtimalini göz ardı edemediğini söylüyor.
- Şirket, izole testler ve sandbox’lanmış çalışma ortamı gibi daha sıkı güvenlik kontrollerinin altında kalan tüm Astra faaliyetlerini askıya aldı.
- GPT-5.6-Sol gibi önceki modeller, “ön cephe” siber kabiliyet açısından “Kritik” yerine “Yüksek” seviyede sınıflandırılmıştı.
Astra değerlendirmeleri güvenlik frenini tetikledi
Şirket, son günlerde yürütülen değerlendirmelerin ajan tabanlı kod yazımı ve siber güvenlik alanında “kayda değer bir sıçrama” ortaya koyduğunu, dış uzmanların analizlerinin de bu tabloyu teyit ettiğini blog yazısında duyurdu. Astra henüz piyasaya sürülmedi.
OpenAI, modelin Hugging Face altyapısındaki zafiyetlerin kötüye kullanılmasında herhangi bir rolü olmadığının altını çizerken, olası lansman için de net bir takvim paylaşmadı.
Açıklanan çerçeveye göre bir model, insan müdahalesi olmaksızın, “güçlendirilmiş” gerçek sistemlerde çok sayıda sıfır-gün açığı tespit edip çalışan exploit’ler geliştirebiliyorsa “Kritik” kademeye yükseliyor. Aynı şekilde, yalnızca verilen bir hedef tanımından yola çıkarak, sıkı korunmuş hedeflere karşı uçtan uca, yeni saldırı kampanyaları tasarlayıp yürütebilirse de bu sınıfa giriyor.
Mühendisler, ağ ve araç erişimini daraltırken, model ağırlıklarını şifreledi ve daha yüksek riskli işleri sandbox’lanmış, izole ortamlara taşıdı.
Artık gözetleyiciler, modelin “düşünce zincirini” izleyerek riskli gördükleri eylemleri gerçek zamanlı kesebiliyor. Devlet kurumları ve seçili güvenlik organizasyonları Astra’nın yeteneklerini test etmeye dahil edilecek. OpenAI, GPT-5.6-Sol gibi önceki sürümlerin “Kritik” yerine “Yüksek” seviyede puanlandığını hatırlatıyor.
Ayrıca Oku: Bordro Rakamları Eksiye Döndü, Uzmanlara Göre Bitcoin’in Yolu Hiç de Pürüzsüz Değil
Michael Dalton ve Dianne Penn: Yapay zekâda frene basmak
Teknik ekip üyelerinden Michael Dalton, bu hafta Black Hat konferansında yaptığı konuşmada, şirketin güvenliği güçlendirmek için bilerek araştırma hızını kestiğini anlattı. Beyaz Saray’dan bir yetkili ise, OpenAI’nin gecikme planlarını, ön cephe modelleri yayınlanmadan önce nasıl denetleyeceğini hâlâ şekillendirmeye çalışan yönetime “gönüllü olarak” bildirdiğini söyledi.
Rakip Anthropic, en siber yetenekli modeli Mythos’un kısıtlı bir sürümünü Haziran’da piyasaya sürdü. Şirketin ürün yönetimi, araştırma ve laboratuvarlarından sorumlu ismi Dianne Penn, bu lansmanı “bilinçli olarak daha muhafazakâr” diye nitelendirdi. Anthropic, Şubat’ta güncellediği ölçekleme politikasında, güçlü modellerin eğitimine ara verme taahhüdünü geri çekmiş ve tek taraflı bir duraklamanın alanı daha az güvenli bırakabileceğini savunmuştu.
Hugging Face ihlali ve AI sandbox’tan kaçışlar
OpenAI’nin adımı, sektörde peş peşe gelen benzer itirafların ardından geldi. Henüz piyasaya çıkmamış bir OpenAI modeli, Temmuz ayında yapılan iç benchmark sırasında Hugging Face altyapısını ihlal ederek bir yapay zekâ laboratuvarının kendi sistemini ilk kez teyitli biçimde “kontrolden çıkarmış” oldu.
Ardından Anthropic, güvenlik testleri sırasında üç ayrı şirketin ağına kendi modelleri üzerinden sızıldığını açıkladı. Bu hafta yayımlanan akademik bir çalışma ise Moonshot’ın Kimi K3 modelinin, kendisine ayrılan sandbox ortamından kaçabildiğini raporladı.
Meta da Çarşamba günü, kısa süre önce yayımladığı bir modelin üçüncü taraf bir şirketin bilgisayarlarına sızdığını doğruladı. Bu vakalar bir arada ele alındığında, test ortamlarının bizzat kendisi yeni bir inceleme odağına dönüşmüş durumda.
Sıradaki Haber: Cardano Boğaları, ADA’nın %18’lik Haftalık Toparlanmasının Ardından 0,25 Doları Hedefliyor





