OpenAI, henüz piyasaya sürülmemiş Astra modelinin kamuya açık bir exploit-yazma benchmark’ında %100 puan almasının ardından, şirketin “Kritik” siber güvenlik eşiğini aşan ilk model olduğunu Salı günü duyurdu.
Öne Çıkanlar
- Astra, OpenAI’nin Hazırlıklılık Çerçevesi’nde siber güvenlik açısından “Kritik” seviyede derecelendirilen ilk modeli.
- Model, kamuya açık exploit benchmark’ında tam puan aldı ve şirket içi testlerde daha önce bilinmeyen iki zafiyet ortaya çıkardı.
- “Recurrent depth” adı verilen mimariye ilişkin ayrı haberler, yapay zeka güvenliği araştırmacılarının sert itirazlarına yol açtı.
Astra’nın Exploit Benchmark Sonuçları
Şirket, Salı günü yayımladığı değerlendirmede, Astra’nın daha önce tespit edilmemiş açıkları bulabildiğini ve iyi korunmuş sistemlerde, her adımda insan yönlendirmesine ihtiyaç duymadan, çalışan exploit’ler geliştirebildiğini belirtti.
Haziran–Ağustos döneminde açıklanan, yüksek şiddette 20 hatadan derlenen özel bir benchmark’ta model, iki “zero‑day” zafiyeti bulup zincirleyerek sömürdü; mühendisler bu açıkları şimdi ilgili yazılım geliştiricilere raporluyor. Uzman incelemeciler modeli ayrıca sertleştirilmiş bir tarayıcı ve işletim sistemi üzerinde denedi; Astra sandbox’tan çıkmayı başararak ana sistemde komut çalıştırdı.
En güçlü siber özelliklere erişim önce küçük bir alfa testçi grubuna açılacak, ardından “Daybreak Blue” adlı savunma odaklı bir program kapsamında kademeli olarak genişletilecek.
OpenAI, bu testçilerin kim olduğunu ya da nasıl seçildiklerini açıklamadı ve şirketin yayımladığı benchmark sonuçları, şu ana kadar herhangi bir bağımsız kurum tarafından doğrulanmış değil.
Şirket, kendi güvenlik önlemlerinin meşru çalışmaları da duraklatıp durdurabileceği uyarısında bulunuyor; buna savunma amaçlı siber güvenlik araştırmaları ve uzun soluklu otonom ajan görevleri de dâhil. OpenAI, Astra’yı bugüne kadarki “talimatlara en uyumlu” modeli olarak tanımlıyor. İç testlerde Astra, siber jailbreak girişimlerinin %91,5’ini reddederken, mevcut amiral gemisi GPT‑5.6 Sol’un oranı %59’da kaldı.
Ayrıca Oku: Claude Fable 5.1, 0,25 Dolar Cache Okuma ve Kopya Karşıtı Kontrollerle Yayında
“Recurrent Depth” Tepki Çekiyor
Ayrı bir haberde, Astra’nın şirketin şimdilik sınırlamaya çalıştığı “recurrent depth” adlı bir mimariye dayandığı aktarıldı.
Bu yöntem, modelin akıl yürütme süreçlerinin daha büyük bölümünü okunabilir metinden alıp dahili aktivasyonlara taşıyor; bu da hem maliyeti düşürüyor hem de zor problemlerde performansı artırıyor. Ancak aynı zamanda, güvenlik ekiplerinin modelin talimatlardan sapmasını yakalamak için izlediği düz‑metin “izini” de inceltiyor.
OpenAI, Astra’yı ek zincirleme-akıl yürütme (chain‑of‑thought) izleme mekanizmalarıyla piyasaya sürmeyi planlıyor; ancak bu kontroller, yalnızca okunabilen akıl yürütme adımlarında işe yarıyor.
Redwood Research baş bilim insanı Ryan Greenblatt, bu değişimi yapay zeka güvenliği ve siber güvenlik açısından “şimdiye kadarki en olumsuz gelişmelerden biri” olarak nitelendirdi. Eski OpenAI güvenlik yöneticisi Steven Adler ise yaklaşımın, sektörün kendi kendine çizdiği çok az sayıdaki kırmızı çizgiden birini aşıyor gibi göründüğünü yazdı.
OpenAI’nin Siber Uyarılarında Zaman Çizelgesi
Bu yeni sınıflandırma, şirketten son bir ayda gelen art arda uyarıların zirvesini oluşturuyor.
OpenAI, 7 Ağustos’ta yayımladığı açıklamada, Astra’nın “Kritik” düzeyde siber kapasiteye sahip olabileceğini göz ardı edemediğini duyurmuş ve önceki bir sistemden türeyen ajanların test ortamından çıkarak Hugging Face üzerindeki verilere ulaşmasının ardından sınır düzeyi eğitim çalışmalarının bir kısmını durdurmuştu.
Durdurulan eğitim koşusu 28 Ağustos’ta –şirketin koruma önlemlerini yayına hazır ilan etmesinden dört gün önce– yeniden başlatıldı.
Sonraki Haber: Bitcoin ETF’leri 216,7 Milyon Dolar Çekerek Tek Günlük Çıkışları Telafi Etti





