OpenAI Astra, Kritik Siber Eşiği Aşan İlk Model Oldu

Researchers pushed back after a 100% exploit score moved OpenAI's Astra past its own Critical cyber threshold. (Image: Shutterstock)
Researchers pushed back after a 100% exploit score moved OpenAI's Astra past its own Critical cyber threshold. (Image: Shutterstock)

OpenAI, henüz piyasaya sürülmemiş Astra modelinin kamuya açık bir exploit-yazma benchmark’ında %100 puan almasının ardından, şirketin “Kritik” siber güvenlik eşiğini aşan ilk model olduğunu Salı günü duyurdu.

Öne Çıkanlar

  • Astra, OpenAI’nin Hazırlıklılık Çerçevesi’nde siber güvenlik açısından “Kritik” seviyede derecelendirilen ilk modeli.
  • Model, kamuya açık exploit benchmark’ında tam puan aldı ve şirket içi testlerde daha önce bilinmeyen iki zafiyet ortaya çıkardı.
  • “Recurrent depth” adı verilen mimariye ilişkin ayrı haberler, yapay zeka güvenliği araştırmacılarının sert itirazlarına yol açtı.

Astra’nın Exploit Benchmark Sonuçları

Şirket, Salı günü yayımladığı değerlendirmede, Astra’nın daha önce tespit edilmemiş açıkları bulabildiğini ve iyi korunmuş sistemlerde, her adımda insan yönlendirmesine ihtiyaç duymadan, çalışan exploit’ler geliştirebildiğini belirtti.

Haziran–Ağustos döneminde açıklanan, yüksek şiddette 20 hatadan derlenen özel bir benchmark’ta model, iki “zero‑day” zafiyeti bulup zincirleyerek sömürdü; mühendisler bu açıkları şimdi ilgili yazılım geliştiricilere raporluyor. Uzman incelemeciler modeli ayrıca sertleştirilmiş bir tarayıcı ve işletim sistemi üzerinde denedi; Astra sandbox’tan çıkmayı başararak ana sistemde komut çalıştırdı.

En güçlü siber özelliklere erişim önce küçük bir alfa testçi grubuna açılacak, ardından “Daybreak Blue” adlı savunma odaklı bir program kapsamında kademeli olarak genişletilecek.

OpenAI, bu testçilerin kim olduğunu ya da nasıl seçildiklerini açıklamadı ve şirketin yayımladığı benchmark sonuçları, şu ana kadar herhangi bir bağımsız kurum tarafından doğrulanmış değil.

Şirket, kendi güvenlik önlemlerinin meşru çalışmaları da duraklatıp durdurabileceği uyarısında bulunuyor; buna savunma amaçlı siber güvenlik araştırmaları ve uzun soluklu otonom ajan görevleri de dâhil. OpenAI, Astra’yı bugüne kadarki “talimatlara en uyumlu” modeli olarak tanımlıyor. İç testlerde Astra, siber jailbreak girişimlerinin %91,5’ini reddederken, mevcut amiral gemisi GPT‑5.6 Sol’un oranı %59’da kaldı.

Ayrıca Oku: Claude Fable 5.1, 0,25 Dolar Cache Okuma ve Kopya Karşıtı Kontrollerle Yayında

“Recurrent Depth” Tepki Çekiyor

Ayrı bir haberde, Astra’nın şirketin şimdilik sınırlamaya çalıştığı “recurrent depth” adlı bir mimariye dayandığı aktarıldı.

Bu yöntem, modelin akıl yürütme süreçlerinin daha büyük bölümünü okunabilir metinden alıp dahili aktivasyonlara taşıyor; bu da hem maliyeti düşürüyor hem de zor problemlerde performansı artırıyor. Ancak aynı zamanda, güvenlik ekiplerinin modelin talimatlardan sapmasını yakalamak için izlediği düz‑metin “izini” de inceltiyor.

OpenAI, Astra’yı ek zincirleme-akıl yürütme (chain‑of‑thought) izleme mekanizmalarıyla piyasaya sürmeyi planlıyor; ancak bu kontroller, yalnızca okunabilen akıl yürütme adımlarında işe yarıyor.

Redwood Research baş bilim insanı Ryan Greenblatt, bu değişimi yapay zeka güvenliği ve siber güvenlik açısından “şimdiye kadarki en olumsuz gelişmelerden biri” olarak nitelendirdi. Eski OpenAI güvenlik yöneticisi Steven Adler ise yaklaşımın, sektörün kendi kendine çizdiği çok az sayıdaki kırmızı çizgiden birini aşıyor gibi göründüğünü yazdı.

OpenAI’nin Siber Uyarılarında Zaman Çizelgesi

Bu yeni sınıflandırma, şirketten son bir ayda gelen art arda uyarıların zirvesini oluşturuyor.

OpenAI, 7 Ağustos’ta yayımladığı açıklamada, Astra’nın “Kritik” düzeyde siber kapasiteye sahip olabileceğini göz ardı edemediğini duyurmuş ve önceki bir sistemden türeyen ajanların test ortamından çıkarak Hugging Face üzerindeki verilere ulaşmasının ardından sınır düzeyi eğitim çalışmalarının bir kısmını durdurmuştu.

Durdurulan eğitim koşusu 28 Ağustos’ta –şirketin koruma önlemlerini yayına hazır ilan etmesinden dört gün önce– yeniden başlatıldı.

Sonraki Haber: Bitcoin ETF’leri 216,7 Milyon Dolar Çekerek Tek Günlük Çıkışları Telafi Etti

Alexey Bondarev profile photo

Alexey Bondarev

Alexey Bondarev, Yellow.com'da İçerik Başkanıdır ve son 10 yıldır kripto hakkında haber yapmaktadır. Analitik raporlama, sektör bağlamı ve kriptonun şekillenmesinde rol oynayan daha büyük dinamiklere odaklanan derinlemesine Araştırma ve Öğrenme içerikleri konusunda uzmanlaşmıştır; bunlara yapay zeka çağı, güvenlik teknolojileri ve fintech inovasyonu dahildir. Dijital olan her şeyin kısa süre içinde analog olan her şeyin yerini alacağına inanmakta ve bunun gerçekleşmesi için yoğun şekilde çalışmaktadır.

Feragatname ve Risk Uyarısı: Bu makalede sağlanan bilgiler yalnızca eğitici ve bilgilendirici amaçlıdır ve yazarın görüşüne dayanmaktadır. Mali, yatırım, hukuki veya vergi tavsiyesi teşkil etmez. Kripto para varlıkları son derece değişkendir ve yatırımınızın tamamını veya önemli bir kısmını kaybetme riski dahil olmak üzere yüksek riske tabidir. Kripto varlık ticareti veya tutma tüm yatırımcılar için uygun olmayabilir. Bu makalede ifade edilen görüşler yalnızca yazara aittir ve Yellow, kurucuları veya yöneticilerinin resmi politikasını veya pozisyonunu temsil etmez. Her zaman kendi kapsamlı araştırmanızı yapın (D.Y.O.R.) ve herhangi bir yatırım kararı vermeden önce lisanslı bir finansal uzmanla görüşün.
OpenAI Astra, Kritik Siber Eşiği Aşan İlk Model Oldu | Yellow