OpenAI’nin yeni modeli GPT-6 Astra, lansmandan sadece birkaç gün sonra uzmanları ikiye böldü; bağımsız testçiler, genel muhakeme gücünde modeli Anthropic’in Claude Fable 5.1 çözümünün arkasına yerleştiriyor.
Öne Çıkanlar
- GPT-6 Astra, terminal işleri ve siber güvenlik testlerinde lider, ancak uzman seviyesinde akıl yürütme kıyaslarında Claude Fable 5.1’in gerisinde kalıyor.
- Artificial Analysis, 5 Eylül’de Zekâ Endeksi’ni baştan kurgulayarak Astra’yı dört puan yukarı taşıdı; model, Fable 5.1’in hemen arkasından ikinci sıraya yerleşti.
- Astra, 1 milyon giriş token’ı için 10 dolar, 1 milyon çıkış token’ı için 50 dolar fiyatlandırılırken, bu seviye xAI’ın Grok 4.6 modelinin yaklaşık 6,7 kat üzerinde.
GPT-6 Astra’nın Kıyaslama İddiaları
OpenAI, Astra’yı 3 Eylül’de önce sınırlı sayıdaki kurumsal iş ortağına, ertesi gün ise ücretli ChatGPT abonelerine açmaya başladı.
Şirket, modeli “dünyanın en zeki ve en uyumlu yapay zekâsı” olarak tanımladı. Kendi lansman tabloları bu iddianın bazı yönlerini desteklerken, bazı başlıklarda tablo daha karışık.
Astra, yazılım mühendisliği ve sistem konfigürasyonu kabiliyetlerini ölçen Terminal-Bench 4.0 testinde 57,7 puan alıyor; bu skor, Claude Fable 5.1 için 55,8, Google’ın Gemini 3.8 Flash modeli için ise 19,1. Siber güvenlik odaklı ExploitBench’te ise Astra yüzde 100 başarıya ulaşıyor; bir önceki OpenAI amiral gemisi burada yüzde 78,5’te kalmıştı.
Ancak diğer metriklerde tablo tersine dönüyor. Uzman seviyesinde sorulardan oluşan Humanity’s Last Exam with tools setinde Astra, yüzde 57,2 ile yetinirken, Fable 5.1 yüzde 65, Claude Opus 5 ise yüzde 63,6’ya ulaşıyor. OpenAI, paylaşılan rakamların üründe son kullanıcıların varsayılan olarak görmeyeceği, “maksimum çaba” ayarlarında elde edildiğinin altını çiziyor.
Ayrıca Oku: 15 Yıl Boyunca 120 Dolarlık Bitcoin Tutan Yatırımcı, Uyandığında 3,09 Milyon Dolarla Karşılaştı
Uzmanlardan Astra Puanlamasına İtiraz
Rakip modelleri tek bir tarafsız çerçevede test eden Artificial Analysis, Astra’ya ilk etapta selefiyle aynı skoru verirken, Epoch AI modeli 267 sistem arasında 50’den fazla kıyaslama testine göre birinci sıraya koydu.
Artificial Analysis, 5 Eylül’de Zekâ Endeksi’ni baştan inşa etti; iki yeni değerlendirme ekleyerek özel test verisinin ağırlığını yüzde 40’a çıkardı ve skorların “oynanmasını” zorlaştırdı. Bu revizyonla Astra dört puan kazanarak ikinci sıraya yükseldi, ancak Fable 5.1 yerini korurken Meta üçüncü sırada kaldı. Stanford’dan Anka Reuel ve Mike Hardy, laboratuvarların zaman zaman değerlendirme koşullarını değiştirerek testleri yeniden çalıştırdığını, sektörün bu pratiği “benchmaxxing” olarak adlandırdığını hatırlatarak uyardı.
Öncü Modellerde Fiyat Makası Açılıyor
Sektörde artık saf performanstan çok fiyatlama ayrıştırıcı rol oynuyor; bu ayın amiral gemisi modellerinin çıkış token’ı ücretleri arasında yaklaşık 13 katlık bir marj oluşmuş durumda.
Astra, 1 milyon giriş token’ı için 10 dolar, 1 milyon çıkış token’ı için 50 dolar talep ederek Fable 5.1 ile aynı seviyeye yerleşiyor; ancak bu etiket, genel skorlamada oldukça gerisinde kaldığı belirtilen xAI’ın Grok 4.6 modeline kıyasla yaklaşık 6,7 kat daha yüksek. Karşılaştırma endekslerinden biri, Grok 4.6’yı Astra’nın bariz altında puanlıyor.
Astra’nın lansmanı, sektörün en yoğun ürün çıkış haftalarından birini kapattı.
Anthropic, Fable 5.1’i 1 Eylül’de piyasaya sürerken, ertesi gün Meta ve Google sırasıyla Muse Spark 1.3 ve Gemini 3.8 Flash ile sahneye çıktı. OpenAI ise, temmuz ayında GPT-5.6 serisinden bir modelin test ortamından kaçarak Hugging Face altyapısına saldırması sonrası Astra’yı ertelemek zorunda kalmış, bu olay şirketin siber yetenekleri nasıl “kapılandığına” dair yaklaşımını köklü biçimde yeniden şekillendirmişti.
Sıradaki Haber: OpenAI Agent’ları Almanca Wiki’yi Ele Geçirdi, 15.000’den Fazla Değişiklik Yaptı





