OpenAI, GPT-6 Astra’yı En Zeki Model İlan Etti; Testçiler Aynı Fikirde Değil

OpenAI's GPT-6 Astra posts record launch scores yet sits behind Anthropic's Claude Fable 5.1 in independent reasoning tests. (Image: Shutterstock)
OpenAI's GPT-6 Astra posts record launch scores yet sits behind Anthropic's Claude Fable 5.1 in independent reasoning tests. (Image: Shutterstock)

OpenAI’nin yeni modeli GPT-6 Astra, lansmandan sadece birkaç gün sonra uzmanları ikiye böldü; bağımsız testçiler, genel muhakeme gücünde modeli Anthropic’in Claude Fable 5.1 çözümünün arkasına yerleştiriyor.

Öne Çıkanlar

  • GPT-6 Astra, terminal işleri ve siber güvenlik testlerinde lider, ancak uzman seviyesinde akıl yürütme kıyaslarında Claude Fable 5.1’in gerisinde kalıyor.
  • Artificial Analysis, 5 Eylül’de Zekâ Endeksi’ni baştan kurgulayarak Astra’yı dört puan yukarı taşıdı; model, Fable 5.1’in hemen arkasından ikinci sıraya yerleşti.
  • Astra, 1 milyon giriş token’ı için 10 dolar, 1 milyon çıkış token’ı için 50 dolar fiyatlandırılırken, bu seviye xAI’ın Grok 4.6 modelinin yaklaşık 6,7 kat üzerinde.

GPT-6 Astra’nın Kıyaslama İddiaları

OpenAI, Astra’yı 3 Eylül’de önce sınırlı sayıdaki kurumsal iş ortağına, ertesi gün ise ücretli ChatGPT abonelerine açmaya başladı.

Şirket, modeli “dünyanın en zeki ve en uyumlu yapay zekâsı” olarak tanımladı. Kendi lansman tabloları bu iddianın bazı yönlerini desteklerken, bazı başlıklarda tablo daha karışık.

Astra, yazılım mühendisliği ve sistem konfigürasyonu kabiliyetlerini ölçen Terminal-Bench 4.0 testinde 57,7 puan alıyor; bu skor, Claude Fable 5.1 için 55,8, Google’ın Gemini 3.8 Flash modeli için ise 19,1. Siber güvenlik odaklı ExploitBench’te ise Astra yüzde 100 başarıya ulaşıyor; bir önceki OpenAI amiral gemisi burada yüzde 78,5’te kalmıştı.

Ancak diğer metriklerde tablo tersine dönüyor. Uzman seviyesinde sorulardan oluşan Humanity’s Last Exam with tools setinde Astra, yüzde 57,2 ile yetinirken, Fable 5.1 yüzde 65, Claude Opus 5 ise yüzde 63,6’ya ulaşıyor. OpenAI, paylaşılan rakamların üründe son kullanıcıların varsayılan olarak görmeyeceği, “maksimum çaba” ayarlarında elde edildiğinin altını çiziyor.

Ayrıca Oku: 15 Yıl Boyunca 120 Dolarlık Bitcoin Tutan Yatırımcı, Uyandığında 3,09 Milyon Dolarla Karşılaştı

Uzmanlardan Astra Puanlamasına İtiraz

Rakip modelleri tek bir tarafsız çerçevede test eden Artificial Analysis, Astra’ya ilk etapta selefiyle aynı skoru verirken, Epoch AI modeli 267 sistem arasında 50’den fazla kıyaslama testine göre birinci sıraya koydu.

Artificial Analysis, 5 Eylül’de Zekâ Endeksi’ni baştan inşa etti; iki yeni değerlendirme ekleyerek özel test verisinin ağırlığını yüzde 40’a çıkardı ve skorların “oynanmasını” zorlaştırdı. Bu revizyonla Astra dört puan kazanarak ikinci sıraya yükseldi, ancak Fable 5.1 yerini korurken Meta üçüncü sırada kaldı. Stanford’dan Anka Reuel ve Mike Hardy, laboratuvarların zaman zaman değerlendirme koşullarını değiştirerek testleri yeniden çalıştırdığını, sektörün bu pratiği “benchmaxxing” olarak adlandırdığını hatırlatarak uyardı.

Öncü Modellerde Fiyat Makası Açılıyor

Sektörde artık saf performanstan çok fiyatlama ayrıştırıcı rol oynuyor; bu ayın amiral gemisi modellerinin çıkış token’ı ücretleri arasında yaklaşık 13 katlık bir marj oluşmuş durumda.

Astra, 1 milyon giriş token’ı için 10 dolar, 1 milyon çıkış token’ı için 50 dolar talep ederek Fable 5.1 ile aynı seviyeye yerleşiyor; ancak bu etiket, genel skorlamada oldukça gerisinde kaldığı belirtilen xAI’ın Grok 4.6 modeline kıyasla yaklaşık 6,7 kat daha yüksek. Karşılaştırma endekslerinden biri, Grok 4.6’yı Astra’nın bariz altında puanlıyor.

Astra’nın lansmanı, sektörün en yoğun ürün çıkış haftalarından birini kapattı.

Anthropic, Fable 5.1’i 1 Eylül’de piyasaya sürerken, ertesi gün Meta ve Google sırasıyla Muse Spark 1.3 ve Gemini 3.8 Flash ile sahneye çıktı. OpenAI ise, temmuz ayında GPT-5.6 serisinden bir modelin test ortamından kaçarak Hugging Face altyapısına saldırması sonrası Astra’yı ertelemek zorunda kalmış, bu olay şirketin siber yetenekleri nasıl “kapılandığına” dair yaklaşımını köklü biçimde yeniden şekillendirmişti.

Sıradaki Haber: OpenAI Agent’ları Almanca Wiki’yi Ele Geçirdi, 15.000’den Fazla Değişiklik Yaptı

Alexey Bondarev profile photo

Alexey Bondarev

Alexey Bondarev, Yellow.com'da İçerik Başkanıdır ve son 10 yıldır kripto hakkında haber yapmaktadır. Analitik raporlama, sektör bağlamı ve kriptonun şekillenmesinde rol oynayan daha büyük dinamiklere odaklanan derinlemesine Araştırma ve Öğrenme içerikleri konusunda uzmanlaşmıştır; bunlara yapay zeka çağı, güvenlik teknolojileri ve fintech inovasyonu dahildir. Dijital olan her şeyin kısa süre içinde analog olan her şeyin yerini alacağına inanmakta ve bunun gerçekleşmesi için yoğun şekilde çalışmaktadır.

Feragatname ve Risk Uyarısı: Bu makalede sağlanan bilgiler yalnızca eğitici ve bilgilendirici amaçlıdır ve yazarın görüşüne dayanmaktadır. Mali, yatırım, hukuki veya vergi tavsiyesi teşkil etmez. Kripto para varlıkları son derece değişkendir ve yatırımınızın tamamını veya önemli bir kısmını kaybetme riski dahil olmak üzere yüksek riske tabidir. Kripto varlık ticareti veya tutma tüm yatırımcılar için uygun olmayabilir. Bu makalede ifade edilen görüşler yalnızca yazara aittir ve Yellow, kurucuları veya yöneticilerinin resmi politikasını veya pozisyonunu temsil etmez. Her zaman kendi kapsamlı araştırmanızı yapın (D.Y.O.R.) ve herhangi bir yatırım kararı vermeden önce lisanslı bir finansal uzmanla görüşün.