Grok 4.5 ile GPT-5.6, yalnızca bir gün arayla piyasaya çıktı ve incelemeleri böldü: Bir yanda OpenAI’nin terminal tabanlı “agentic” görevlerde yakaladığı yüzde 91,9’luk kodlama skoru, diğer yanda SpaceXAI’nin milyon token başına 2 dolarlık agresif fiyatlaması.
Öne çıkan başlıklar:
- GPT-5.6 Sol, başa baş kıyaslamalarda çoğu ölçümde lider; Grok 4.5 ise fiyat, hız ve token verimliliğinde öne geçiyor.
- Bağımsız testçiler, Grok 4.5’i zekâ endeksinde dördüncü sıraya koyarken halüsinasyon oranının yüzde 54’e, yani iki katına çıktığını vurguluyor.
- İncelemeler, uzun yazı ve maraton kodlama işlerinde GPT-5.6’yı; yüksek hacimli, bütçe hassasiyetli kullanımda ise Grok 4.5’i öne çıkarıyor.
Grok 4.5 ve GPT-5.6: Kafa kafaya kıyas
SpaceXAI, Grok 4.5’i 8 Temmuz’da devreye aldı. OpenAI ise ertesi gün yanıt verdi ve amiral gemisi Sol’un yanında daha ucuz Terra ve Luna katmanlarını içeren GPT-5.6 ailesini duyurdu. Ölçüm şirketi Artificial Analysis, yeni Grok’u 54 puanla Zekâ Endeksi’nde dördüncü sıraya yerleştirdi; Claude Fable 5, GPT-5.5 ve Opus 4.8’in gerisinde.
Doğrudan karşılaştırmada tablo OpenAI lehine. Geçici bir skor tablosu, GPT-5.6 Sol’u 82 puan alan Grok 4.5’e karşı 86 puanla öne koyuyor. Fark, özellikle terminal tabanlı “agentic” görevlerde açılıyor: Sol burada yüzde 91,9’a karşı Grok’un yüzde 83,3’ünü görüyor. Ortalama kodlama skorları ise 64,7’ye karşı 64,6 ile neredeyse başa baş.
OpenAI, açıklamasında Sol’un maksimum muhakeme ayarında bağımsız Coding Agent Index’te 80 puanla rekor kırdığını, Grok 4.5’in ise Grok Build ortamı içinde 76 puanda kaldığını belirtiyor. Ekonomi cephesinde ise ibre tersine dönüyor. Grok, milyon giriş token’ı için 2 dolar isterken Sol için bu rakam 5 dolar. Tamamlanmış bir kodlama işinin maliyeti Grok’ta 2,49 dolar iken Fable 5 tarafında 11,80 dolara çıkıyor.
Ayrıca bakınız: Dodgers Bahisleri 68 Milyon Dolara Ulaştı: Polymarket ve Kalshi Beyzbol Play-off Yarışına Yükleniyor
Kodlama, yazı işleri ve günlük kullanım
Saha testleri de aynı ayrımı işaret ediyor. Uzun vadeli bir deneme ortamında, Sol’un 100’ün üzerinde gerçek depo görevini, deneme/yanılma hatasına düşmeden yüzde 63,7 oranında tamamladığı ve dağınık, çok adımlı kontrol listelerinde bile yönünü kaybetmediği bildirildi. Ayrı bir bağımsız kodlama testi ise Sol’a 100 üzerinden 92, Grok 4.5’e 87 puan verdi – yani Grok, en güçlü açık ağırlıklı modellerle başa baş.
İçerik üreticileri cephesinde de tablo benzer. Erken dönem kullanıcılar, Sol’u günlük iş akışında “varsayılan araç” olarak tanımlıyor; rutin bilgi işçiliğinin yaklaşık yüzde 80’ini tek başına kaldırabildiğini ve rakiplerine kıyasla stil rehberlerine daha sadık kaldığını aktarıyor.
Grok 4.5 ise hız ve “itaat” kartını oynuyor. Canlı işlerde modeli deneyen kullanıcılar, raporlarında ilk seferde derli toplu çıktı, tutarlı yapılandırılmış yanıtlar ve saniyede yaklaşık 80 token’lık üretim hızıyla 5 saniyenin altına inen cevap süreleri not ediyor. Ancak isabet oranı soru işareti: Ölçülen halüsinasyon oranı yüzde 25’ten 54’e sıçrarken, doğruluk metriği sadece yüzde 52’ye yükselmiş durumda.
Uzman değerlendirmeleri ve güven tartışması
Elon Musk, Grok 4.5’i “Opus sınıfında bir model, ama daha hızlı, token açısından daha verimli ve daha ucuz” diye pazarladı. Bazı analistler, aradaki fiyat farkının, test skorlarındaki makası gölgede bırakabileceğini savunuyor; zira Grok, görev başına ortalama 1,9 milyon token harcarken Fable 5’in tüketimi 7,2 milyon token’a çıkıyor.
Şüpheciler ise temkinli. İncelemelerde, lansmandaki pek çok skorun şirketler tarafından bildirildiği, model kartının yayımlanmadığı ve Cursor’ın, Grok’un kendi kod tabanıyla istemeden eğitilmesi üzerine bir iç benchmark’ını geri çektiği hatırlatılıyor. GPT-5.6 tarafında da soru işareti var: OpenAI’nin sistem kartı, modelin selefine kıyasla talimatlara daha sık aykırı davrandığını açıkça kabul ediyor.
Rekabet, zaten çalkantılı geçen birkaç ayın ardından geldi. SpaceX, şubat ayında xAI’ı bünyesine kattı, haziranda Cursor’ı 60 milyar dolara satın aldı ve Grok 4.5 lansmanından iki gün önce laboratuvarı SpaceXAI markasıyla yeniden adlandırdı. OpenAI ise haziran sonunu Sol’un devlet denetimi altında kilitli olduğu bir sürecin içinde geçirdi. Öte yandan hâlâ yayımlanmış kıyaslamalarda bir numara olan Anthropic’in Fable 5’i, 19 günlük askı sürecinin ardından ancak 1 Temmuz’da geri dönebildi.
Sıradaki haber: Ethereum, Bitcoin Karşısında Güçleniyor: Tom Lee’nin 2026 Boğa Senaryosu Testte






