Grok 4.5, Ajan Yapay Zekâ Testinde %51,4’lük Skorla Fable 5 ve Opus 4.8’i Geride Bıraktı

Grok 4.5, Ajan Yapay Zekâ Testinde %51,4’lük Skorla Fable 5 ve Opus 4.8’i Geride Bıraktı

Grok 4.5, bağımsız bir ajan kıyaslamasında birinci sıraya yerleşerek Elon Musk’ın maliyet ve performans iddialarına yeni bir dayanak sağladı.

Öne Çıkan Noktalar:

  • Grok 4.5, AutomationBench-AA testinde %51,4 skorla iki Claude modelinin önüne geçti.
  • Modelin görev başı maliyeti 0,34 dolar; en yakın Anthropic rakiplerinin çok altında.
  • Daha yüksek kural/koruma ihlali oranı, kurumsal ajan kullanımında hâlâ önemli bir risk unsuru.

Grok Kıyaslaması

Artificial Analysis, açıklamasında Grok 4.5’in AutomationBench-AA’de %51,4 skor aldığını, bunun da Claude Fable 5’in %48,6’lık ve Claude Opus 4.8’in %48,5’lik performansının önüne geçtiğini belirtti. Modelin görev başına maliyeti de 0,34 dolar seviyesinde; Fable 5’in 1,35 doları ve Opus 4.8’in 1,46 dolarıyla kıyaslandığında ciddi bir fark söz konusu.

Bu kıyaslama, Musk’ın Grok 4.5’i “Opus sınıfı, ama daha hızlı ve daha ucuz” diye tanımlayan söylemine harici bir test referansı ekliyor. SpaceXAI, 1,5 trilyon parametreli V9 taban modelini ve erken iç değerlendirmeleri kullanarak, bu hafta Grok 4.5’i halka açık şekilde piyasaya sürdü.

AutomationBench-AA, Gmail, Slack, Salesforce ve HubSpot dâhil 40 simüle uygulama üzerinde 657 görev kullanıyor. Test, bir yapay zekâ ajanının hedefleri, güvenlik ve kural setlerini (guardrail) ihlal etmeden tamamlayıp tamamlayamadığını izliyor. Artificial Analysis, ölçümün bozulmaması için görev setini kamuya açıklamadan gizli tutuyor.

Ayrıca Oku: Grok 4.5, Daha Ucuz Ajan Yapay Zekâ ile OpenAI ve Anthropic’e Meydan Okuyor

Musk’ın İddialı Söylemi

Artificial Analysis’e göre Grok 4.5, görev başına yaklaşık 8.000 çıktı token’ı üretti; bu da Opus 4.8’in toplamının yaklaşık dörtte birine denk geliyor. Kuruluş, “Görev başına toplam 0,44 milyon token kullanımı, liderlik tablosundaki en düşük seviyelerden biri” diyerek, düşük maliyetin hem verimlilikten hem de token fiyatlandırmasından kaynaklandığını vurguladı.

Model, görev hedeflerinin %79,9’unu tamamlamayı başardı; görevlerin %21,9’unda ise uçtan uca tam başarı sağladı. Kıyaslamanın en zor alanı olan finans dikeyinde Grok 4.5, %71 ile liderlik koltuğuna oturdu; Fable 5 %64’te, Opus 4.8 ise %62’de kaldı.

Zayıf halka ise uyum tarafı oldu. Grok 4.5, görev başına ortalama 0,63 koruma/kural ihlali kaydetti; bu oran Opus 4.8’de 0,55 ve Google’ın Gemini 3.5 Flash modelinde 0,46. Canlı finansal sistemlere yakın çalışan ajanları devreye almak isteyen kurumlar açısından bu fark kritik önem taşıyor.

Musk’ın lansman anlatısı, temiz bir test zaferinden çok pratik bir “verimlilik karşılığı risk” dengesi üzerine kuruldu. Grok 4.5, maliyet ve hız tarafında artık bağımsız bir doğrulamaya sahip; ancak daha yüksek kural ihlali oranı, kurumsal benimsemenin nihayetinde güvenilirlik metriklerine bağlı olacağını gösteriyor.

Sıradaki Haber: Bitcoin’in Toparlanmasında Boğaların Göz Ardı Edemeyeceği Talep Sorunu

Feragatname ve Risk Uyarısı: Bu makalede sağlanan bilgiler yalnızca eğitici ve bilgilendirici amaçlıdır ve yazarın görüşüne dayanmaktadır. Mali, yatırım, hukuki veya vergi tavsiyesi teşkil etmez. Kripto para varlıkları son derece değişkendir ve yatırımınızın tamamını veya önemli bir kısmını kaybetme riski dahil olmak üzere yüksek riske tabidir. Kripto varlık ticareti veya tutma tüm yatırımcılar için uygun olmayabilir. Bu makalede ifade edilen görüşler yalnızca yazara aittir ve Yellow, kurucuları veya yöneticilerinin resmi politikasını veya pozisyonunu temsil etmez. Her zaman kendi kapsamlı araştırmanızı yapın (D.Y.O.R.) ve herhangi bir yatırım kararı vermeden önce lisanslı bir finansal uzmanla görüşün.
Grok 4.5, Ajan Yapay Zekâ Testinde %51,4’lük Skorla Fable 5 ve Opus 4.8’i Geride Bıraktı | Yellow