İlk Bağımsız Testlerin Ardından Claude Opus 5 Hakkında Uzmanlar İkiye Bölündü

İlk Bağımsız Testlerin Ardından Claude Opus 5 Hakkında Uzmanlar İkiye Bölündü

Bağımsız testçiler, Anthropic’in yeni modeli Claude Opus 5’e bir yetkinlik endeksinde 159 puan verdi; bu da Claude Fable 5’in sadece iki puan gerisinde. Ancak kod inceleme performansı ve pratik faydası konusunda değerlendirmeler sert biçimde ayrıştı.

Öne Çıkan Noktalar

  • Epoch AI, Claude Opus 5’i yetkinlik endeksinde 159, Claude Fable 5’i ise 161 puanla derecelendirdi; yazılım mühendisliği başlığında iki model başa baş çıktı.
  • CodeRabbit, eyleme dönük kod inceleme yorumlarında yüzde 39,3 isabet oranı ölçtü; bu, yüzde 35,2’lik mevcut taban çizgisinin üzerinde, ancak model aynı zamanda dört kat daha fazla “gereksiz ayrıntı” yorumu üretti.
  • Cognition ve Zapier’deki kurumsal testler, hata ayıklama ve uçtan uca iş otomasyonu senaryolarında belirgin iyileşme raporladı.

Claude Opus 5’in Karşılaştırmalı Skorları Tartışma Yaratıyor

Anthropic, modeli cuma günü piyasaya sundu ve açıklamasında, Opus 5’in, Fable 5’in “uç seviye” zekasına yarı maliyetle yaklaştığını, bu nedenle ürünü uzmanlardan ziyade günlük kullanım için konumlandırdığını belirtti. Harici kıyaslayıcılar genel resimde bu çerçeveye katılırken, ayrıntılarda görüş birliği sağlanamadı.

Epoch AI, Latent Space’in derlemesine göre paylaşılan verilerde, Opus 5’i yetkinlik endeksinde 159 puana, Fable 5’i ise 161 puana yerleştirdi ve yazılım mühendisliği kabiliyetinde iki modeli aynı seviyede derecelendirdi.

Artificial Analysis, kendi “ajan tabanlı bilgi işi” kıyas testinde Opus 5’i birinci sıraya koydu; model, Fable 5’i neredeyse 150 Elo puan farkla geride bırakırken, görev başına maliyeti de yüzde 20 düşürdü. Bazı geliştiriciler ise yetkinlik endeksine itiraz etti. Bu eleştirmenler, Opus 4.8’e göre yalnızca “bir puanlık” ilerlemenin, günlük kullanımda gördükleri sıçramayı yansıtmadığını savunuyor. Bir değerlendirici, kodlama testinde “orta çaba” ayarının, daha yüksek çaba seviyelerinden daha iyi sonuç verdiğini bildirdi.

Ayrıca Oku: BitMEX 11 Yıl Sonra Alıcı Bulamadan Kapanıyor

Kod İncelemesi Sonuçları Testçileri İkiye Bölüyor

CodeRabbit, Opus 5’i gerçek açık kaynak pull request’lerinden türetilmiş yaklaşık 100 hata örüntüsü üzerinde, her yapılandırmada üçer geçişle koşturdu ve yaptığı ölçümde eyleme dönük kod inceleme yorumlarında yüzde 39,3’lük bir isabet oranı kaydetti.

Bu oran, şirketin hâlihazırda üretimde kullandığı otomatik inceleyicinin belirlediği yüzde 35,2’lik taban seviyesini aşıyor. Öte yandan model, önceden bilinen hataların bir kısmını kaçırdı ve mühendislere ek iş yükü çıkaran, düşük katma değerli “titiz ayar” (nitpick) yorumlarını dört katına çıkardı.

Varsayılan çaba ayarında isabet oranı yüzde 26,4’e kadar düşüyor. CodeRabbit, bu sonuçlar ışığında ekiplerin Opus 5’i, mevcut çalışan kod inceleme hattını doğrudan ikame edecek bir çözüm yerine, gerektiğinde “yüksek hassasiyetli ikinci inceleyici” olarak konumlandırması gerektiği sonucuna vardı. Ürün ekipleri için yedi farklı modeli karşılaştırmalı testten geçiren Claire Vo ise, modeli değerlendirdiği yazıda “olağanüstü ama rahatsız edici” sözleriyle tanımladı; Vo, modelin “nevrotik” davranışlara meyletmesini ve birleştirme (merge) çatışmasını çözmeyi kategorik olarak reddetmesini örnek gösterdi.

Anthropic Müşterileri Ajan Tarafında Kazanç Görüyor

Cognition CEO’su Scott Wu, Opus 5’in, şirketin geliştirici ajanı Devin içinde Fable seviyesine yakın performansa, yarı maliyetle yaklaştığını söyledi; Wu, özellikle hata ayıklama ve kök neden analizi senaryolarında modelin öne çıktığını belirtti. Zapier CEO’su Wade Foster da, Opus 5’in, şirketin otomasyon ajansında en üst sıraya yerleştiğini, bunu da önceki Claude sürümleriyle aynı, milyon giriş token başına 5 dolar fiyat seviyesinde ve ek token tüketmeden başardığını aktardı.

Bu övgülere rağmen bazı kritik sınırlamalar da vurgulandı. Anthropic, paylaştığı notta, Opus 5’in saldırgan siber güvenlik görevlerinde Mythos 5 modelinin gerisinde kaldığını hatırlattı; ayrıca şirketin güvenlik sınıflandırıcıları tarafından riskli görülen isteklerin otomatik olarak Opus 4.8’e yönlendirildiğini bildirdi.

Bu temkinli yaklaşım, şirketin en üst segment modellerinde yaşanan dalgalı dönemin ardından geliyor. Fable 5, haziran ayında piyasaya çıktı ancak birkaç gün içinde hizmetten çekildi ve temmuz başında yeniden kullanıma sunuldu.

Sıradaki Haber: HubSpot Yüzde 12,7 Düştü, Analistler Neden Olarak Doğrudan OpenAI’nin Yeni Ajanını Gösteriyor

Feragatname ve Risk Uyarısı: Bu makalede sağlanan bilgiler yalnızca eğitici ve bilgilendirici amaçlıdır ve yazarın görüşüne dayanmaktadır. Mali, yatırım, hukuki veya vergi tavsiyesi teşkil etmez. Kripto para varlıkları son derece değişkendir ve yatırımınızın tamamını veya önemli bir kısmını kaybetme riski dahil olmak üzere yüksek riske tabidir. Kripto varlık ticareti veya tutma tüm yatırımcılar için uygun olmayabilir. Bu makalede ifade edilen görüşler yalnızca yazara aittir ve Yellow, kurucuları veya yöneticilerinin resmi politikasını veya pozisyonunu temsil etmez. Her zaman kendi kapsamlı araştırmanızı yapın (D.Y.O.R.) ve herhangi bir yatırım kararı vermeden önce lisanslı bir finansal uzmanla görüşün.
İlk Bağımsız Testlerin Ardından Claude Opus 5 Hakkında Uzmanlar İkiye Bölündü | Yellow