İlk Bağımsız Testler Sonrası Claude Opus 5 İçin Uzmanlar İkiye Bölündü

İlk Bağımsız Testler Sonrası Claude Opus 5 İçin Uzmanlar İkiye Bölündü

Bağımsız testçiler, Anthropic’in yeni modeli Claude Opus 5’e bir yetkinlik endeksinde 159 puan verdi; bu, Claude Fable 5’in yalnızca iki puan gerisinde. Ancak özellikle kod inceleme performansına ilişkin değerlendirmeler sert biçimde ayrışıyor.

Öne Çıkan Başlıklar

  • Epoch AI, Claude Opus 5’i yetkinlik endeksinde 159, Claude Fable 5’i ise 161 puanla derecelendirdi; yazılım mühendisliği tarafında iki model başa baş çıktı.
  • CodeRabbit, eyleme dönük kod inceleme yorumlarında yüzde 39,3 isabet oranı ölçerken, önceki yüzde 35,2’lik tabana göre iyileşme gördü; ancak “önemsiz detay” niteliğindeki yorum sayısı dört katına çıktı.
  • Cognition ve Zapier gibi kurumsal kullanıcılar, hata ayıklama ve uçtan uca iş otomasyonu senaryolarında kayda değer ilerleme bildirdi.

Claude Opus 5’in Kıyaslamaları Erken Dönemde Mercek Altında

Anthropic, modeli Cuma günü kullanıma açtı ve açıklamasında Opus 5’in, Fable 5’in sınır teknoloji seviyesine yarı maliyetle yaklaştığını, bu nedenle özel nişler yerine “günlük kullanım aracı” olarak konumlandığını duyurdu. Harici puanlayıcılar genel resimde buna katıldı; ancak “marj” konusunda tablo daha tartışmalı.

Epoch AI, Latent Space’in derlemesine göre, Opus 5’i yetkinlik endeksinde 159, Fable 5’i ise 161 puanla değerlendirirken; yazılım mühendisliğinde iki modeli aynı seviyede gördü. Bu tabloyu Latent Space ortaya koydu.

Artificial Analysis, modelin “ajan tipi bilgi işi” kıyaslamasında birinci geldiğini, Fable 5’i neredeyse 150 Elo farkla geride bıraktığını ve görev başına maliyeti yüzde 20 azalttığını bildirdi. Buna karşın bazı geliştiriciler yetkinlik endeksine itiraz ediyor. Onlara göre, Opus 4.8’e göre yalnızca “bir puanlık” artış, günlük kullanımda gözlemledikleri sıçramayı ciddi biçimde olduğundan küçük gösteriyor. Bir değerlendirici, bir kodlama testinde “orta çaba” ayarının, daha yüksek çaba seviyelerinden daha iyi sonuç verdiğini tespit etti.

Ayrıca Oku: BitMEX Is Shutting Down After 11 Years With No Buyer In Sight

Kod İnceleme Sonuçları Testçileri Böldü

CodeRabbit, Opus 5’i gerçek açık kaynak pull request’lerinden derlenen yaklaşık 100 hata örüntüsüne karşı, her yapılandırma için üçer geçişle test etti ve yaptığı ölçümde eyleme dönük yorumlarda yüzde 39,3’lük bir isabet oranı raporladı.

Bu oran, halihazırda üretimde çalışan otomatik inceleyicinin yüzde 35,2’lik tabanını geride bırakıyor. Öte yandan model, bilinen hata örneklerinin daha azını tespit etti ve mühendislerin tek tek elemek zorunda kaldığı düşük değerli “titizlenme” yorumlarını dört katına çıkardı.

Varsayılan çaba seviyesinde isabet oranı yüzde 26,4’e kadar düşüyor. Şirket, bu bulgular ışığında ekiplerin Opus 5’i, mevcutta çalışan kod inceleme hattının doğrudan yerine geçecek bir çözümden ziyade, ikinci ve “yüksek hassasiyetli” bir göz olarak konumlandırması gerektiği sonucuna vardı. Ürün ekipleri için yedi farklı modeli karşılaştıran Claire Vo da, yayımladığı değerlendirmede modeli “parlak ama sinir bozucu” diye niteledi; aşırı titiz davranışına ve bir merge çakışmasını çözmeyi tamamen reddetmesine atıf yaptı.

Anthropic Müşterilerinden Ajan Performansı Yorumları

Cognition CEO’su Scott Wu, Opus 5’in şirketin Devin adlı ajanında, özellikle hata ayıklama ve kök neden analizi tarafında, Fable seviyesine yakın performansı yarı maliyetle sunduğunu belirtti. Zapier CEO’su Wade Foster ise modelin, şirketin otomasyon sıralamasında zirveye yerleştiğini; bunu yaparken de, milyon başına 5 dolar seviyesinde fiyatlanan önceki Claude sürümlerinden daha fazla token harcamadığını söyledi.

Övgülerin yanında çekinceler de var. Anthropic, bir değerlendirmesinde vurguladığına göre, Opus 5 saldırı amaçlı siber güvenlik senaryolarında Mythos 5’in gerisinde kalıyor; ayrıca şirketin güvenlik sınıflandırıcıları tarafından riskli görülen talepler otomatik olarak Opus 4.8’e düşürülüyor.

Bu temkinli duruş, üst segmentteki dalgalı dönemin ardından geliyor. Fable 5, Haziran’da piyasaya çıkmış, birkaç gün sonra devreden alınmış ve Temmuz başında kullanıcılara geri verilmişti.

Sıradaki Haber: HubSpot Fell 12.7% And Analysts Point Straight At OpenAI's New Agent

Feragatname ve Risk Uyarısı: Bu makalede sağlanan bilgiler yalnızca eğitici ve bilgilendirici amaçlıdır ve yazarın görüşüne dayanmaktadır. Mali, yatırım, hukuki veya vergi tavsiyesi teşkil etmez. Kripto para varlıkları son derece değişkendir ve yatırımınızın tamamını veya önemli bir kısmını kaybetme riski dahil olmak üzere yüksek riske tabidir. Kripto varlık ticareti veya tutma tüm yatırımcılar için uygun olmayabilir. Bu makalede ifade edilen görüşler yalnızca yazara aittir ve Yellow, kurucuları veya yöneticilerinin resmi politikasını veya pozisyonunu temsil etmez. Her zaman kendi kapsamlı araştırmanızı yapın (D.Y.O.R.) ve herhangi bir yatırım kararı vermeden önce lisanslı bir finansal uzmanla görüşün.
İlk Bağımsız Testler Sonrası Claude Opus 5 İçin Uzmanlar İkiye Bölündü | Yellow