Anthropic, pazartesi günü Claude Sonnet 5.5’i duyurdu. Şirket, yeni orta seviye yapay zekâ modelinin selefine göre %30’dan daha hızlı çalıştığını ve görev başına maliyeti %30’a kadar aşağı çektiğini söylüyor.
Öne çıkanlar:
- Sonnet 5.5, Terminal-Bench 4.0 kodlama testinde %70,6 puan alarak Sonnet 5’in %10,3’lük skorunu geride bıraktı.
- Siber güvenlik için daha önce yalnızca Anthropic’in üst seviye sistemlerinde yer alan korumalar, ilk kez bir Sonnet modeline entegre edildi.
- Bağımsız bir kıyaslama, maksimum performans ayarlarında Sonnet 5.5’in görev başı maliyetinin Sonnet 5’ten yüksek çıktığını bildiriyor.
Claude Sonnet 5.5 performans göstergeleri
Claude 5.5 ailesinin ikinci üyesi olan model, amiral gemisi Claude Opus 5.5’in çıkışından yalnızca altı gün sonra piyasaya sürüldü, şirketin açıklamasına göre.
Anthropic, Sonnet 5.5’i Opus 5.5’e göre daha hızlı ve daha düşük maliyetli bir tamamlayıcı olarak konumlandırıyor. Model; iyi tanımlanmış günlük işler, hata ayıklama süreçleri ile son haline getirilmiş dokümanlar, sunumlar ve elektronik tablolar için hedefleniyor. Fiyatlandırma, 1 milyon giriş token’ı için 2 dolar, 1 milyon çıkış token’ı için 10 dolar seviyesinde.
Ajan tabanlı bir kodlama testi olan Terminal-Bench 4.0’da Sonnet 5.5, %70,6 skor elde etti. Bu oran, Sonnet 5’in %10,3’lük ve daha pahalı konumlanan Opus 5.5’in %66,4’lük skorunun üzerinde. Model ayrıca yalnızca ekran görüntülerini kullanarak Pokémon Red’i bitiren ilk Sonnet versiyonu oldu; bu da uzun vadeli görev yürütme ve görsel anlama kabiliyetlerine işaret ediyor.
Model artık Amazon Web Services, Google Cloud ve Microsoft Azure dahil olmak üzere tüm Anthropic platformlarında çalışıyor. Anthropic, yüksek hacimli ve maliyet duyarlı kullanım senaryolarına dönük daha küçük Claude Haiku 5.5’in önümüzdeki haftalarda geleceğini belirtiyor. Böylece üç modelden oluşan ürün gamı tamamlanmış olacak.
Ayrıca bkz.: OpenAI, 20 Eylül Sandbox Kaçışının Ardından Frontier AI Gelişimini Frenliyor
Sonnet 5.5’in güvenlik katmanları ve maliyet tartışması
Anthropic, Epic Games operasyon direktörü Daniel Vogel’in değerlendirmesine de atıf yapıyor. Vogel, erken denemelerde modelin on binlerce satırlık oyun sistemi kodunu işlediğini ve “beklentinin, daha üst segment bir modelle aynı kalite standardını yakaladığını” söylüyor.
Siber becerilerinin Opus 5 ile kıyaslanabilir seviyeye gelmesi sayesinde Sonnet 5.5, Anthropic’in şimdiye dek yalnızca en yetkin modelleri için ayırdığı güvenlik önlemleriyle sunulan ilk Sonnet oldu. Rutin hata düzeltme görevleri etkilenmezken, daha yüksek riskli siber talepler görünür biçimde Sonnet 5’e geri çekiliyor. Yeni sınıflandırıcılar ise modelin akıl yürütme süreçlerinin dışarıya çıkarılmasına dönük denemeleri engelliyor.
Buna karşın, tüm testler maliyet avantajı iddiasını teyit etmiyor. Artificial Analysis, maksimum çaba düzeyinde yürütülen kıyaslama görevlerinde ağırlıklandırılmış görev maliyetini Sonnet 5.5 için 7,60 dolar, Sonnet 5 için ise 5,09 dolar olarak ölçtüğünü bildiriyor. Buna rağmen, yeni modelin endeks skoru 38’den 56’ya yükselmiş durumda.
Sonnet 5.5’in lansmanı, Anthropic’in 22 Eylül’de Opus 5.5’i tanıtmasının hemen ardından geldi. Şirket, o tarihte amiral gemisi modelin fiyatını %20 indirerek 1 milyon giriş token’ı için 4 dolar, 1 milyon çıkış token’ı için 20 dolara çekmişti. Anthropic, Opus 5.5’in tipik iş yüklerinde Opus 5’e göre yaklaşık %40 daha düşük maliyetle çalışacağını ve çıktıları %30’dan hızlı üreteceğini savunuyor. OpenAI ise aynı gün GPT-6 Sol ve GPT-6 Luna’yı piyasaya sürerek, bu modelleri seleflerinin yarı fiyatına konumlandırdı.
Sıradaki haber: BlackRock, Hesaplama Gücünün Vadeli İşlem Piyasalarına Taşınacağını Öngörüyor

