Anthropic resmi merilis Claude Sonnet 5.5 pada Senin, dengan klaim bahwa model AI kelas menengah terbarunya berjalan lebih dari 30% lebih cepat dan memangkas biaya per tugas hingga 30% dibandingkan pendahulunya.
Poin Penting:
- Sonnet 5.5 mencatat skor 70,6% pada uji coding Terminal-Bench 4.0, melonjak dari 10,3% untuk Sonnet 5.
- Ini adalah model Sonnet pertama yang hadir dengan pengaman siber yang sebelumnya hanya disematkan pada sistem unggulan Anthropic.
- Satu tolok ukur independen justru mendapati biaya per tugas lebih tinggi dibanding Sonnet 5 ketika dijalankan pada tingkat usaha maksimum.
Tolok Ukur Kinerja Claude Sonnet 5.5
Sonnet 5.5 menjadi model kedua di keluarga Claude 5.5 dan hadir enam hari setelah peluncuran model flagship Claude Opus 5.5, menurut pengumuman perusahaan di situsnya.
Anthropic memposisikannya sebagai pendamping Opus 5.5 yang lebih cepat dan lebih hemat, dirancang untuk tugas-tugas harian yang terdefinisi jelas, perbaikan bug, hingga penyusunan dokumen, presentasi, dan spreadsheet yang rapi. Tarifnya dipatok sebesar US$2 per satu juta token input dan US$10 per satu juta token output.
Pada Terminal-Bench 4.0, sebuah uji coding berbasis agen, Sonnet 5.5 mencatat skor 70,6%, dibandingkan 10,3% untuk Sonnet 5 dan 66,4% untuk Opus 5.5 yang dibanderol lebih mahal. Model ini juga menjadi model Sonnet pertama yang berhasil menuntaskan gim Pokémon Red hanya dengan bermodal tangkapan layar, sebuah pengujian kemampuan kerja jangka panjang dan pemahaman visual.
Sonnet 5.5 kini tersedia di seluruh platform Anthropic, termasuk Amazon Web Services, Google Cloud, dan Microsoft Azure. Anthropic menyatakan model yang lebih kecil, Claude Haiku 5.5, yang ditujukan untuk kebutuhan volume tinggi dan sangat sensitif terhadap biaya, akan menyusul dalam beberapa minggu ke depan. Kehadiran Haiku 5.5 akan melengkapi jajaran tiga model di lini ini.
Juga Baca: OpenAI Menginjak Rem Frontier AI Setelah Insiden Sandbox Escape 20 September
Pengaman Siber dan Struktur Biaya Sonnet 5.5
Anthropic mengutip komentar Daniel Vogel, chief operating officer Epic Games, yang menyebut Sonnet 5.5 mampu menangani puluhan ribu baris kode sistem gameplay pada uji awal. Vogel menilai model ini “lulus standar kualitas yang biasanya Anda harapkan dari model kelas atas.”
Karena kemampuan sibernya dinilai sebanding dengan Opus 5, Sonnet 5.5 menjadi model Sonnet pertama yang diluncurkan dengan rangkaian pengaman yang sebelumnya hanya dipasang pada model paling canggih Anthropic. Perbaikan bug rutin diklaim tidak terdampak, namun permintaan terkait siber berisiko tinggi akan secara jelas dialihkan kembali ke Sonnet 5. Selain itu, classifier baru disematkan untuk memblokir upaya pengguna menarik atau “mengorek” proses penalaran internal model.
Tidak semua pengujian mendukung klaim efisiensi biaya tersebut. Firma riset Artificial Analysis dilaporkan mengukur biaya tertimbang sebesar US$7,60 per tugas benchmark pada tingkat usaha maksimum, dibanding US$5,09 untuk Sonnet 5, meski skor indeks kinerja model baru naik ke 56 dari 38.
Peluncuran ini mengikuti debut Opus 5.5 pada 22 September, ketika Anthropic memangkas harga flagship sebesar 20% menjadi US$4 per satu juta token input dan US$20 per satu juta token output. Saat itu, perusahaan menyatakan Opus 5.5 akan memangkas biaya sekitar 40% dibanding Opus 5 untuk beban kerja tipikal, serta menghasilkan output lebih dari 30% lebih cepat. OpenAI di hari yang sama merilis GPT-6 Sol dan GPT-6 Luna, dengan harga separuh dari pendahulunya.
Baca Berikutnya: BlackRock Yakin Daya Komputasi Akan Menjadi Instrumen di Pasar Berjangka

