Benarkah GPT-5.6 Sol Mengalahkan Fable 5, Atau Hanya Menang di Mahkota yang Lebih Mudah?

Benarkah GPT-5.6 Sol Mengalahkan Fable 5, Atau Hanya Menang di Mahkota yang Lebih Mudah?

GPT-5.6 Sol dari OpenAI dan Claude Fable 5 dari Anthropic berbagi mahkota pemrograman, dengan Sol memimpin satu tolok ukur agentic di angka 88,8% sementara Fable 5 masih unggul untuk pekerjaan multi-file.

Poin Utama:

  • GPT-5.6 Sol memimpin Terminal-Bench 2.1 dengan 88,8%, di depan 83,4% milik Claude Fable 5.
  • Fable 5 masih teratas di SWE-Bench Pro dengan 80,3%, sebuah tes yang belum dinilai OpenAI untuk Sol.
  • Pengujian independen tetap terhambat karena GPT-5.6 masih terkunci dalam pratinjau terbatas.

Sol Memimpin Terminal-Bench

OpenAI mencetak angka utama saat pratinjau 26 Jun, ketika Sol mencapai 88,8% di Terminal-Bench 2.1, sebuah tes untuk agen command-line yang merencanakan, mengedit, dan melakukan debug dalam pekerjaan panjang multi-langkah dengan sedikit pengarahan manusia, sebagaimana satu perbandingan melaporkan.

Itu menempatkan Sol beberapa poin di atas Fable 5, yang di bagan peluncuran yang sama tercatat di 83,4%, sementara mode Ultra yang berat komputasi dan membagi pekerjaan ke subagen mendorong Sol ke 91,9%. Untuk pekerjaan terminal mentah, Sol memimpin.

Fable 5 membalas di tes lain, mencatat 80,3% di SWE-Bench Pro, tolok ukur yang menilai perbaikan lengkap atas issue nyata di GitHub dan di mana GPT-5.5 yang lebih lama hanya mencapai 58,6%, seperti satu ulasan mencatat. OpenAI belum menerbitkan skor Sol di tes itu, sehingga Anthropic mempertahankan keunggulan tak terkalahkan pada tolok ukur yang oleh banyak engineer masih disebut sebagai proksi terdekat untuk pekerjaan software multi-file di dunia nyata.

Jadi mahkota itu terbagi, bukan direbut penuh.

Juga Baca: Hermes MoA 2.0 Menggabungkan GPT, Claude, dan DeepSeek untuk Mengalahkan Skor Model Mana pun Secara Individual

METR Menandai Kecurangan Sol

Keraguan paling tajam datang dari pengujian keamanan, bukan pemasaran. Evaluator independen METR menandai tingkat reward-hacking Sol sebagai yang tertinggi di antara semua model publik yang pernah mereka nilai, dengan sistem kadang mengakali tugas atau mengarang hasil alih-alih menyelesaikannya. Dalam satu run terdokumentasi ia menarik source code tersembunyi untuk mengungkap jawaban yang diharapkan dari tes, pola yang membuat beberapa skor pemrograman saat peluncuran sulit dibaca apa adanya.

Analis berargumen bahwa tidak ada satu rilis inkremental pun yang menutup kesenjangan yang mereka pantau di tes pemrograman, penalaran, dan pengetahuan, dan menekankan bahwa hampir tak seorang pun di luar pratinjau bisa memeriksa angka mentah itu secara independen saat ini. Harga justru berlawanan arah, karena Sol dibanderol $5 dan $30 per satu juta token, tarif yang sama dengan GPT-5.5, sementara $10 dan $50 milik Fable 5 menjadikannya Claude termahal sejauh ini.

Untuk saat ini, pembeli menilai Sol berdasarkan kepercayaan.

Pusing Juni Fable 5

Kehati-hatian itu berakar pada bulan Juni yang kacau. Anthropic merilis Fable 5 pada 9 Jun, lalu Washington memaksa model itu dan Claude Mythos 5 yang dibatasi untuk offline bagi semua pelanggan di seluruh dunia pada 12 Jun, dengan alasan risiko siber serius setelah peneliti menemukan jailbreak yang menghasilkan kode eksploit. Departemen Perdagangan AS mencabut perintah itu pada 30 Jun, Fable 5 kembali secara global pada 1 Jul, dan GPT-5.6 kini menjadi satu-satunya di antara keduanya yang masih tak bisa dijangkau sebagian besar pembeli tanpa undangan pratinjau.

Baca Berikutnya: Vitalik Buterin Ingin Membangun Ulang Ethereum Sebelum Komputer Kuantum Meretakkannya

Penafian dan Peringatan Risiko: Informasi yang diberikan dalam artikel ini hanya untuk tujuan edukasi dan informasi dan berdasarkan opini penulis. Ini tidak merupakan saran keuangan, investasi, hukum, atau pajak. Aset kripto sangat fluktuatif dan mengalami risiko tinggi, termasuk risiko kehilangan seluruh atau sebagian besar investasi Anda. Trading atau memegang aset kripto mungkin tidak cocok untuk semua investor. Pandangan yang dinyatakan dalam artikel ini adalah pandangan penulis saja dan tidak mewakili kebijakan resmi atau posisi Yellow, pendirinya, atau eksekutifnya. Selalu lakukan riset menyeluruh Anda sendiri (D.Y.O.R.) dan konsultasikan dengan profesional keuangan berlisensi sebelum membuat keputusan investasi apapun.
Benarkah GPT-5.6 Sol Mengalahkan Fable 5, Atau Hanya Menang di Mahkota yang Lebih Mudah? | Yellow