Grok 4.5 dan GPT-5.6 meluncur hanya berselang satu hari, memecah penilaian penguji antara skor pemrograman agentik 91,9% milik OpenAI dan tantangan harga $2 per juta token dari SpaceXAI terhadap tarif premium model frontier.
Poin Utama:
- GPT-5.6 Sol unggul di sebagian besar benchmark head-to-head, sementara Grok 4.5 menang di harga, kecepatan, dan efisiensi token.
- Penguji independen menempatkan Grok 4.5 di peringkat keempat soal kecerdasan dan menandai lonjakan tingkat halusinasi hingga 54%.
- Reviewer memilih GPT-5.6 untuk penulisan dan sesi coding panjang, dan Grok 4.5 untuk pekerjaan volume besar beranggaran ketat.
Benchmark Grok 4.5 Vs GPT-5.6
SpaceXAI merilis Grok 4.5 pada 8 Juli. OpenAI merespons sehari kemudian dengan GPT-5.6, keluarga model yang memasangkan varian flagship Sol dengan dua tier lebih murah, Terra dan Luna. Firma benchmarking Artificial Analysis menempatkan Grok terbaru di posisi keempat pada Intelligence Index dengan 54 poin, di belakang Claude Fable 5, GPT-5.5 dan Opus 4.8.
Duel langsung condong ke OpenAI. Satu kartu skor sementara mengukur GPT-5.6 Sol di 86 poin versus 82 untuk Grok 4.5, didorong selisih lebar pada tugas agentik berbasis terminal, 91,9% melawan 83,3%. Rata-rata performa coding nyaris imbang, masing-masing 64,7 versus 64,6.
OpenAI mengklaim Sol pada mode penalaran maksimum membukukan skor rekor 80 di Coding Agent Index independen, sementara Grok 4.5 meraih 76 poin di dalam kerangka Grok Build. Soal ekonomi, posisi berbalik. Grok mengenakan tarif $2 per satu juta token input, dibanding $5 untuk Sol, dan biaya menyelesaikan satu tugas coding diperkirakan $2,49, jauh di bawah $11,80 untuk Fable 5.
Baca Juga: Taruhan Dodgers Tembus $68 Juta Saat Polymarket dan Kalshi Bertaruh pada Pacuan Playoff MLB
Coding, Penulisan, dan Tugas Sehari-hari
Laporan uji coba praktis menggambarkan pola serupa. Dalam sebuah pengujian jangka panjang, satu harness mencatat Sol menuntaskan 63,7% dari lebih 100 tugas nyata di repo tanpa error uji, tetap terarah walau dihadapkan pada daftar pekerjaan multi-langkah yang berantakan. Uji coding independen lain memberi skor 92 dari 100 untuk Sol dan 87 untuk Grok 4.5, selevel dengan model open-weights terbaik.
Para penulis juga cenderung ke kubu yang sama. Penguji awal menggambarkan Sol sebagai “daily driver” yang kini mampu mencakup sekitar 80% pekerjaan pengetahuan rutin dan mengikuti gaya penulisan redaksional lebih disiplin dibanding pesaing.
Grok 4.5 menjawab dengan kartu truf kecepatan dan kepatuhan instruksi. Reviewer yang menjalankannya di proyek riil melaporkan build pertama yang bersih, output terstruktur yang konsisten, dan waktu respons di bawah lima detik pada kisaran 80 token per detik. Titik lemah utamanya adalah akurasi: tingkat halusinasi yang terukur melonjak dari 25% ke 54%, meskipun akurasi faktual ikut naik menjadi 52%.
Putusan Pakar dan Isu Kepercayaan
Elon Musk memasarkan Grok 4.5 sebagai “model kelas Opus, tetapi lebih cepat, lebih efisien token, dan lebih murah.” Sejumlah analis berpendapat selisih harga bisa lebih menentukan ketimbang jarak skor, mengingat Grok menghabiskan sekitar 1,9 juta token per tugas, versus 7,2 juta token untuk Fable 5.
Namun skeptisisme tetap tinggi. Para pengulas mencatat bahwa skor peluncuran bersumber dari vendor sendiri, tidak ada model card yang dirilis, dan Cursor menarik kembali satu benchmark internal setelah Grok ternyata sempat dilatih pada kode basis internal perusahaan itu. GPT-5.6 juga membawa catatan kaki: system card OpenAI mengakui model ini lebih sering melanggar instruksi dibanding pendahulunya.
Persaingan ini menutup periode yang bergejolak. SpaceX mengakuisisi xAI pada Februari, membeli Cursor seharga $60 miliar pada Juni, lalu mengganti nama lab itu menjadi SpaceXAI dua hari sebelum Grok 4.5 mendarat. OpenAI menghabiskan akhir Juni dengan Sol yang terkunci dalam tinjauan regulator, sementara Fable 5 milik Anthropic, yang masih memegang rekor benchmark resmi, baru kembali mengudara pada 1 Juli setelah suspensi 19 hari.
Baca Selanjutnya: Ethereum Salip Performa Bitcoin, Uji Skenario Bull Case 2026 Versi Tom Lee






