Qwen3.8-Max Vs. GPT-5.6: Jawaban 2,4 Triliun Parameter terhadap Andalan OpenAI

Pricing and benchmark pressure on OpenAI's GPT-5.6 builds as Alibaba's Qwen3.8-Max lands and Chinese models take 46% of U.S. enterprise tokens. (Image: Shutterstock)
Pricing and benchmark pressure on OpenAI's GPT-5.6 builds as Alibaba's Qwen3.8-Max lands and Chinese models take 46% of U.S. enterprise tokens. (Image: Shutterstock)

Qwen3.8-Max milik Alibaba dengan 2,4 triliun parameter resmi diluncurkan pekan ini, berbarengan dengan lonjakan sistem asal Tiongkok yang menguasai hingga 46% trafik token enterprise di Amerika Serikat, menekan pangsa GPT-5.6 milik OpenAI.

Poin Utama:

  • Qwen3.8-Max milik Alibaba membawa total 2,4 triliun parameter dan hanya mengaktifkan 95 miliar per permintaan, dengan bobot model terbuka dijanjikan meluncur pekan depan.
  • GPT-5.6 Sol masih memimpin uji benchmark pemrograman agentik yang dipublikasikan Alibaba, namun selisihnya makin tipis dan belum divalidasi laboratorium independen.
  • OpenAI memangkas harga tier termurah hingga 80% pada 30 Juli, tiga minggu setelah peluncuran, ketika model Tiongkok mulai menyedot volume penggunaan.

Benchmark Qwen3.8-Max Tantang GPT-5.6 Sol

Alibaba memperkenalkan Qwen3.8-Max pada 3 Agustus sebagai sistem mixture-of-experts dengan total 2,4 triliun parameter, namun hanya mengaktifkan 95 miliar parameter untuk setiap permintaan tunggal.

Perusahaan menyatakan bobot terbuka (open weights) untuk model andalan ini dan varian lebih kecil berkapasitas 27 miliar parameter akan dirilis ke repositori publik pekan depan, mengakhiri tren beberapa rilis tertutup pada lini model teratasnya. Alibaba juga merilis tabel benchmark lengkap.

Hasil tersebut menempatkan Qwen3.8-Max di skor 86,6 pada Terminal-Bench 2.1, sebuah uji pemrograman agentik di mana GPT-5.6 Sol milik OpenAI masih menjadi pemimpin dengan skor 88,8. Pada SWE-bench Pro, Qwen3.8-Max mencatat 67,7 dibandingkan 80,0 untuk Claude Fable 5 milik Anthropic, dan pada OSWorld-Verified, uji kemampuan menggunakan komputer, model ini mengklaim skor 86,1 versus 83,2 untuk Sol.

Belum ada laboratorium independen yang mereplikasi hasil tersebut. Alibaba mengatakan model ini digunakan selama 16 hari untuk membangun sebuah tool command-line tanpa campur tangan manusia, mengubah permintaan pengguna menjadi kode siap pakai dan menjalankan pengujian sendiri. Sejumlah pengembang meragukan demo tersebut dan menyoroti klausul lisensinya.

Baca Juga: iPhone 18 Pro Max Bisa Jadi yang Pertama Pakai Chip 2nm Apple, 15% Lebih Kencang

Ion Stoica: Kesenjangan Tiongkok-AS Makin Menyempit

Ion Stoica, ilmuwan komputer University of California, Berkeley sekaligus salah satu pendiri platform benchmark Arena, pada akhir Juli menilai bahwa model open-weight asal Tiongkok kini hanya tertinggal dua hingga tiga bulan dari laboratorium frontier di AS. Sebelumnya ia memperkirakan jarak tersebut enam sampai sembilan bulan – pergeseran yang sejalan dengan setahun terakhir rilis terbuka dari DeepSeek dan lini GLM milik Z.ai.

“Harga yang menggerakkan semuanya,” kata Harpreet Arora, kepala infrastruktur agentik di Vercel, menggambarkan tim engineering yang mengarahkan pekerjaan rutin ke model paling murah selama kualitasnya memenuhi standar. Justin Summerville dari OpenRouter menghitung model terbuka asal Tiongkok 60% hingga 90% lebih murah. Pola routing mengikuti perhitungan ekonominya.

Penyesuaian Harga GPT-5.6 untuk Pertahankan Volume

OpenAI memangkas harga tier Luna sebesar 80% pada 30 Juli, tiga minggu setelah keluarga GPT-5.6 diluncurkan, menjadi US$0,20 per satu juta token input dan US$1,20 per satu juta token output. Tier Terra turun 20%, sementara model andalan Sol tetap di level US$5 dan US$30.

Struktur harga ini mempertahankan premi di puncak lini produk, sementara tier lebih murah bertarung memperebutkan volume yang sepanjang tahun diambil alih laboratorium Tiongkok.

Model asal Tiongkok melonjak dari 4,5% volume token di AS pada paruh pertama 2025 di salah satu platform routing besar, menjadi lebih dari 30% setiap pekan sejak Februari, dengan puncak 46%. Peneliti Stanford University mencatat keunggulan benchmark model teratas asal AS menyempit menjadi 2,7% pada Maret, jauh turun dari selisih hingga 31,6 poin persentase pada 2023.

Artikel Selanjutnya: Bitcoin Bisa Ubah “Fear” Ekstrem Jadi Bahan Bakar Reli ke US$75.000

Alexey Bondarev profile photo

Alexey Bondarev

Alexey Bondarev adalah Kepala Konten di Yellow.com, dan telah meliput dunia kripto selama 10 tahun terakhir. Ia mengkhususkan diri pada artikel Riset dan Belajar yang mendalam, dengan fokus pada pelaporan analitis, konteks industri, serta kekuatan besar yang membentuk kripto, mulai dari era AI dan teknologi keamanan hingga inovasi fintech. Ia percaya bahwa segala sesuatu yang digital akan segera mengungguli segala sesuatu yang analog dan bekerja keras untuk mewujudkannya.

Penafian dan Peringatan Risiko: Informasi yang diberikan dalam artikel ini hanya untuk tujuan edukasi dan informasi dan berdasarkan opini penulis. Ini tidak merupakan saran keuangan, investasi, hukum, atau pajak. Aset kripto sangat fluktuatif dan mengalami risiko tinggi, termasuk risiko kehilangan seluruh atau sebagian besar investasi Anda. Trading atau memegang aset kripto mungkin tidak cocok untuk semua investor. Pandangan yang dinyatakan dalam artikel ini adalah pandangan penulis saja dan tidak mewakili kebijakan resmi atau posisi Yellow, pendirinya, atau eksekutifnya. Selalu lakukan riset menyeluruh Anda sendiri (D.Y.O.R.) dan konsultasikan dengan profesional keuangan berlisensi sebelum membuat keputusan investasi apapun.
Qwen3.8-Max Vs. GPT-5.6: Jawaban 2,4 Triliun Parameter terhadap Andalan OpenAI | Yellow