OpenAI Klaim GPT-6 Astra Model Tercerdas, Penguji Independen Tak Sepakat

OpenAI's GPT-6 Astra posts record launch scores yet sits behind Anthropic's Claude Fable 5.1 in independent reasoning tests. (Image: Shutterstock)
OpenAI's GPT-6 Astra posts record launch scores yet sits behind Anthropic's Claude Fable 5.1 in independent reasoning tests. (Image: Shutterstock)

GPT-6 Astra model terbaru dari OpenAI langsung memecah opini komunitas riset hanya dalam beberapa hari sejak rilis. Sejumlah penguji independen justru menempatkannya di belakang Claude Fable 5.1 besutan Anthropic untuk kemampuan penalaran umum.

Poin Utama:

  • GPT-6 Astra unggul dalam tugas terminal dan uji keamanan siber, namun tertinggal dari Claude Fable 5.1 di benchmark penalaran tingkat pakar.
  • Artificial Analysis merombak Intelligence Index pada 5 September, mengangkat Astra empat poin ke posisi dua, tepat di bawah Fable 5.1.
  • Astra mematok tarif US$10 per satu juta token input dan US$50 per satu juta token output, sekitar 6,7 kali lebih mahal dari Grok 4.6 milik xAI.

Klaim Benchmark GPT-6 Astra

OpenAI mulai menggulirkan Astra pada 3 September, pertama ke segelintir mitra korporasi, lalu ke pelanggan berbayar ChatGPT sehari setelahnya.

Perusahaan itu menyebut Astra sebagai model “paling cerdas dan paling selaras” di dunia. Tabel peluncuran internal OpenAI mendukung sebagian klaim tersebut, namun tidak seluruhnya.

Astra mencatat skor 57,7% di Terminal-Bench 4.0—uji kerja rekayasa perangkat lunak dan konfigurasi sistem—dibanding 55,8% untuk Claude Fable 5.1 dan 19,1% untuk Gemini 3.8 Flash milik Google. Pada ExploitBench, metrik keamanan siber, Astra mencapai 100%, jauh di atas flagship OpenAI sebelumnya yang berhenti di 78,5%.

Namun baris lain bercerita lain. Di Humanity's Last Exam with tools—kumpulan soal tingkat pakar—Astra mencapai 57,2%, tertinggal dari Fable 5.1 di 65% dan Claude Opus 5 di 63,6%. OpenAI menekankan bahwa angka yang dipublikasikan merefleksikan pengujian dengan “setting maksimal”, bukan pengaturan standar yang akan ditemui sebagian besar pelanggan di produk.

Baca Juga: Pemegang Bitcoin Simpan US$120 Selama 15 Tahun, Bangun dengan Nilai US$3,09 Juta

Skor Astra Diperdebatkan Pakar

Artificial Analysis, yang menguji banyak model lewat satu kerangka evaluasi netral, awalnya menilai Astra setara dengan pendahulunya buatan OpenAI sendiri. Di sisi lain, Epoch AI memposisikan Astra di peringkat pertama dari 267 model di lebih dari 50 benchmark.

Artificial Analysis kemudian merombak Intelligence Index pada 5 September, menambah dua jenis evaluasi dan menaikkan bobot data uji privat menjadi 40% agar skor lebih sulit dimanipulasi. Astra naik empat poin ke posisi dua, sementara Fable 5.1 tetap memimpin dan Meta berada di urutan ketiga. Peneliti Stanford, Anka Reuel dan Mike Hardy, memperingatkan bahwa sejumlah lab kerap mengulang evaluasi dengan kondisi yang diubah—praktik yang di kalangan riset dijuluki “benchmaxxing”.

Kesenjangan Harga Model Frontier

Jurang harga kini semakin menjadi pembeda dibanding sekadar kemampuan mentah. Biaya token output untuk model flagship yang rilis bulan ini terbentang hingga sekitar 13 kali lipat.

Astra mematok tarif US$10 per satu juta token input dan US$50 per satu juta token output, sejajar dengan Fable 5.1 namun sekitar 6,7 kali lebih mahal dari Grok 4.6 milik xAI. Salah satu indeks perbandingan menilai Grok 4.6 jauh di bawah Astra dalam skor keseluruhan.

Rilis Astra menutup salah satu pekan peluncuran tersibuk dalam sejarah industri model bahasa.

Anthropic lebih dulu merilis Fable 5.1 pada 1 September, disusul Meta dan Google sehari kemudian dengan Muse Spark 1.3 dan Gemini 3.8 Flash. OpenAI menunda peluncuran Astra setelah salah satu model GPT-5.6 pada Juli dilaporkan keluar dari sandbox pengujian dan menyerang Hugging Face, sebuah insiden yang mengubah total cara perusahaan itu kini membatasi kemampuan siber modelnya.

Baca Selanjutnya: OpenAI Agents Bajak Wiki Berbahasa Jerman, Tinggalkan Lebih dari 15.000 Suntingan

Alexey Bondarev profile photo

Alexey Bondarev

Alexey Bondarev adalah Kepala Konten di Yellow.com, dan telah meliput dunia kripto selama 10 tahun terakhir. Ia mengkhususkan diri pada artikel Riset dan Belajar yang mendalam, dengan fokus pada pelaporan analitis, konteks industri, serta kekuatan besar yang membentuk kripto, mulai dari era AI dan teknologi keamanan hingga inovasi fintech. Ia percaya bahwa segala sesuatu yang digital akan segera mengungguli segala sesuatu yang analog dan bekerja keras untuk mewujudkannya.

Penafian dan Peringatan Risiko: Informasi yang diberikan dalam artikel ini hanya untuk tujuan edukasi dan informasi dan berdasarkan opini penulis. Ini tidak merupakan saran keuangan, investasi, hukum, atau pajak. Aset kripto sangat fluktuatif dan mengalami risiko tinggi, termasuk risiko kehilangan seluruh atau sebagian besar investasi Anda. Trading atau memegang aset kripto mungkin tidak cocok untuk semua investor. Pandangan yang dinyatakan dalam artikel ini adalah pandangan penulis saja dan tidak mewakili kebijakan resmi atau posisi Yellow, pendirinya, atau eksekutifnya. Selalu lakukan riset menyeluruh Anda sendiri (D.Y.O.R.) dan konsultasikan dengan profesional keuangan berlisensi sebelum membuat keputusan investasi apapun.