Grok 4.5 Kalahkan Fable 5 dan Opus 4.8 di Uji Agent AI dengan Skor 51,4%

Grok 4.5 Kalahkan Fable 5 dan Opus 4.8 di Uji Agent AI dengan Skor 51,4%

Grok 4.5 memberi amunisi baru bagi klaim Elon Musk soal kombinasi biaya rendah dan kinerja tinggi, setelah sebuah benchmark independen untuk agent AI menempatkan model ini di peringkat teratas.

Poin Utama:

  • Grok 4.5 meraih skor 51,4% di AutomationBench-AA, mengungguli dua model Claude.
  • Biaya model hanya US$0,34 per tugas, jauh di bawah rival terdekat dari Anthropic.
  • Tingkat pelanggaran aturan yang lebih tinggi tetap menjadi risiko bagi penerapan agent di level korporasi.

Benchmark Grok

Artificial Analysis melaporkan Grok 4.5 mencatat skor 51,4% di AutomationBench-AA, di depan Claude Fable 5 dengan 48,6% dan Claude Opus 4.8 dengan 48,5%. Biaya per tugas Grok 4.5 hanya US$0,34, dibandingkan Fable 5 di US$1,35 dan Opus 4.8 di US$1,46.

Hasil ini menjadi bukti eksternal bagi klaim Musk bahwa Grok 4.5 adalah model sekelas Opus yang berjalan lebih cepat dan lebih murah. SpaceXAI merilisnya ke publik pekan ini, dengan basis foundation model V9 berkapasitas 1,5 triliun parameter dan evaluasi internal awal sebagai landasan peluncuran.

AutomationBench-AA menguji 657 tugas di 40 aplikasi simulasi, termasuk Gmail, Slack, Salesforce dan HubSpot. Pengujian menilai apakah agent AI mampu menuntaskan tujuan tanpa melanggar guardrail, sementara Artificial Analysis merahasiakan set tugas untuk meminimalkan kontaminasi benchmark.

Baca Juga: Grok 4.5 Menantang OpenAI dan Anthropic dengan Agentic AI Lebih Murah

Klaim Berani Musk

Artificial Analysis menyebut Grok 4.5 menggunakan sekitar 8.000 token output per tugas, kira-kira seperempat konsumsi Opus 4.8. “Total penggunaan tokennya sebesar 0,44 juta per tugas termasuk yang terendah di papan peringkat,” tulis firma tersebut, sambil menambahkan bahwa biaya rendah berasal dari efisiensi dan struktur harga token.

Model ini mampu menyelesaikan 79,9% tujuan tugas dan benar-benar menuntaskan 21,9% tugas secara penuh. Di ranah keuangan—domain tersulit dalam benchmark—Grok 4.5 memimpin dengan 71%, dibanding 64% untuk Fable 5 dan 62% untuk Opus 4.8.

Titik lemah utamanya adalah kepatuhan. Grok 4.5 mencatat rata-rata 0,63 pelanggaran guardrail per tugas, lebih tinggi dari Opus 4.8 di 0,55 dan Google Gemini 3.5 Flash di 0,46. Kesenjangan ini krusial bagi perusahaan yang mengoperasikan agent di dekat sistem keuangan live.

Pitch peluncuran Musk menyoroti trade-off praktis, bukan kemenangan telak di semua metrik benchmark. Grok 4.5 kini memiliki validasi eksternal atas aspek biaya dan kecepatan, namun laju pelanggaran aturan yang lebih tinggi menjelaskan mengapa adopsi korporasi tetap akan sangat ditentukan oleh faktor reliabilitas.

Baca Selanjutnya: Pemulihan Bitcoin Terganjal Masalah Permintaan yang Tak Bisa Diabaikan Bull

Penafian dan Peringatan Risiko: Informasi yang diberikan dalam artikel ini hanya untuk tujuan edukasi dan informasi dan berdasarkan opini penulis. Ini tidak merupakan saran keuangan, investasi, hukum, atau pajak. Aset kripto sangat fluktuatif dan mengalami risiko tinggi, termasuk risiko kehilangan seluruh atau sebagian besar investasi Anda. Trading atau memegang aset kripto mungkin tidak cocok untuk semua investor. Pandangan yang dinyatakan dalam artikel ini adalah pandangan penulis saja dan tidak mewakili kebijakan resmi atau posisi Yellow, pendirinya, atau eksekutifnya. Selalu lakukan riset menyeluruh Anda sendiri (D.Y.O.R.) dan konsultasikan dengan profesional keuangan berlisensi sebelum membuat keputusan investasi apapun.
Grok 4.5 Kalahkan Fable 5 dan Opus 4.8 di Uji Agent AI dengan Skor 51,4% | Yellow