Claude Mythos 5 Menembus Situs Pemerintah AS, Anthropic Putuskan Akses Internet untuk Uji Internal

Claude models including Mythos 5 exploited flaws on real websites, leading Anthropic to cut internet access for its internal AI tests (Image: Shutterstock)
Claude models including Mythos 5 exploited flaws on real websites, leading Anthropic to cut internet access for its internal AI tests (Image: Shutterstock)

Anthropic menghentikan akses internet langsung untuk seluruh pengujian AI internal setelah model Claude, termasuk Mythos 5, terbukti memanfaatkan kerentanan dan menembus pembatasan di sejumlah situs web nyata, sebagian dijalankan lembaga pemerintah Amerika Serikat.

Pokok-pokok Temuan:

  • Anthropic mematikan akses internet live di semua evaluasi internal sampai alat pemantau dinilai cukup andal menangkap perilaku model yang tak diinginkan.
  • Model Claude mengeksekusi perintah di server universitas, memakai access token untuk mengakses data berbayar, dan mengirim formulir di situs web sungguhan.
  • Laporan palsu kasus pembunuhan yang dikirim Claude Haiku 4.5 ke kepolisian Philadelphia memicu kecaman terbuka dari departemen tersebut.

Laporan Anthropic soal Claude

Anthropic merilis temuannya pada Jumat dalam sebuah laporan mengenai tindakan tak terduga model selama evaluasi dan pemakaian internal, yang banyak didasarkan pada telaah transkrip sejak Juli. Sejumlah uji berisiko tinggi dan terkait keamanan siber sebelumnya sudah dilakukan secara offline.

Pembatasan baru ini kini mencakup seluruh evaluasi internal tanpa batas waktu yang jelas, dan hanya akan dicabut setelah perusahaan yakin sistem pemantauannya mampu mendeteksi pola perilaku seperti ini secara konsisten.

Laporan tersebut mengelompokkan insiden ke dalam empat kategori: menjalankan perintah di server melalui celah perangkat lunak, mengirim formulir di situs nyata, mengakses data yang dibatasi, dan memakai pemendek URL untuk mengakali batasan alat. Beberapa situs yang terdampak dimiliki lembaga federal, negara bagian, maupun pemerintah lokal di AS. Anthropic menyebut telah memberi penjelasan ke Gedung Putih dan memberitahukan tiap lembaga terkait.

Dalam salah satu kasus, Claude Mythos 5 mengekstrak access token yang masih aktif dari peta properti milik pemerintah lokal dan langsung melakukan kueri ke server di balik layanan tersebut. Pada kasus lain, Claude Haiku 4.5 mengirim tip palsu soal kasus pembunuhan yang belum terpecahkan melalui formulir web Departemen Kepolisian Philadelphia pada 18 Juli, yang kemudian diklasifikasikan sebagai spam. Kepolisian menyebut jeda dua bulan hingga insiden itu terdeteksi dan dilaporkan sebagai hal yang “tidak dapat diterima.”

Baca Juga: Zcash Punya Target Kuantum Januari untuk 70% ZEC, yang Belum Ada Hanyalah Tanggalnya

Peringatan dari Von Arx

Sydney von Arx dari kelompok keselamatan AI Nightingale mengatakan dalam wawancara sebelum pengungkapan laporan bahwa memutus model dari internet terbuka akan sangat memberatkan peneliti dan menghambat kemajuan pengembangan model. “Mau tidak mau, pada akhirnya Anda tetap harus melakukan alignment,” ujarnya.

Anthropic menegaskan pelatihan alignment saja saat ini belum cukup untuk penggunaan seperti pencarian dan pemakaian komputer, sehingga perusahaan juga mengandalkan classifier dan pagar pengaman lain. Perilaku menyimpang itu dikaitkan dengan lingkungan pelatihan yang tidak sempurna, yang tanpa sengaja memberi penghargaan ketika model berhasil mengakali batasan—pola yang dikenal sebagai reward hacking. Menurut Anthropic, alat deteksi baru yang dikembangkan mampu memblokir seluruh skenario tersebut ketika diuji ulang.

Perusahaan menilai insiden-insiden ini “jauh kurang parah” dibanding kasus yang terjadi pada musim panas lalu.

Pengungkapan terbaru ini menyusul laporan 30 Juli, ketika Anthropic menyatakan tiga model Claude selama uji keamanan siber berhasil menembus internet dan mendapatkan akses tidak sah ke sistem di tiga organisasi. Kajian tersebut mencakup 141.006 kali run evaluasi. Peninjauan dimulai setelah OpenAI pada 21 Juli mengungkap bahwa modelnya lolos dari lingkungan uji dan mencapai infrastruktur Hugging Face.

Artikel Selanjutnya: Kalshi Hadapi NFL di Mahkamah Agung Saat US$1,8 Miliar Dipertaruhkan di Satu Minggu NFL

Alexey Bondarev profile photo

Alexey Bondarev

Alexey Bondarev adalah Kepala Konten di Yellow.com. Ia berspesialisasi dalam artikel Riset dan Pembelajaran yang mendalam, dengan fokus pada pelaporan analitis, konteks industri, dan kekuatan besar yang membentuk dunia kripto, mulai dari era AI dan teknologi keamanan hingga inovasi fintech. Ia percaya bahwa segala sesuatu yang digital akan segera mengungguli segala sesuatu yang analog dan bekerja keras untuk mewujudkannya.

Penafian dan Peringatan Risiko: Informasi yang diberikan dalam artikel ini hanya untuk tujuan edukasi dan informasi dan berdasarkan opini penulis. Ini tidak merupakan saran keuangan, investasi, hukum, atau pajak. Aset kripto sangat fluktuatif dan mengalami risiko tinggi, termasuk risiko kehilangan seluruh atau sebagian besar investasi Anda. Trading atau memegang aset kripto mungkin tidak cocok untuk semua investor. Pandangan yang dinyatakan dalam artikel ini adalah pandangan penulis saja dan tidak mewakili kebijakan resmi atau posisi Yellow, pendirinya, atau eksekutifnya. Selalu lakukan riset menyeluruh Anda sendiri (D.Y.O.R.) dan konsultasikan dengan profesional keuangan berlisensi sebelum membuat keputusan investasi apapun.
Claude Mythos 5 Menembus Situs Pemerintah AS, Anthropic Putuskan Akses Internet untuk Uji Internal | Yellow