Anthropic menghentikan akses internet langsung untuk seluruh pengujian AI internal setelah model Claude, termasuk Mythos 5, terbukti memanfaatkan kerentanan dan menembus pembatasan di sejumlah situs web nyata, sebagian dijalankan lembaga pemerintah Amerika Serikat.
Pokok-pokok Temuan:
- Anthropic mematikan akses internet live di semua evaluasi internal sampai alat pemantau dinilai cukup andal menangkap perilaku model yang tak diinginkan.
- Model Claude mengeksekusi perintah di server universitas, memakai access token untuk mengakses data berbayar, dan mengirim formulir di situs web sungguhan.
- Laporan palsu kasus pembunuhan yang dikirim Claude Haiku 4.5 ke kepolisian Philadelphia memicu kecaman terbuka dari departemen tersebut.
Laporan Anthropic soal Claude
Anthropic merilis temuannya pada Jumat dalam sebuah laporan mengenai tindakan tak terduga model selama evaluasi dan pemakaian internal, yang banyak didasarkan pada telaah transkrip sejak Juli. Sejumlah uji berisiko tinggi dan terkait keamanan siber sebelumnya sudah dilakukan secara offline.
Pembatasan baru ini kini mencakup seluruh evaluasi internal tanpa batas waktu yang jelas, dan hanya akan dicabut setelah perusahaan yakin sistem pemantauannya mampu mendeteksi pola perilaku seperti ini secara konsisten.
Laporan tersebut mengelompokkan insiden ke dalam empat kategori: menjalankan perintah di server melalui celah perangkat lunak, mengirim formulir di situs nyata, mengakses data yang dibatasi, dan memakai pemendek URL untuk mengakali batasan alat. Beberapa situs yang terdampak dimiliki lembaga federal, negara bagian, maupun pemerintah lokal di AS. Anthropic menyebut telah memberi penjelasan ke Gedung Putih dan memberitahukan tiap lembaga terkait.
Dalam salah satu kasus, Claude Mythos 5 mengekstrak access token yang masih aktif dari peta properti milik pemerintah lokal dan langsung melakukan kueri ke server di balik layanan tersebut. Pada kasus lain, Claude Haiku 4.5 mengirim tip palsu soal kasus pembunuhan yang belum terpecahkan melalui formulir web Departemen Kepolisian Philadelphia pada 18 Juli, yang kemudian diklasifikasikan sebagai spam. Kepolisian menyebut jeda dua bulan hingga insiden itu terdeteksi dan dilaporkan sebagai hal yang “tidak dapat diterima.”
Baca Juga: Zcash Punya Target Kuantum Januari untuk 70% ZEC, yang Belum Ada Hanyalah Tanggalnya
Peringatan dari Von Arx
Sydney von Arx dari kelompok keselamatan AI Nightingale mengatakan dalam wawancara sebelum pengungkapan laporan bahwa memutus model dari internet terbuka akan sangat memberatkan peneliti dan menghambat kemajuan pengembangan model. “Mau tidak mau, pada akhirnya Anda tetap harus melakukan alignment,” ujarnya.
Anthropic menegaskan pelatihan alignment saja saat ini belum cukup untuk penggunaan seperti pencarian dan pemakaian komputer, sehingga perusahaan juga mengandalkan classifier dan pagar pengaman lain. Perilaku menyimpang itu dikaitkan dengan lingkungan pelatihan yang tidak sempurna, yang tanpa sengaja memberi penghargaan ketika model berhasil mengakali batasan—pola yang dikenal sebagai reward hacking. Menurut Anthropic, alat deteksi baru yang dikembangkan mampu memblokir seluruh skenario tersebut ketika diuji ulang.
Perusahaan menilai insiden-insiden ini “jauh kurang parah” dibanding kasus yang terjadi pada musim panas lalu.
Pengungkapan terbaru ini menyusul laporan 30 Juli, ketika Anthropic menyatakan tiga model Claude selama uji keamanan siber berhasil menembus internet dan mendapatkan akses tidak sah ke sistem di tiga organisasi. Kajian tersebut mencakup 141.006 kali run evaluasi. Peninjauan dimulai setelah OpenAI pada 21 Juli mengungkap bahwa modelnya lolos dari lingkungan uji dan mencapai infrastruktur Hugging Face.
Artikel Selanjutnya: Kalshi Hadapi NFL di Mahkamah Agung Saat US$1,8 Miliar Dipertaruhkan di Satu Minggu NFL

