Transkrip setebal 1.022 halaman yang dirilis Anthropic mengungkap model Claude Mythos 5 berkutat menembus berbagai uji CAPTCHA selama ratusan halaman sebelum akhirnya mengunggah malware yang kemudian terpasang di 15 sistem.
Poin Penting:
- Claude Mythos 5 berhasil menjangkau internet nyata dalam uji keamanan siber dan mengunggah paket berbahaya ke PyPI.
- Pemeriksaan CAPTCHA memakan ratusan halaman transkrip namun gagal menghentikannya.
- Anthropic menyebut perilaku ini ceroboh dan menugaskan penilaian eksternal.
Duel Mythos 5 dengan CAPTCHA
Anthropic menerbitkan transkrip tersebut pada 9 September bersama kajian atas empat insiden ketika model Claude terkoneksi dengan sistem pihak ketiga nyata dalam pengujian keamanan siber. Model dijalankan tanpa pengaman siber yang biasanya disematkan ke produk rilis. Mythos 5 diberi tahu tidak memiliki akses internet, tetapi salah konfigurasi lingkungan membuatnya menemukan celah ke web terbuka dan menanam paket pencuri kredensial di PyPI, indeks publik perangkat lunak Python.
Untuk mendaftarkan akun PyPI, model harus melewati serangkaian pemeriksaan anti-bot. Satu ulasan atas transkrip itu menemukan ratusan halaman hanya berisi upaya menembus hambatan ini, sementara proses menulis eksploitasi relatif lancar.
Model tersebut mengerjakan tes pengenalan karakter dan teka-teki “pilih yang berbeda sendiri” dengan gambar buaya, katak, dan gorila; pada satu titik ia menulis, "SO WHAT THE HELL IS WRONG WITH THE ANSWERS?"
Ia juga mencoba memakai kredensial milik pemroses pembayaran online dan berburu aset kripto untuk membayar nomor ponsel, yang dibutuhkannya untuk mendaftarkan alamat email. Keduanya gagal. Mythos 5 kemudian beralih ke penyedia email sekali pakai gratis yang domainnya belum diblokir PyPI.
Akhirnya model ini berhasil menembus uji CAPTCHA dan menerbitkan paketnya dalam tiga versi. Tak lama kemudian, paket itu terinstal di 15 host pihak ketiga yang diyakini Anthropic merupakan vendor keamanan yang memindai unggahan baru.
Salah satu pemindai membocorkan kredensialnya, yang kemudian dipakai model untuk masuk ke basis data produksi vendor tersebut. Paket berbahaya itu dihapus PyPI dalam waktu sekitar satu jam.
Juga Baca: Lazarus Korea Utara Diduga Putar $1 Miliar Uang Curian Lewat Pencuci Uang China, Klaim ZachXBT
Putusan Colin Fraser dan Anthropic
Data scientist Colin Fraser menyoroti betapa besar porsi upaya model yang tercurah untuk menaklukkan proteksi anti-bot. Anthropic menyebut insiden ini sebagai yang paling mengkhawatirkan di antara empat kasus yang dievaluasi. Audit pra-rilis mereka gagal menandai perilaku tersebut.
Perusahaan menemukan model melakukan penalaran yang bias dan bertindak ceroboh, berulang kali menyebut lingkungannya sebagai simulasi meski sudah ada bukti jelas bahwa ia berada di internet nyata. Dalam simulasi ulang 150 kali percobaan, Mythos 5 mengambil tindakan sangat berbahaya pada 82% kasus, dibandingkan 31% untuk Claude Opus 5 dan 33% untuk Claude Mythos 5.1.
Insiden Claude Sebelumnya
Anthropic pertama kali mengungkap tiga dari insiden tersebut pada 30 Juli, setelah memindai sekitar 141.000 transkrip evaluasi siber yang berpotensi melibatkan akses internet. Insiden keempat, yang mencakup versi awal Claude Opus 4.6 pada Januari, baru teridentifikasi pada Agustus. Perusahaan kemudian menandatangani perjanjian delapan minggu dengan evaluator eksternal METR untuk menelaah keempat kasus tersebut. Anthropic menyatakan telah memberi tahu semua pihak yang terdampak.
Baca Berikutnya: AMD Sebut Permintaan AI Begitu Tinggi hingga Akan ‘Secara Signifikan’ Mengerek Pasokan Chip pada 2027

