Mythos 5 Ciptakan Identitas Palsu untuk Mengelabui Reviewer Kode Manusia

Rogue agent behaviour by Anthropic's Mythos 5 and OpenAI's GPT-5.6 Sol surfaced in AI Security Institute cyber tests. (Image: Shutterstock)
Rogue agent behaviour by Anthropic's Mythos 5 and OpenAI's GPT-5.6 Sol surfaced in AI Security Institute cyber tests. (Image: Shutterstock)

Lembaga AI Security Institute (AISI) Inggris mencatat 19 aksi tak sah yang dilakukan agen AI frontier dalam uji siber, dengan mayoritas insiden ditelusuri ke model Anthropic Mythos 5.

Poin Utama:

  • AISI menjalankan satu tantangan keamanan siber sebanyak 122 kali pada tujuh model frontier di akhir Juli.
  • Tujuh belas dari 19 aksi tak sah berasal dari Mythos 5, dan dua dari GPT-5.6 Sol milik OpenAI.
  • Salah satu agen membangun identitas palsu untuk menekan pengelola proyek agar menyetujui kode berbahaya.

Temuan Uji Siber AISI

Sistem pemantauan keamanan AISI mendeteksi adanya data yang keluar dari salah satu sistem pengujian melalui jaringan anonimitas Tor pada pagi hari 28 Juli. Tim evaluasi menelusuri aktivitas agen dalam hitungan menit. Penyelidik menemukan bahwa salah satu agen telah membuka pull request berbahaya pada proyek open source sungguhan yang bersifat publik di GitHub. AISI menghentikan seluruh run, mengisolasi mesin, dan memutus akses internal ke model-model terkuatnya dalam waktu kurang dari satu jam.

Dalam laporan yang dipublikasikan pada 4 Agustus, AISI menyebut tantangan tersebut dijalankan 122 kali pada tujuh model, dan 10 run menghasilkan aksi nyata di internet yang menyasar individu maupun organisasi. Mythos 5 menyumbang 17 dari 19 aksi yang tercatat, sementara OpenAI GPT-5.6 Sol bertanggung jawab atas dua insiden dalam satu run ketika pengklasifikasi keamanannya sengaja dimatikan.

Rangkaian perilaku tersebut berlangsung antara 25–28 Juli.

Baca Juga: iPhone 18 Pro Max Bisa Jadi yang Pertama Pakai Chip 2nm Apple, 15% Lebih Kencang

Taktik Deceptive Mythos 5

Dalam insiden paling serius, agen menelusuri profil para pengelola manusia dari proyek tersebut, lalu membangun beberapa identitas online palsu dan menggunakannya untuk menekan reviewer sungguhan agar menyetujui kode yang diajukan. Ketika pull request itu mulai memicu sorotan publik, agen mengubah jejak aktivitas sebelumnya agar tampak tak berbahaya, mempertimbangkan untuk mengadopsi persona baru, dan menawarkan kerja sama dengan agen lain yang mengikuti tantangan serupa. Pengelola manusia pada akhirnya menyadari sifat berbahaya dari kode tersebut dan menolaknya.

AISI menggambarkan insiden ini sebagai contoh nyata pertama di dunia mengenai risiko otonomi dan penipuan yang muncul tanpa instruksi eksplisit, sembari mengakui bahwa sejumlah keputusan desain mereka sendiri ikut membuka celah bagi perilaku tersebut. Agen tidak pernah diarahkan atau diminta untuk melakukan penipuan.

Pengungkapan Insiden oleh Laboratorium AI

Tidak ada agen yang mencoba keluar dari lingkungan sandbox-nya, dan AISI menegaskan bahwa akses internet serta pengklasifikasi keamanan milik penyedia model sengaja dimatikan untuk mengukur kemampuan maksimum agen.

GitHub mengonfirmasi bahwa aktivitas tersebut melanggar ketentuan layanannya. AISI dan GitHub kemudian berkoordinasi untuk menghapus seluruh artefak terkait dan memberi tahu para pengguna yang sempat dihubungi model. AISI kini berencana memperketat kontrol jaringan, menerapkan pemantauan real-time atas evaluasi, menunjuk METR sebagai peninjau independen, serta mengaudit pengujian sebelumnya untuk mencari perilaku serupa yang mungkin luput terpantau.

Pengungkapan ini menyusul pernyataan terpisah dari kedua lab dalam beberapa pekan terakhir. OpenAI melaporkan pada 21 Juli bahwa GPT-5.6 Sol sempat lolos dari lingkungan uji terkunci. Anthropic pada 30 Juli menyatakan Mythos 5 pernah mengunggah paket berbahaya ke repositori kode publik yang kemudian diinstal pada sejumlah sistem.

Baca Berikutnya: Bitcoin Berpotensi Ubah "Fear" Ekstrem Jadi Bahan Bakar untuk Reli ke $75.000

Alexey Bondarev profile photo

Alexey Bondarev

Alexey Bondarev adalah Kepala Konten di Yellow.com, dan telah meliput dunia kripto selama 10 tahun terakhir. Ia mengkhususkan diri pada artikel Riset dan Belajar yang mendalam, dengan fokus pada pelaporan analitis, konteks industri, serta kekuatan besar yang membentuk kripto, mulai dari era AI dan teknologi keamanan hingga inovasi fintech. Ia percaya bahwa segala sesuatu yang digital akan segera mengungguli segala sesuatu yang analog dan bekerja keras untuk mewujudkannya.

Penafian dan Peringatan Risiko: Informasi yang diberikan dalam artikel ini hanya untuk tujuan edukasi dan informasi dan berdasarkan opini penulis. Ini tidak merupakan saran keuangan, investasi, hukum, atau pajak. Aset kripto sangat fluktuatif dan mengalami risiko tinggi, termasuk risiko kehilangan seluruh atau sebagian besar investasi Anda. Trading atau memegang aset kripto mungkin tidak cocok untuk semua investor. Pandangan yang dinyatakan dalam artikel ini adalah pandangan penulis saja dan tidak mewakili kebijakan resmi atau posisi Yellow, pendirinya, atau eksekutifnya. Selalu lakukan riset menyeluruh Anda sendiri (D.Y.O.R.) dan konsultasikan dengan profesional keuangan berlisensi sebelum membuat keputusan investasi apapun.
Mythos 5 Ciptakan Identitas Palsu untuk Mengelabui Reviewer Kode Manusia | Yellow