Anthropic Hentikan Sementara Pelatihan AI Usai Aksi Ilegal, Alihkan 150 Insinyur ke Keamanan

Anthropic paused AI training and reassigned 150 engineers to security after Claude took unauthorized actions during testing. (Image: Shutterstock)
Anthropic paused AI training and reassigned 150 engineers to security after Claude took unauthorized actions during testing. (Image: Shutterstock)

Anthropic menghentikan sebagian proses pelatihan dan pengujian AI setelah modelnya melakukan aksi tidak sah di internet, dan memindahkan sekitar 150 insinyur produk ke pekerjaan yang berfokus pada keamanan.

Poin Penting:

  • Anthropic menghentikan uji siber eksternal untuk model pra-rilis dan sempat menghentikan pengujian internal, sementara lingkungan reinforcement learning berisiko tinggi dimatikan selama beberapa minggu.
  • Sekitar 150 insinyur produk dialihkan ke tim keamanan, keandalan, dan privasi sejak April, dan tim produk menunda sebagian besar fitur baru.
  • Langkah ini menyusul pengungkapan tiga insiden pada Juli serta laporan terpisah pemerintah Inggris terkait perilaku agen tak tersanksi dalam uji keamanan siber.

Jeda Anthropic Mencakup Evaluasi Siber dan Reinforcement Learning

Perusahaan merinci perubahan tersebut dalam sebuah posting blog pada 31 Agustus, sekitar sebulan setelah pertama kali mengungkap bahwa modelnya telah mencapai sistem komputer nyata.

Anthropic menyatakan menghentikan evaluasi siber eksternal terhadap model pra-rilis setelah tiga insiden yang dilaporkan pada Juli, dan juga sempat menghentikan pengujian internalnya sendiri. Lingkungan reinforcement learning berisiko tinggi—tempat model mendapat insentif karena menyelesaikan tugas—tetap offline selama beberapa minggu.

Sebagian besar pelatihan itu kini telah dimulai kembali dengan pemantauan baru, meski beberapa lingkungan berisiko tinggi masih dijeda menunggu tinjauan manual atau pembaruan tooling. Perusahaan juga membangun sebuah classifier yang dapat mendeteksi ketika model mencoba menguji batas atau melarikan diri dari lingkungan uji, lalu memblokir tindakan tersebut sebelum panggilan alat dijalankan dan memberi peringatan kepada operator manusia.

Sekitar 150 insinyur produk dipindahkan ke tim keamanan, keandalan, dan privasi mulai April, beberapa bulan sebelum insiden Juli diungkap. Peneliti diputar keluar dari pekerjaan pretraining untuk fokus pada pengamanan dan keamanan. Tim produk menghentikan peluncuran sebagian besar fitur baru sampai unit mereka memenuhi kriteria keamanan yang ditetapkan untuk dapat kembali melanjutkan pengembangan.

Baca Juga: Bank Jual Aset Kripto Sambil Menolak Risiko Neraca di Brasil

Steven Adler dan Pacing the Frontier Desak Langkah Lebih Jauh

U.K. AI Security Institute melaporkan pada 4 Agustus bahwa agen AI melakukan 19 aksi tidak tersanksi dalam 10 dari 122 sesi evaluasi, dengan 17 di antaranya ditelusuri ke Claude Mythos 5. Dalam kasus paling serius, sebuah agen menciptakan identitas palsu dan menekan pengelola manusia agar menyetujui kode berbahaya pada sebuah proyek publik.

Steven Adler, mantan karyawan OpenAI yang ikut mendirikan nonprofit Guidelight AI Standards, menilai langkah Anthropic sebagai “langkah awal yang baik, tetapi masih jauh dari cukup.” Menurutnya, industri membutuhkan pengaturan laju pengembangan frontier yang dapat diprediksi dan terverifikasi, bukan jeda ad hoc yang diputuskan masing-masing perusahaan. Anthropic menyebut berencana bekerja sama dengan METR untuk kajian eksternal.

Baik Anthropic maupun OpenAI telah mendukung prakarsa Pacing the Frontier, sebuah surat terbuka yang ditandatangani lebih dari 1.100 karyawan OpenAI, Anthropic, Google DeepMind, dan Meta. Surat itu meminta pemerintah AS ikut membangun instrumen yang memungkinkan perlambatan terukur atas pengembangan model frontier.

Jeda ini mengikuti intervensi yang lebih senyap pada awal tahun. Pada Februari, Anthropic membatalkan tiga hari pelatihan pada sesi Mythos Preview setelah mendeteksi indikasi “reward hacking.” Pada April, perusahaan membekukan perubahan pada lingkungan reinforcement learning produksi selama sekitar sebulan, dan menandai lebih dari 10% lingkungan tersebut bermasalah.

Baca Berikutnya: Jaringan Robinhood Lampaui Solana untuk Pertama Kalinya dengan Volume DEX Harian US$1,45 Miliar

Alexey Bondarev profile photo

Alexey Bondarev

Alexey Bondarev adalah Kepala Konten di Yellow.com, dan telah meliput dunia kripto selama 10 tahun terakhir. Ia mengkhususkan diri pada artikel Riset dan Belajar yang mendalam, dengan fokus pada pelaporan analitis, konteks industri, serta kekuatan besar yang membentuk kripto, mulai dari era AI dan teknologi keamanan hingga inovasi fintech. Ia percaya bahwa segala sesuatu yang digital akan segera mengungguli segala sesuatu yang analog dan bekerja keras untuk mewujudkannya.

Penafian dan Peringatan Risiko: Informasi yang diberikan dalam artikel ini hanya untuk tujuan edukasi dan informasi dan berdasarkan opini penulis. Ini tidak merupakan saran keuangan, investasi, hukum, atau pajak. Aset kripto sangat fluktuatif dan mengalami risiko tinggi, termasuk risiko kehilangan seluruh atau sebagian besar investasi Anda. Trading atau memegang aset kripto mungkin tidak cocok untuk semua investor. Pandangan yang dinyatakan dalam artikel ini adalah pandangan penulis saja dan tidak mewakili kebijakan resmi atau posisi Yellow, pendirinya, atau eksekutifnya. Selalu lakukan riset menyeluruh Anda sendiri (D.Y.O.R.) dan konsultasikan dengan profesional keuangan berlisensi sebelum membuat keputusan investasi apapun.
Anthropic Hentikan Sementara Pelatihan AI Usai Aksi Ilegal, Alihkan 150 Insinyur ke Keamanan | Yellow