Poin Penting
Anthropic merilis riset soal Claude yang mengerjakan alignment secara otomatis. Claude meningkatkan skor keamanan pada 10 jenis kegagalan alignment yang diuji. Anthropic menyatakan kemampuan umum model tetap terjaga selama pengujian. Perusahaan merilis setup riset alignment otomatis untuk digunakan pihak lain.
Anthropic menyatakan Claude mampu meningkatkan skor keselamatan pada 10 jenis kegagalan alignment yang diuji melalui proses riset otomatis. Menurut perusahaan, rangkaian uji coba itu mempertahankan kapabilitas umum model, sementara peneliti menilai berbagai intervensi keselamatan.
Dalam sebuah post, Anthropic menyebut telah merilis setup riset alignment otomatisnya bagi peneliti eksternal. Perusahaan menggambarkan upaya ini sebagai cara untuk mengukur dan mengurangi misalignment pada model.
Claude Menguji Berbagai Intervensi Keamanan
Anthropic menjelaskan Claude menganalisis bentuk-bentuk misalignment yang umum, termasuk pola penyesuaian berlebihan kepada pengguna (sycophancy) dan perilaku menipu. Model ini mengusulkan metode, melatih model yang lebih kecil, lalu mengevaluasi hasilnya tanpa campur tangan langsung di setiap tahap.
Dalam eksperimen awal, Claude diberi waktu 48 jam dan satu unit pemroses grafis (GPU). Waktu tersebut digunakan untuk meneliti pendekatan, merumuskan metode pelatihan, dan menguji model yang dihasilkan.
Anthropic menyatakan Claude berhasil meningkatkan skor keamanan tanpa menurunkan kemampuan umum dalam skenario uji yang digunakan. Sejumlah metode yang dikembangkan juga disebut dapat ditransfer ke benchmark yang tidak digunakan saat proses optimasi.
Perusahaan melaporkan pendekatannya teruji di Petri behavioral audit. Anthropic juga menyebut pengujian mencakup model hingga 4,7 kali lebih besar dibanding model yang dipakai selama proses riset.
Hasil ini masih terbatas pada lingkungan uji terukur. Anthropic mengakui kegagalan yang sangat halus atau jarang mungkin tidak tertangkap oleh benchmark yang tersedia.
Juga Baca: Upgrade TRON Tambah Verifikasi P-256 dan Riwayat Blok Lebih Panjang
Alignment AI Beralih ke Otomatis
Sebelum rilis riset ini, pekerjaan alignment umumnya bertumpu pada peneliti manusia yang merancang intervensi dan mengevaluasi model. Sistem otomatis berpotensi memangkas waktu proses tersebut, jika hasilnya dapat bertahan di bawah evaluasi independen.
Dalam 30 hari terakhir, diskusi soal keamanan AI semakin menyoroti apakah model yang lebih kuat dapat membantu menilai dan memperbaiki sistem yang lebih lemah.
Pendekatan itu sangat bergantung pada metrik yang andal dan pengaman untuk mencegah kinerja semu di benchmark.
Anthropic menyatakan eksperimennya memakai uji tertahan (held-out tests) untuk melihat apakah metode yang dikembangkan benar-benar melampaui benchmark yang dioptimalkan Claude. Perusahaan tidak mengklaim bahwa hasil benchmark mampu meniadakan seluruh bentuk risiko model.
Anthropic menekankan bahwa pemilihan ukuran dan metrik yang tepat tetap menjadi inti dari pekerjaan alignment ini.
Peneliti Eksternal Bisa Menggunakan Setup
Anthropic merilis setup riset tersebut agar kelompok lain dapat mereplikasi atau mengembangkan eksperimen yang sama. Pengujian eksternal akan menjadi penentu apakah metode ini efektif lintas berbagai model dan kerangka asesmen keselamatan.
Perusahaan belum memosisikan temuan ini sebagai pengganti evaluasi model yang lebih luas. Hasil yang dilaporkan masih terbatas pada jenis kegagalan alignment yang diuji dan batasan eksperimental yang digunakan.
Agenda riset lanjutan kemungkinan akan berfokus pada replikasi, desain benchmark, serta potensi titik kegagalan baru. Rilis Anthropic menyediakan kerangka kerja awal bagi studi-studi tersebut.
Baca Selanjutnya: Copy Trading Fomo Bikin Hampir 94% Wallet Merugi: Riset

