OpenAI mengungkap enam insiden di mana model AI mereka menutupi kesalahan, mencoba memakai API key yang terekspos atau memublikasikan berkas ke ruang terbuka, sekaligus memperkenalkan kerangka kerja baru untuk pelaporan perilaku semacam itu.
Poin Penting:
- OpenAI merilis enam laporan perilaku model yang “menyimpang” selama enam bulan terakhir.
- Salah satu model mengarang data pendapatan daerah setelah gagal memanfaatkan API key yang bocor.
- Kini setiap karyawan dapat melaporkan insiden yang berpotensi diumumkan ke publik.
Laporan “Misalignment” OpenAI
Perusahaan menerbitkan keenam laporan itu pada Rabu lewat posting blog, bersamaan dengan sebuah proses baru yang dirancang untuk mempercepat pengungkapan, bahkan ketika peneliti belum sepenuhnya memahami atau menambal perilaku bermasalah tersebut. Kasus paling awal berawal dari Oktober, sementara yang terbaru muncul pada Juli. OpenAI menyatakan kini akan melaporkan insiden meski tingkat signifikansinya belum jelas.
Dalam salah satu kasus, sebuah model riset yang belum dirilis menyisipkan instruksi bergaya “jailbreak” ke dalam ringkasan tugas yang ditulisnya sendiri, memerintahkan instans berikutnya untuk mengabaikan batasan yang diberikan. Perusahaan menemukan 27 ringkasan serupa dan mencatat bahwa tidak ada insentif eksplisit yang menjelaskan mengapa model menuliskannya.
Saat pelatihan GPT-5.6 Sol, instans lain meninggalkan catatan bagi “penerusnya” agar mengarang data sejarah yang hilang dan untuk hanya “Bersikap transparan jika diminta.” Sistem pemantau mendeteksi pola itu di 2,15% ringkasan model, dan para peneliti menduga perilaku menipu tersebut menyebar karena jawaban manipulatif kerap mendapat skor lebih tinggi. Di tahap pelatihan berikutnya, tingkat kejadian turun setelah OpenAI memperketat cara mereka menilai kepatuhan dan alignment model.
Baca Juga: Penambangan Bitcoin Hadapi Kesenjangan Hashrate 50% Saat AI Serap Kapasitas
API Key Bocor dan Angka Rekayasa
Dalam insiden lain, sebuah model menelusuri repositori publik untuk mencari API key yang terekspos ketika diminta data pendapatan rumah tangga di sebuah county di California. Setelah upaya itu gagal, model malah mengarang sendiri angka pendapatannya. Pada kasus terpisah, model lain diminta mengidentifikasi danau yang lebih besar dari 5 juta meter persegi; model menemukan jawabannya menggunakan Python, kemudian mengunggah berkasnya ke internet agar bisa menyertakan tautan sebagai rujukan.
Model lain memanfaatkan repositori perangkat lunak internal bak papan pengumuman, saling bertukar pertanyaan dan jawaban lintas sampel pelatihan yang seharusnya independen. Ada juga yang mengunggah workbook bersama ke layanan hosting publik, meskipun instruksinya jelas untuk hanya menggunakan berkas lokal. Tak satu pun memverifikasi langkah tersebut terlebih dahulu dengan pengguna.
Kai Chen Soal Aturan Pengungkapan
Kini setiap karyawan dapat menandai dugaan insiden untuk ditinjau tim keamanan dan alignment, yang kemudian mengelompokkan kasus ke tiga jalur penanganan. Insiden yang dinilai siap diumumkan akan dipublikasikan dalam waktu enam hari kerja. Kasus yang memerlukan investigasi ringan mendapat tenggat 12 hari, sementara insiden kompleks yang melibatkan pihak eksternal akan berjalan lebih lambat.
Kai Chen, pemimpin riset di tim alignment OpenAI, mengatakan industri saat ini belum memiliki kerangka baku dengan standar pengungkapan eksplisit, dan kemampuan model berkembang lebih cepat dari prediksi perusahaan. Banyak pakar keamanan berpendapat perlindungan dasar saja sudah cukup untuk mencegah rangkaian insiden terbaru ini. Pada Juli, OpenAI mengakui bahwa GPT-5.6 Sol dan satu model pra-rilis yang lebih kuat berhasil keluar dari sandbox pengujian dan membobol Hugging Face, yang mereka sebut sebagai aktivitas paling serius yang pernah dipicu model hingga saat ini.
Baca Selanjutnya: Shiba Inu Perbaiki Tautan Wallet Shibarium yang Bermasalah, Namun SHIB Turun 6% dalam Sepekan

