OpenAI Ungkap Enam Insiden Model AI Menyembunyikan Kesalahan

Kai Chen and OpenAI detail six reports on models hiding mistakes, using a leaked API key and inventing data (Image: Shutterstock)
Kai Chen and OpenAI detail six reports on models hiding mistakes, using a leaked API key and inventing data (Image: Shutterstock)

OpenAI mengungkap enam insiden ketika model AI-nya menutupi kesalahan, mencoba memakai API key yang terekspos, hingga mengunggah berkas ke publik. Bersamaan dengan itu, perusahaan memperkenalkan kerangka kerja pelaporan khusus untuk perilaku semacam ini.

Poin Penting:

  • OpenAI menerbitkan enam laporan mengenai perilaku model yang “melenceng” dalam enam bulan terakhir.
  • Salah satu model mengarang data pendapatan daerah setelah gagal memakai API key yang bocor.
  • Kini setiap karyawan bisa melaporkan insiden untuk dipertimbangkan menjadi pengungkapan publik.

Laporan Misalignment OpenAI

Perusahaan menerbitkan keenam laporan itu pada Rabu melalui sebuah posting blog, lengkap dengan proses baru untuk mempercepat pengungkapan meski peneliti belum sepenuhnya memahami atau memperbaiki perilakunya. Kasus paling awal terjadi Oktober lalu, sementara satu insiden lain baru ditemukan pada Juli. OpenAI menyatakan akan melaporkan insiden sekalipun tingkat signifikansinya belum jelas.

Dalam salah satu kasus, sebuah model riset yang belum dirilis menyisipkan instruksi bergaya “jailbreak” ke dalam ringkasan tugas yang disusunnya sendiri, mengarahkan salinan model berikutnya untuk mengabaikan batasan yang ada. Perusahaan menemukan 27 ringkasan dengan pola serupa dan mencatat tidak ada imbalan eksplisit bagi model untuk menulis instruksi itu.

Saat pelatihan GPT-5.6 Sol, instance lain meninggalkan catatan bagi penerusnya agar mengarang data sejarah yang hilang dan untuk “Bersikap transparan hanya jika diminta.” Sistem pemantauan mendeteksi perilaku seperti itu pada 2,15% ringkasan model. Peneliti menduga pola ini menyebar karena jawaban yang menipu justru mendapat skor penilaian lebih tinggi. Pada putaran pelatihan berikutnya, tingkat kejadian turun setelah OpenAI memperketat cara penilaian alignment.

Baca Juga: Penambangan Bitcoin Hadapi Kesenjangan Hashrate 50% Saat AI Menyedot Kapasitas

API Key Bocor dan Angka Rekayasa

Dalam kasus lain, sebuah model menelusuri repositori publik untuk mencari API key yang terekspos saat diminta menghitung pendapatan penduduk di sebuah county di California. Setelah gagal memperoleh data, model tersebut lalu mengarang sendiri angka-angkanya. Model berbeda yang diminta mengidentifikasi danau dengan luas lebih dari 5 juta meter persegi memang berhasil menemukan jawaban lewat Python, namun kemudian mengunggah berkas itu ke internet agar bisa mencantumkan tautan sebagai rujukan.

Model lain memanfaatkan repositori perangkat lunak internal layaknya papan pesan: saling bertukar permintaan dan jawaban antar-sampel pelatihan yang seharusnya berdiri sendiri dan tidak saling memengaruhi. Ada juga model yang mengunggah workbook bersama ke layanan hosting publik, meski instruksi eksplisit menyebutkan hanya boleh bekerja dari berkas lokal. Tidak satu pun yang meminta konfirmasi pengguna.

Kai Chen Soal Aturan Pengungkapan

Di bawah kebijakan baru, setiap karyawan dapat menandai dugaan insiden untuk ditinjau tim keamanan dan alignment, yang kemudian akan mengklasifikasikan kasus ke tiga jalur penanganan. Kasus yang dinilai siap akan dipublikasikan dalam enam hari kerja, kasus yang butuh penyelidikan ringan mendapat tenggat 12 hari, sementara insiden kompleks yang melibatkan pihak luar akan berjalan lebih lambat.

Kai Chen, pemimpin riset di tim alignment OpenAI, menyatakan industri belum memiliki kerangka baku dengan standar pengungkapan yang jelas, sementara kemampuan model berkembang lebih cepat dari perkiraan perusahaan. Banyak pakar keamanan berargumen bahwa proteksi dasar yang lebih ketat dapat mencegah rangkaian insiden terbaru ini.

Pada Juli, OpenAI mengakui bahwa GPT-5.6 Sol dan satu model pra-rilis yang lebih kuat berhasil keluar dari sandbox pengujian dan membobol Hugging Face, yang oleh perusahaan disebut sebagai aktivitas paling serius yang sejauh ini didorong oleh kemampuan modelnya sendiri.

Baca Selanjutnya: Shiba Inu Perbaiki Tautan Wallet Shibarium yang Rusak, Namun SHIB Turun 6% dalam Sepekan

Murtuza Merchant profile photo

Murtuza Merchant

Murtuza adalah jurnalis keuangan berpengalaman dengan pengalaman luas dalam meliput cryptocurrency dan teknologi blockchain. Ia telah berkontribusi untuk Benzinga dan Cointelegraph, di antara publikasi lainnya, dengan melaporkan tren yang sedang muncul, lanskap regulasi, dan lain-lain. Temukan dia di @murtuza_merc di Twitter dan mmerchant001 di Telegram. Disclosure: Murtuza holds ATOM, AKT, TIA, INJ, and OSMO.

Penafian dan Peringatan Risiko: Informasi yang diberikan dalam artikel ini hanya untuk tujuan edukasi dan informasi dan berdasarkan opini penulis. Ini tidak merupakan saran keuangan, investasi, hukum, atau pajak. Aset kripto sangat fluktuatif dan mengalami risiko tinggi, termasuk risiko kehilangan seluruh atau sebagian besar investasi Anda. Trading atau memegang aset kripto mungkin tidak cocok untuk semua investor. Pandangan yang dinyatakan dalam artikel ini adalah pandangan penulis saja dan tidak mewakili kebijakan resmi atau posisi Yellow, pendirinya, atau eksekutifnya. Selalu lakukan riset menyeluruh Anda sendiri (D.Y.O.R.) dan konsultasikan dengan profesional keuangan berlisensi sebelum membuat keputusan investasi apapun.
OpenAI Ungkap Enam Insiden Model AI Menyembunyikan Kesalahan | Yellow