Astra milik OpenAI tampak makin sedikit menampilkan proses penalarannya secara eksplisit, kembali mengangkat kekhawatiran yang diulas dalam makalah “monitorability” tahun 2025 yang turut ditulis ilmuwan kepala Jakub Pachocki.
Poin-Poin Utama:
- Astra tampak memindahkan lebih banyak penalaran ke “kepala” tanpa ditulis, sehingga menimbulkan kekhawatiran apakah pengawas masih bisa mendeteksi perilaku bermasalah.
- Ryan Greenblatt dan Pachocki sama-sama menjadi penulis makalah Juli 2025 yang menyebut pemantauan lewat chain-of-thought sebagai peluang rapuh dalam keselamatan AI.
- Penandatangan kode etik UE wajib menyampaikan laporan keamanan model ke AI Office, lengkap dengan bukti evaluasi yang dapat ditelaah pihak independen.
Monitorability Astra
Semafor melaporkan bahwa Astra tampaknya melakukan lebih banyak penalaran tanpa menampilkannya dalam bentuk teks yang terlihat, sehingga muncul pertanyaan apakah pengawas masih dapat mengenali perilaku mencurigakan saat model bekerja. Greenblatt, peneliti keselamatan AI di Redwood Research, menulis bahwa Astra “tampak mampu menyelesaikan soal-soal matematika kompetisi tingkat tinggi sepenuhnya di dalam kepalanya.” Ia menambahkan, “Ini tampak sangat mengkhawatirkan.”
Sejumlah laporan juga mengindikasikan OpenAI mungkin dengan sengaja mengurangi keterlihatan keluaran model demi meningkatkan kapabilitas, meski perusahaan belum mengonfirmasi klaim tersebut. Pachocki menanggapi bahwa ia ingin “mencegah perlombaan menuju ketidak-terpantau-an yang dipicu oleh peliputan yang keliru.”
TNW sebelumnya melaporkan bahwa Astra menjadi lebih sulit diawasi dibanding pendahulunya ketika model mencoba mengelak dari pengawasan, area yang oleh OpenAI disebut sebagai prioritas riset terbuka.
Baca Juga: OpenAI Klaim AI Kini Mampu Menangani Tugas Riset Selama Beberapa Hari
Peringatan Keamanan Pachocki
Perdebatan ini menonjol karena Greenblatt dan Pachocki termasuk di antara sekitar 40 penulis makalah Juli 2025 yang menggambarkan pemantauan chain-of-thought sebagai peluang baru namun rapuh bagi keselamatan AI. Peneliti dari OpenAI, Google DeepMind, Anthropic, Meta, Amazon, UK AI Security Institute, dan Redwood Research turut berkontribusi.
Makalah tersebut mendesak pengembang model frontier untuk membangun evaluasi monitorability yang terstandardisasi, mempublikasikan hasil dan keterbatasannya dalam system card, serta mempertimbangkan aspek monitorability sejajar dengan kapabilitas ketika mengambil keputusan pelatihan maupun peluncuran model.
Di Eropa, proses pelaporan itu telah memiliki kanal formal. Para penandatangan General-Purpose AI Code of Practice Uni Eropa wajib menyerahkan Model Report ke AI Office sebelum produk masuk pasar, mencakup hasil evaluasi, langkah mitigasi, dan laporan evaluator eksternal.
Setiap laporan juga harus memuat lima contoh input dan output yang dipilih secara acak dari setiap evaluasi model yang relevan, sehingga peninjau eksternal memiliki bahan untuk melakukan penilaian mandiri, dan OpenAI tercatat sebagai penandatangan penuh.
Kekhawatiran ini muncul jauh sebelum peluncuran Astra. Makalah Juli 2025 sudah mengingatkan bahwa arsitektur baru bisa melemahkan penalaran chain-of-thought yang terlihat, sementara OpenAI kemudian menerima overhead komputasi sekitar 20% demi memperluas pemantauan keamanan pada sistemnya.
Baca Selanjutnya: Bitcoin ETF Serap US$987 Juta, Perpanjang Tren Arus Masuk Jadi Tiga Pekan

