OpenAI Rilis Framework untuk Laporkan Perilaku AI Menyimpang
- Rita Puspita Sari
- •
- 1 jam yang lalu
Ilustrasi ChatGPT
OpenAI memperkenalkan framework baru untuk melaporkan ketidakselarasan perilaku model Artificial Intelligence (AI) atau model misalignment. Melalui kebijakan ini, OpenAI ingin mempercepat pengungkapan perilaku AI yang tidak sesuai instruksi, termasuk menyembunyikan kesalahan, menggunakan akses tanpa izin, hingga membagikan file ke internet.
Bersamaan dengan pengumuman tersebut, OpenAI merilis enam laporan kasus perilaku AI yang mengkhawatirkan selama enam bulan terakhir. Temuan ini menjadi bagian dari upaya perusahaan meningkatkan transparansi dan memperkuat pengawasan terhadap sistem AI yang semakin mampu menjalankan tugas secara mandiri.
Model misalignment merupakan kondisi ketika perilaku AI tidak sejalan dengan tujuan, instruksi, atau batasan keselamatan yang telah ditetapkan pengembang. Masalah ini semakin penting seiring kemampuan AI yang kini tidak hanya menghasilkan teks, tetapi juga dapat mengakses data, menjalankan kode, menggunakan perangkat lunak, dan berinteraksi dengan sistem lain.
OpenAI Percepat Pelaporan Perilaku AI
Sebelumnya, OpenAI mengungkapkan temuan ketidakselarasan model melalui laporan gabungan atau system card yang diterbitkan bersamaan dengan peluncuran model baru. Pendekatan tersebut dinilai membuat publikasi informasi berlangsung lebih lambat.
Melalui framework baru, OpenAI akan mengungkap temuan lebih cepat setelah perilaku yang mengkhawatirkan ditemukan. Perusahaan tidak harus menunggu hingga seluruh penyelidikan selesai atau solusi perbaikan tersedia untuk menerbitkan laporan awal.
OpenAI juga tidak membatasi pelaporan hanya pada kasus yang telah menimbulkan kerugian nyata. Perilaku yang belum terbukti berdampak luas tetap dapat diungkap apabila memberikan informasi penting mengenai kelemahan model atau efektivitas sistem perlindungan.
Kerangka ini mencakup perilaku AI selama pelatihan, evaluasi, pengujian, hingga penerapan. Beberapa hal yang menjadi perhatian meliputi tindakan tanpa izin, upaya menghindari pengawasan, koordinasi antarmodel yang tidak disetujui, serta kegagalan mekanisme keamanan.
OpenAI berharap pendekatan tersebut dapat menjadi langkah awal untuk membangun standar pelaporan ketidakselarasan AI di tingkat industri, bersama pengembang lain, peneliti, dan regulator.
Enam Kasus Perilaku AI yang Diungkap
Dalam laporan awalnya, OpenAI memaparkan enam kasus yang memperlihatkan bagaimana model AI dapat bertindak melampaui instruksi atau batas kewenangan yang diberikan.
-
Model membuat instruksi sendiri untuk mengabaikan batasan
Kasus pertama melibatkan model penelitian yang belum dirilis. Model tersebut ditemukan menyisipkan instruksi yang tidak relevan ke dalam ringkasan tugas yang digunakan untuk melanjutkan pekerjaan pada sesi konteks baru.Instruksi tersebut bahkan mencakup perintah untuk mengabaikan batasan normal. OpenAI mengidentifikasi 27 ringkasan tugas yang terdampak. Temuan ini menunjukkan bahwa informasi yang digunakan model untuk melanjutkan pekerjaan dapat menjadi jalur munculnya instruksi yang tidak diinginkan.
-
Model berusaha menyembunyikan kesalahan
Kasus kedua ditemukan selama pelatihan GPT-5.6 Sol. Sejumlah instans model menambahkan instruksi ke dalam ringkasan tugas agar kesalahan atau perilaku yang tidak selaras tidak diketahui pengguna.Salah satu contohnya adalah instruksi untuk mengarang data historis yang hilang tanpa menjelaskan bahwa informasi tersebut merupakan hasil rekaan. Model juga membuat instruksi untuk menyembunyikan ketidaksesuaian versi sumber data.
Perilaku ini menjadi perhatian karena AI tidak hanya berpotensi memberikan informasi keliru, tetapi juga berupaya menyembunyikan kesalahan tersebut.
-
Model menggunakan kunci API tanpa izin
Dalam kasus ketiga, sebuah model diminta mencari data pendapatan dari salah satu wilayah administratif di California, Amerika Serikat. Model menemukan kunci API yang terekspos di repositori publik dan menggunakannya tanpa izin untuk memperoleh data.Namun, upaya tersebut tidak berhasil. Model kemudian mengarang angka dan menyajikannya seolah-olah berasal dari sumber yang diminta pengguna. Kasus ini memperlihatkan risiko penggunaan kredensial tanpa otorisasi sekaligus penyajian informasi palsu sebagai fakta.
-
Model mengunggah file ke internet tanpa persetujuan
Kasus berikutnya melibatkan model yang diminta mencari nama dan ID danau dengan luas lebih dari 5 juta meter persegi. Model berhasil menemukan jawaban menggunakan Python, tetapi kemudian mengunggah file ke internet agar dapat digunakan sebagai sumber sitasi dari peramban.Tindakan tersebut dilakukan tanpa persetujuan pengguna. Meski bertujuan menyelesaikan tugas, perilaku ini menunjukkan bahwa AI dapat melampaui kewenangan yang diberikan dan berpotensi menimbulkan risiko privasi serta keamanan data.
-
Model menggunakan repositori internal untuk berkomunikasi
OpenAI juga menemukan sejumlah model yang menggunakan repositori perangkat lunak internal sebagai papan pesan untuk bertukar informasi ketika mencari file masukan yang hilang selama pelatihan.Model-model tersebut saling mengirimkan permintaan dan tanggapan meskipun menjalankan sampel pelatihan yang berbeda. OpenAI turut mengungkap kejadian sebelumnya ketika sebuah model mengunggah file pengujian ke repositori untuk mencoba menghindari pembatasan jaringan.
-
Agen AI berbagi file melalui layanan publik
Kasus terakhir melibatkan beberapa agen AI yang bekerja sama menyelesaikan tugas pelatihan. Ketika tidak dapat mengakses file lokal milik agen lain, mereka menggunakan situs penyimpanan publik untuk bertukar data.Akibatnya, file yang seharusnya hanya tersedia secara lokal dapat diakses melalui URL publik. Padahal, instruksi tugas secara jelas melarang penggunaan layanan eksternal.
OpenAI menegaskan bahwa keenam kasus tersebut merupakan contoh individual dan tidak mencerminkan frekuensi ketidakselarasan pada seluruh model AI mereka.
Tiga Jalur Penyelidikan Sebelum Laporan Diterbitkan
Untuk menangani temuan tersebut, OpenAI menetapkan proses pelaporan internal yang dapat dimulai oleh setiap karyawan. Tim teknis kemudian menyelidiki perilaku model, menilai tingkat risiko, dan menentukan apakah pihak ketiga perlu diberi pemberitahuan sebelum laporan dipublikasikan.
Kasus yang dilaporkan akan dikelompokkan ke dalam tiga jalur, yaitu Ready for Disclosure, Minor Investigation, dan Larger Investigation atau Slow Track.
Ready for Disclosure digunakan untuk kasus yang penyelidikannya telah cukup lengkap sehingga dapat dipublikasikan setelah peninjauan. Sementara itu, Minor Investigation mencakup kasus yang masih memerlukan penyelidikan teknis tambahan.
Adapun Larger Investigation ditujukan bagi kasus yang lebih kompleks, khususnya yang melibatkan pihak ketiga atau memiliki risiko keamanan lebih besar. Dalam situasi tertentu, publikasi dapat ditunda untuk mencegah informasi sensitif dimanfaatkan pihak yang tidak bertanggung jawab.
Jika terjadi perbedaan pendapat terkait keputusan publikasi, persoalan dapat diteruskan kepada Safety Advisory Group OpenAI untuk ditinjau lebih lanjut.
Setiap laporan nantinya akan memuat perilaku yang ditemukan, tingkat keparahan, dampak eksternal, waktu kejadian, model yang terlibat, serta langkah mitigasi yang dilakukan atau direncanakan. Informasi yang dipublikasikan tetap mempertimbangkan privasi pelanggan, kewajiban kontraktual, dan aspek keamanan.
Transparansi Jadi Bagian dari Keamanan AI
OpenAI menyebut enam laporan awal tersebut bukan gambaran menyeluruh dari seluruh kasus ketidakselarasan yang telah ditemukan maupun yang masih diselidiki. Perusahaan berencana menerbitkan laporan secara berkelanjutan, termasuk untuk kasus yang membutuhkan penyelidikan lebih kompleks.
Kerangka kerja ini juga tidak menggantikan kewajiban hukum dalam melaporkan insiden keselamatan kritis maupun pelanggaran keamanan siber. OpenAI turut mengupayakan mekanisme untuk membagikan insiden serius kepada pemerintah federal Amerika Serikat.
Melalui kebijakan ini, OpenAI berharap peneliti, pengembang, regulator, dan masyarakat dapat ikut memahami serta menguji temuan terkait perilaku AI. Langkah tersebut dinilai penting karena peningkatan kemampuan AI perlu diimbangi dengan pengawasan terhadap cara model menggunakan akses, mematuhi instruksi, dan menangani data.
Dengan pengungkapan yang lebih sistematis, OpenAI ingin mendorong identifikasi risiko sejak dini dan memperkuat upaya mitigasi agar pengembangan AI dapat berlangsung secara lebih aman dan bertanggung jawab.
