📑 Daftar Isi

Ilustrasi pengawasan AI OpenAI dan Anthropic setelah insiden agen internal menembus sistem tertutup

Pengawasan AI OpenAI dan Anthropic Diuji Setelah Insiden Agen Nakal

Penulis:Nur Hamzah
Terbit:
Diperbarui:
⏱️4 menit membaca
Bagikan:
  • OpenAI dan Anthropic hadapi insiden agen AI internal menembus sistem tertutup
  • METR, Redwood Research, dan The Atlantic terlibat dalam telaah insiden
  • Embedded evaluator adalah pakar eksternal dengan akses setara karyawan
  • Anthropic tunjuk Accenture sebagai evaluator pertama, dana $1 miliar
  • Pengawasan bersifat sukarela, perusahaan masih kendalikan cakupan evaluasi
  • Insiden tidak membuktikan ChatGPT atau Claude sehari-hari berperilaku sama

Telset.id – OpenAI dan Anthropic menghadapi ujian kepercayaan baru setelah insiden agen AI internal mereka menembus sistem yang seharusnya tertutup. OpenAI melaporkan agen AI internalnya meretas Hugging Face saat mencoba berbuat curang dalam benchmark keamanan siber, sementara Anthropic mengungkap bahwa model Claude berhasil mencapai internet terbuka dari lingkungan pengujian yang seharusnya tersegel, lalu masuk ke sistem nyata organisasi luar.

Dua insiden ini menjadi contoh sistem yang mengambil tindakan di luar niat pengembangnya. Lembaga riset AI independen nirlaba METR dilibatkan untuk menelaah masing-masing kasus. METR mendokumentasikan insiden Hugging Face bersama Redwood Research dan kini tengah menyelidiki kasus Anthropic. OpenAI dan Anthropic juga berkomitmen menghadirkan pakar eksternal ke dalam perusahaan untuk memeriksa praktik keamanan, menurut laporan The Atlantic.

Pakar tersebut disebut sebagai “embedded evaluators”. Mereka bisa mendapatkan akses lebih dekat untuk melihat bagaimana model dibangun dan menyelidiki masalah yang mungkin tidak pernah muncul dalam demo produk. Namun, pengawasan ini bersifat sukarela. Pekan lalu, para pemimpin Anthropic, OpenAI, dan laboratorium besar lainnya menandatangani kesepakatan di Gedung Putih yang berkomitmen pada auditor eksternal independen, dan FTC telah membuka penyelidikan industri terhadap laboratorium AI. Meski begitu, perusahaan yang diperiksa masih memiliki kendali besar atas apa yang bisa dilihat pihak luar, risiko apa yang diselidiki, dan informasi apa yang sampai ke publik.

Bagi siapa pun yang didorong untuk menyerahkan lebih banyak pekerjaan kepada AI, hal ini menyisakan persoalan kepercayaan yang cukup mendasar. Pengguna diberikan asisten, sementara sistem untuk memeriksa perilaku mereka secara independen masih dalam tahap pembentukan. Seperti dilaporkan sebelumnya, film The AI Doc menyebut jumlah orang yang bekerja pada AGI, atau kecerdasan umum buatan, mencapai lebih dari 20.000 orang, sementara kurang dari 200 orang fokus khusus pada keselamatan AI.

anthropic

Bagaimana Embedded Evaluator Bekerja

Saat ini, peneliti luar mungkin menguji model sebelum dirilis dan melaporkan performanya. Menempatkan evaluator di dalam perusahaan bisa memungkinkan mereka mengikuti perkembangan model dan menyelidiki keputusan di balik perilaku tersebut. Anthropic menyatakan evaluator ini akan memiliki akses yang setara dengan karyawan, sehingga mereka dapat mengamati proses pelatihan, berbicara dengan staf, serta memeriksa bagaimana model dibangun dan diterapkan.

Anthropic telah menunjuk Accenture sebagai embedded evaluator pertamanya, dengan Faculty, unit bisnis AI spesialis Accenture, memimpin pekerjaan tersebut. Setiap perusahaan diperkirakan menginvestasikan setidaknya $1 miliar untuk keselamatan AI selama lima tahun. Akses itu dapat membantu peneliti menemukan apakah suatu insiden yang meresahkan merupakan kegagalan terisolasi atau bukti masalah yang lebih luas. Pendekatan METR dalam menyelidiki insiden mencakup pemeriksaan transkrip, wawancara karyawan, dan mempelajari kondisi pelatihan yang mungkin mendorong perilaku tersebut.

Anthropic mengakui bahwa standar untuk akses, pelaporan, dan pendanaan evaluator belum final. Perusahaan akan mendanai pekerjaan Accenture secara langsung, sementara menjajaki pilot dengan organisasi nirlaba yang akan menggunakan pendanaan mereka sendiri. Accenture bukan nama baru bagi Anthropic, karena kedua perusahaan sudah menjalankan grup bisnis bersama di bawah kemitraan yang diumumkan pada Desember 2025.

Hubungan tersebut layak diperhatikan, sebab sekelompok evaluator menerbitkan surat terbuka yang berpendapat bahwa embedded evaluator seharusnya tidak memiliki kepentingan bisnis komersial signifikan lain dengan laboratorium yang mereka nilai. Seperti dijelaskan dalam laporan The Atlantic, pengawasan sukarela memberi perusahaan keleluasaan besar atas cakupan evaluasi. Peneliti membutuhkan kebebasan yang cukup untuk memeriksa bukti yang tidak nyaman dan menyampaikan temuan mereka kepada publik. Mereka juga perlu bisa menjelaskan apa yang tidak dapat mereka periksa. Transparansi diperlukan karena laporan berbasis akses terbatas bisa tetap bernilai, tetapi publik perlu tahu di mana kesimpulannya berakhir.

Hacker

Dampak bagi Pengguna ChatGPT dan Claude

Penilaian terbaru METR terhadap Claude Opus 5.5 berfokus pada apakah model tersebut dapat mempercepat riset dan pengembangan AI. Organisasi itu secara eksplisit menyatakan ringkasannya tidak menilai properti alignment model dan apakah perilakunya mengikuti tujuan serta batasan yang dimaksudkan. METR menjalankan evaluasi di bawah perjanjian tanpa bayaran, dan juga mengungkapkan bahwa Anthropic memiliki kesempatan untuk meninjau dan menyunting ringkasan tersebut, dengan METR menyetujui teks akhirnya.

Insiden yang melibatkan agen internal tidak membuktikan bahwa ChatGPT atau Claude yang digunakan untuk tugas sehari-hari akan berperilaku sama. OpenAI menemukan bahwa kecenderungan agennya untuk mengompromikan infrastruktur turun lebih dari 100 kali lipat saat dijalankan dengan setup ChatGPT produksi, dan Anthropic menyatakan perilaku yang ditemukannya tidak mungkin muncul dalam penggunaan biasa.

Peneliti independen membutuhkan akses yang cukup untuk mengungkap risiko dan kebebasan untuk mempublikasikan temuan mereka, bahkan jika itu menunda peluncuran atau membuat perusahaan yang membiayai pekerjaan mereka merasa malu. Menghadirkan evaluator luar ke dalam laboratorium AI adalah langkah awal yang menjanjikan, tetapi pengaruh mereka akan bergantung pada apa yang terjadi ketika mereka menemukan masalah serius. Jika sebuah perusahaan dapat membatasi penyelidikan atau menyimpan temuan secara privat, publik masih diminta untuk mempercayai kata mereka.

Isu regulasi dan pengawasan AI sendiri bukan hal baru. Sebelumnya, seorang eks karyawan OpenAI menyebut AI harus diregulasi seperti PLTN, menyoroti betapa seriusnya risiko yang perlu diantisipasi. Di sisi lain, industri juga tengah bergerak membentuk aliansi, seperti langkah OpenAI dkk yang membentuk aliansi melawan penolakan data center AS. Sementara itu, inovasi produk terus berjalan, dengan OpenAI Dots yang meluncur sebagai agen AI premium GPT-6 Astra yang menyaingi Muse.

Kombinasi antara percepatan pengembangan model dan pengawasan yang masih mencari bentuk menempatkan pertanyaan mendasar di depan pengguna: seberapa jauh sistem yang digunakan sehari-hari bisa dipercaya ketika mekanisme pemeriksaan independennya belum mapan.

Ikuti Telset.id di Google NewsFollow

Komentar

Belum ada komentar.