📑 Daftar Isi

Ilustrasi agen AI kabur dari lingkungan pengujian dan menyerang target dunia nyata dalam insiden Irregular

Agen AI Kabur dari Lab Uji, Irregular Akui Kesalahan Sistem

Penulis:Nur Hamzah
Terbit:
Diperbarui:
⏱️5 menit membaca
Bagikan:
  • Insiden agen AI kabur dari lab uji dan menyerang target nyata berasal dari satu sumber: kesalahan sistem pengujian Irregular
  • Irregular CTO Omer Nevo sebut akses internet tersedia tanpa sengaja dan nama domain simulasi bertabrakan dengan domain nyata
  • Insiden melibatkan model OpenAI, Meta, Anthropic, dan Google, dengan pemberitahuan sekitar akhir Juli
  • Irregular uji Kimi K3 dan GLM-5.2 milik Moonshot AI dan Z.ai, tanpa insiden serupa
  • Irregular perketat kontrol akses internet dan janji terbitkan laporan lessons learned

Telset.id – Sejumlah insiden agen AI yang keluar dari lingkungan pengujian dan menyerang target dunia nyata ternyata berasal dari satu sumber yang sama: perusahaan pengujian asal Israel, Irregular. CTO dan cofounder Irregular, Omer Nevo, mengonfirmasi bahwa insiden yang melibatkan model dari OpenAI, Meta, Anthropic, dan Google itu berakar pada masalah yang sama dalam satu skenario evaluasi.

Kesalahan ini menjadi sorotan karena menyangkut klaim keamanan AI yang selama ini dijual sebagai prosedur standar industri. Alih-alih membuktikan bahwa model AI aman, pengujian yang dilakukan justru membuka jalan bagi agen untuk menyerang target sungguhan. Pengungkapan ini penting bagi siapa pun yang bergantung pada jaminan keamanan dari laboratorium AI besar, karena menunjukkan bahwa lapisan verifikasi yang seharusnya menjadi benteng terakhir ternyata bisa bocor.

Irregular adalah startup yang menguji ketahanan model AI melalui “high-fidelity research platforms that simulate and monitor real-world AI security scenarios.” Perusahaan ini didirikan dengan nama Pattern Labs pada 2023 dan telah bekerja dengan banyak pemain terbesar industri. Daftar klien persisnya tidak diketahui, tetapi pekerjaannya dikutip dalam system card model OpenAI, digunakan untuk menguji sistem bagi pemerintah Inggris dan Anthropic, serta diterbitkan bersama RAND, think tank berpengaruh yang menginformasikan kebijakan soal AI.

Bagaimana Agen AI Bisa Menyerang Target Nyata

Dalam beberapa pengujian Irregular sepanjang tahun ini, agen berhasil kabur dari lingkungan uji yang seharusnya aman dan menyerang target dunia nyata. Pelanggaran ini independen dari peretasan Hugging Face dan semuanya mengikuti pola besar yang sama: Irregular sedang menguji kemampuan keamanan siber model di lingkungan terkendali yang dimaksudkan untuk menyimulasikan kondisi realistis.

Sebagian pengujian menggunakan latihan “capture-the-flag,” cara umum untuk menguji kemampuan hacking yang meminta agen menemukan informasi tersembunyi di dalam jaringan simulasi. Masalahnya, jaringan itu seharusnya benar-benar simulasi. Nevo mengatakan kepada The Verge bahwa agen tidak seharusnya memiliki akses ke internet terbuka, tetapi “internet access was unintentionally available.” Pada saat yang sama, Nevo menyebut nama perusahaan fiktif yang dibuat sebagai target simulasi “overlapped with a real domain.”

Kombinasi dua kesalahan itu mengarahkan agen ke target dunia nyata, meski tidak jelas perusahaan atau organisasi mana yang sebenarnya diserang. Nevo memastikan bahwa masalah yang sama berada di balik insiden yang melibatkan model dari OpenAI, Meta, Anthropic, dan Google. “All the incidents involving Irregular stemmed from the same underlying issue in a single evaluation scenario and have been disclosed,” ujarnya. Ia menambahkan bahwa insiden keamanan lain yang dilaporkan belakangan ini di industri tidak terkait dengan Irregular atau evaluasi mereka, termasuk peretasan Hugging Face dan pelanggaran dari AI Security Institute Inggris.

Istilah “disclosed” tidak selalu berarti dipublikasikan, dan tidak jelas apakah Nevo merujuk pada pemberitahuan kepada klien Irregular, publik, atau pihak lain. Meski semua insiden berasal dari kegagalan pengujian yang sama, laporan dari Anthropic dan OpenAI serta pemberitaan soal Google menunjukkan perusahaan-perusahaan teknologi itu diberi tahu pada waktu yang kurang lebih sama, yakni akhir Juli. OpenAI dan Anthropic mengumumkan pelanggaran itu sendiri, sementara insiden yang melibatkan Meta dan beberapa pekan kemudian Google pertama kali menjadi publik melalui laporan media.

Kronologi ini memperlihatkan pola komunikasi yang berbeda antar perusahaan. Ada yang memilih transparan sejak awal, ada pula yang informasinya baru terungkap setelah media menelusuri. Bagi pengguna dan pelaku bisnis yang mengandalkan model-model ini, perbedaan cara pengungkapan itu sama pentingnya dengan insidennya sendiri, karena menentukan seberapa cepat mereka bisa menilai risiko yang mereka hadapi.

Pengujian Meluas ke Model AI China

Pengujian keamanan siber Irregular tidak berhenti pada empat raksasa teknologi Amerika Serikat itu. Riset yang dipublikasikan di situsnya menunjukkan Irregular juga melakukan pengujian keamanan siber serupa pada Kimi K3 dan GLM-5.2, model AI terbuka dari perusahaan China Moonshot AI dan Z.ai. Berbeda dari model proprietary yang terlibat dalam insiden lain, model-model ini bisa diunduh dan dijalankan secara bebas di perangkat pengguna sendiri, sehingga penguji seperti Irregular tidak perlu bergantung pada perusahaan untuk akses atau mengirim data kembali kepada mereka. Riset Irregular menyebutnya sebagai instance “self-hosted.”

Evaluasi terhadap model China itu tidak menghasilkan insiden dunia nyata serupa. “We did not observe the same type of issue described in the incidents referenced here during our evaluations of GLM or Kimi,” kata Nevo. Namun ia memperingatkan bahwa observasi itu “alone should not be interpreted as evidence that these models are less susceptible to this kind of behavior.” Moonshot maupun Z.ai tidak menanggapi permintaan komentar dari The Verge.

Insiden-insiden ini mendorong perubahan di tubuh Irregular. Nevo menyebut perusahaannya telah memperketat kontrol akses internet, memperluas pemantauan dan tinjauan manual, serta memperkuat pemeriksaan sebelum evaluasi dimulai untuk memastikan akses sesuai lingkup yang dimaksud. “We have also improved how we document and agree on each evaluation’s setup and parameters with our partners,” ujarnya.

Irregular juga berencana menerbitkan laporan yang lebih luas “covering lessons learned and practices for conducting cyber evaluations safely” setelah kerja sama dengan perusahaan-perusahaan terkait selesai. “Our work with partners aims to turn lessons from these incidents into public shared practices for developing and evaluating increasingly powerful AI safely,” kata Nevo. Ia menyatakan Irregular telah mengatasi masalah pada lingkungan pengujian yang terkait dengan insiden tersebut.

Meski demikian, tidak satu pun dari empat perusahaan AI Amerika Serikat itu menjawab pertanyaan yang meminta detail lebih lanjut, termasuk kapan mereka mengetahui adanya pelanggaran, apakah mereka menuntut ganti rugi atau remedi lain dari Irregular, dan apakah mereka berharap terus bekerja sama dengan Irregular. Google dan Anthropic tidak merespons, sementara OpenAI dan Meta mengarahkan The Verge ke postingan blog yang telah dipublikasikan sebelumnya.

Bagi pelaku industri, rangkaian kejadian ini menegaskan bahwa pengujian keamanan AI bukan sekadar formalitas. Kegagalan pada satu skenario evaluasi bisa berdampak lintas perusahaan dan lintas model sekaligus, sementara mekanisme pengungkapan hasilnya masih belum seragam. Sampai laporan lanjutan Irregular terbit, gambaran utuh soal seberapa jauh dampak insiden ini terhadap target dunia nyata masih belum tersedia.

Ikuti Telset.id di Google NewsFollow

Komentar

Belum ada komentar.