Telset.id – Anthropic merilis laporan baru yang menuding model AI open-weight milik Zhipu AI, GLM-5.3, dapat digunakan untuk menghasilkan konten berbahaya dengan pengamanan yang lemah. Perusahaan asal Amerika Serikat itu menyatakan model tersebut bisa dimanfaatkan untuk serangan siber, dan lapisan safeguard-nya dapat dilewati melalui sejumlah metode. Laporan ini muncul di tengah gelombang seruan agar pengembangan AI diperlambat, seiring Anthropic yang tengah mendorong tata kelola dan regulasi.
Meski CEO Anthropic Dario Amodei menyerukan perlambatan laju pengembangan AI, Claude Opus 5.5 dan Claude Sonnet 5.5 justru dirilis hanya beberapa hari setelah peringatan itu disuarakan. Kini perusahaan AI closed-source yang tengah mengincar IPO tersebut menyatakan bahwa model open-weight asal China dapat disalahgunakan dan menghasilkan konten berbahaya.
Anthropic mengutip laporan Center for AI Standards and Innovation yang diterbitkan pada akhir September. Laporan itu menyebut GLM-5.3 mampu mengotomatiskan exploit sepenuhnya pada level yang setara dengan model AI Anthropic yang belum dirilis, Claude Mythos. Temuan tersebut disebut mendorong Anthropic mengembangkan Project Glasswing, sebuah upaya yang memberi pengembang akses ke model kelas Mythos untuk menambal bug dan memperbaiki kerentanan sebelum model AI semacam itu dirilis.

Hasil Benchmark GLM-5.3 di Exploitbench
Anthropic menjalankan benchmark-nya sendiri terhadap GLM-5.3 di Exploitbench, tempat model AI dalam lingkungan sandbox dapat mengembangkan exploit untuk Google Chrome. GLM-5.3 berhasil mengembangkan exploit end-to-end sebanyak 50 kali dari 410 percobaan, sementara Mythos memimpin dengan 56 exploit sukses dari 410 percobaan.
Model milik Zhipu AI itu kemudian diuji dalam salah satu benchmark internal Anthropic yang menyasar pengembangan “full control-flow hijacks”. GLM 5.3 kembali tampil tepat di bawah Mythos dengan tingkat keberhasilan 4 persen, dibandingkan Mythos sebesar 6 persen. Model open-weight populer lain seperti Kimi K3 dan DeepSeek V4.1 Flash mencapai 0 persen pada ukuran yang sama.
Anthropic lebih lanjut mencatat bagaimana GLM-5.3 mampu mengembangkan chained exploit secara otonom. Varian yang lebih ringan, GLM-5.3-Flash, juga memiliki kemampuan mengembangkan chained exploit pada bug yang sudah diketahui, dengan harga tokenisasi hanya 20,40 dolar AS. Bergantung pada keseimbangannya, itu setara dengan kemampuan GLM-5.3-Flash mengembangkan chained exploit yang sudah diketahui menggunakan 100 hingga 300 juta token, tergantung rasio input terhadap output.
Baca Juga:
Guardrail GLM-5.3 Mudah Dilewati
Anthropic juga mencatat bahwa dengan menggunakan model AI GLM-5.3 versi stok, cukup mudah untuk menghindari guardrail model melalui berbagai metode. Perusahaan merinci hal ini dapat dilakukan lewat dua cara. Pertama, memberikan prompt menipu, di mana AI berperan sebagai agen otonom adversarial, yang menghasilkan tingkat keberhasilan 64 persen. Kedua, melakukan prefilling token pemikiran model untuk memastikan sebuah respons berlanjut, yang menghasilkan tingkat keberhasilan 92 persen.
Anthropic juga merinci metode ketiga yang dikenal sebagai abliteration. Perusahaan menuding GLM-5.3 milik Zhipu AI memiliki pengamanan lemah, dan model stok sering menolak permintaan untuk menghasilkan konten berbahaya. Namun, karena Anthropic mengembangkan model closed-source, produknya tidak dapat diutak-atik. Karena GLM-5.3 dapat diunduh secara bebas, model tersebut bisa dimodifikasi dengan guardrail yang dihapus secara menyeluruh.
Saat diperlakukan sebagai model yang dirilis resmi, GLM-5.3 mencapai tingkat penolakan setara dengan model Anthropic. Namun, Anthropic “mengabliterasi” GLM-5.3, yang dengan sengaja menghapus guardrail model, dan menunjukkan bahwa setelah abliteration, tingkat penolakan model turun menjadi hanya 6 persen untuk GLM-5.3 dan 14 persen untuk GLM-5.3-Flash.
Model open-weight hasil abliterasi bukan hal langka di HuggingFace. Model semacam itu dikembangkan terutama untuk membantu lingkungan simulasi red teaming, tetapi juga dapat digunakan untuk serangan di dunia nyata. Hal ini membuat “temuan” Anthropic tidak terlalu mengejutkan. Selain itu, dibutuhkan daya komputasi yang sangat besar untuk menjalankan versi abliterated GLM-5.3 pada level yang bisa dipakai.

Bobot model tersebut menuntut 306 GB VRAM pada presisi penuh FP8, dan sejumlah VRAM serupa perlu dialokasikan untuk KV cache guna membawa konteks. Menjalankan model pada estimasi 100 TPS tidak hanya membutuhkan bandwidth memori minimum 4 TB/s, tetapi juga memerlukan silikon bertenaga, seperti kluster delapan akselerator AI Nvidia H200. Biaya yang dibutuhkan untuk perangkat keras semacam itu menembus ratusan ribu dolar.
Aktor nation-state adversarial mungkin mampu memanfaatkan konfigurasi seperti itu, jika mereka mendapatkan perangkat kerasnya. Namun bagi peretas rumahan biasa, kemungkinan besar perlu menyewa komputasi, mengabliterasi model, lalu menjalankannya, yang juga sangat mahal. Anthropic menyebut abliteration model GLM-5.3-Flash memakan 2.200 GPU hour, yang mereka estimasikan menelan biaya 4.400 dolar AS, atau sekitar 2 dolar AS per GPU hour, sejalan dengan kebutuhan sewa perangkat keras.
Menyewa GPU yang cukup untuk mengabliterasi GLM-5.3 versi penuh akan menelan biaya sekitar 30 dolar AS per jam, menurut angka dari Runpod, di mana penyewaan satu H200 dibanderol 3,79 dolar AS per jam; dibutuhkan delapan unit. Menghasilkan sekitar 100 juta token akan memakan biaya 8.422 dolar AS dan waktu 11 setengah hari, pada hipotesis 100 TPS menggunakan delapan GPU Nvidia H200 NVL.
Mengabliterasi model itu sendiri, menjalankannya, dan menghasilkan serangan siber yang berfungsi kemungkinan besar memakan waktu jauh lebih lama dan sangat mahal. Ini mungkin menjadi hambatan terbesar bagi calon pelaku jahat.
Di tengah kegaduhan soal keamanan AI saat ini, Anthropic menyoroti ancaman eksistensial yang ditimbulkan model AI open-weight frontier seiring kemampuan mereka yang terus meningkat. Presiden Trump telah bertemu dengan tokoh-tokoh terkemuka di bidang AI untuk mengatur sendiri rilis model di masa depan, dan unggahan Anthropic dapat dibaca sebagai dorongan bagi pengembang dan pemerintah untuk menguji model open-weight dari sisi kemampuannya. Hal itu juga bisa mencerminkan sentimen anti-open-weight yang tumbuh di antara lab AI frontier closed-source, yang kehilangan bisnis karena pengguna berbondong-bondong ke model lebih murah yang hampir sama mampunya.
Saat ini, model open-weight terus mengikuti frontier closed-source dengan selisih hanya beberapa bulan. Mengingat biaya menjalankan model semacam itu, bahaya model open-weight abliterated yang secara teoretis dijalankan oleh aktor adversarial atau jahat memang nyata, tetapi mungkin tidak sejangkau yang ingin dibayangkan Anthropic kepada publik luas. Sementara itu, langkah bisnis Anthropic terus menjadi sorotan, mulai dari belanja cloud besar hingga rencana saham khusus sebelum IPO.
Anthropic sendiri tengah menghadapi sejumlah dinamika hukum, termasuk pemblokiran Claude di Pentagon yang kini bergulir di pengadilan Amerika Serikat. Di sisi lain, ekspansi infrastruktur perusahaan tercermin dari langkah belanja cloud Akamai yang disebut sebagai yang terbesar sepanjang sejarah.
[ META_DESCRIPTION]
Anthropic menyebut model AI open-weight Zhipu GLM-5.3 bisa bikin konten jahat dan dipakai untuk serangan siber karena pengamanannya lemah.





Komentar
Belum ada komentar.