📑 Daftar Isi

Ilustrasi papan Go dan jaringan neural yang menggambarkan penalaran AI ala AlphaGo

AlphaGo dan Masa Depan AI: Mengapa Mesin Perlu Bernalar

Penulis:Nur Hamzah
Terbit:
Diperbarui:
⏱️5 menit membaca
Bagikan:
  • Thore Graepel meninggalkan Google DeepMind demi pendekatan baru penalaran mesin
  • AlphaGo menang 4-1 atas Lee Sedol pada 2016, dengan langkah 37 yang dinilai kreatif
  • AlphaGo memadukan policy network intuitif dan mesin pencarian bercabang
  • AI modern hanya mengandalkan prediksi token, setara system 1 tanpa deliberasi sejati
  • Tiga kekurangan: tanpa keadaan epistemik, tanpa pemisahan pengetahuan, penalaran disusun setelah fakta
  • Graepel usul sistem berkeadaan epistemik yang bisa diaudit

Telset.id – Mantan anggota tim AlphaGo di DeepMind, Thore Graepel, mengungkap alasan dirinya meninggalkan Google DeepMind. Ia menilai AI saat ini belum memiliki kemampuan penalaran sejati seperti yang ditunjukkan AlphaGo saat mengalahkan Lee Sedol pada 2016. Graepel menyatakan bahwa sistem AI modern perlu dilengkapi kemampuan bernalar yang sesungguhnya agar bisa menghasilkan temuan tepercaya di bidang sains dan medis.

Dalam pertandingan lima gim di Seoul, Maret 2016, langkah ke-37 AlphaGo pada gim kedua tampak seperti kesalahan pemrograman. Langkah itu justru membawa AlphaGo menang dan menutup laga dengan skor 4-1 atas Lee Sedol, salah satu pemain Go profesional terbaik sepanjang masa. “Saya mengira AlphaGo berbasis perhitungan probabilitas dan sekadar mesin,” kata Lee Sedol setelah pertandingan. “Tapi saat melihat langkah ini, saya berubah pikiran. Sungguh, AlphaGo kreatif.”

Keberhasilan itu berbeda dengan Deep Blue yang mengalahkan juara dunia catur Garry Kasparov pada 1997. Deep Blue bekerja dengan melihat enam hingga delapan langkah ke depan per pemain dan mengevaluasi 200 juta posisi catur per detik, memakai aturan yang diprogram manusia. Go jauh lebih kompleks karena nilai sebuah batu bergantung pada bagaimana kelompok dan wilayah yang berjauhan berkembang selama puluhan langkah.

Banyak orang menganggap langkah 37 sebagai kilatan intuisi murni mesin. Graepel menegaskan itu adalah kesalahpahaman. Menurutnya, justru kemampuan penalaran AlphaGo yang membuat pilihan kreatif tersebut, dan kemampuan semacam itu tidak dimiliki AI hari ini.

Dua Sistem di Balik AlphaGo

AlphaGo terdiri dari dua sistem. Pertama, policy network yang dilatih menebak langkah apa yang akan dimainkan pemain manusia kuat. Bagian “intuitif” ini menganggap langkah 37 biasa saja, dengan peluang sekitar satu banding 10.000 dimainkan pemain ahli manusia. Yang membuat AlphaGo memilihnya adalah mesin pencarian yang menimbang konsekuensi masa depan dari langkah yang diusulkan, membangun dan menelusuri pohon permainan dengan ribuan cabang yang mewakili berbagai kemungkinan masa depan.

Teori populer di ilmu perilaku yang dipopulerkan Daniel Kahneman membedakan dua mode berpikir manusia. System 1 bersifat cepat, berbasis insting, dan tanpa usaha; system 2 bersifat lambat, bertahap, dan deliberatif. AlphaGo menawarkan analogi mesin yang mencolok atas pemisahan itu. Jaringannya memasok firasat, sementara mesin pencariannya melakukan deliberasi dengan menguji firasat terhadap langkah dan balasan berikutnya.

Pendekatan itu berbeda jauh dari cara model AI saat ini bekerja. Large language model memilih token berikutnya, berulang-ulang, yang setara dengan system 1 dalam aksi: cepat, asosiatif, dan sangat baik dalam melengkapi pola. Pola seperti ini juga terlihat pada cara konsumen mencari produk, di mana LLM mengubah perilaku pencarian dan 70% respons AI merekomendasikan satu merek.

Setelah ChatGPT muncul, industri menyadari kefasihan bahasa saja tidak cukup. Solusinya adalah membuat model yang deliberatif lewat chain of thought, yakni menghasilkan langkah antara yang menguraikan masalah dan memengaruhi penalaran berikutnya. Keuntungannya nyata, terutama di matematika dan coding. Namun berbeda dari pencarian AlphaGo, ini tidak menghadirkan mekanisme penalaran yang benar-benar terpisah karena penalaran antara tetap dihasilkan oleh proses prediksi token yang sama.

Tiga Kekurangan Penalaran Chatbot

Graepel menyebut tiga kekurangan yang membuat apa yang dilakukan chatbot belum memenuhi syarat sebagai penalaran dalam pengertian ilmuwan. Pertama, model ini umumnya tidak memelihara keadaan epistemik yang eksplisit, persisten, dan bisa diperiksa. Tidak ada catatan terbuka yang memuat hipotesis yang dipertimbangkan, tingkat keyakinan atas berbagai penjelasan, bukti yang ditimbang, dan pertanyaan yang masih terbuka.

Kedua, tidak ada pemisahan bersih antara apa yang diketahui sistem dan bagaimana sistem memanipulasi pengetahuan itu. Pengetahuan dan penalaran terjalin erat dalam bobot jaringan neural, tanpa kumpulan keyakinan yang direpresentasikan secara independen dan eksplisit.

Ketiga, meski rantai pemikiran chatbot tampak seperti deliberasi, riset menunjukkan bot sering menyusunnya setelah fakta, mencapai jawaban lewat satu jalur tetapi melaporkan jalur lain. Masalah serupa juga muncul di sisi keamanan, seperti celah keamanan llms.txt yang bisa disalahgunakan untuk menyebar malware.

Hal ini menjadi persoalan karena pada aplikasi berisiko tinggi seperti kedokteran, teknik, dan riset ilmiah, bukan hanya kesimpulan yang penting tetapi juga cara sistem sampai pada kesimpulan tersebut. Ketika terjadi kesalahan, misalnya dalam diagnosis dan perawatan medis, kita perlu bisa menunjukkan apa yang salah: apakah penalaran sistem keliru, apakah ia memakai bukti tidak valid, atau apakah ia membuat asumsi yang tidak tepat.

Karena itu Graepel meninggalkan posisinya di Google DeepMind. Ia meyakini perlu pendekatan baru untuk penalaran mesin yang mengambil inspirasi dari arsitektur AlphaGo. AlphaGo memelihara catatan tentang apa yang diketahuinya atas suatu posisi, yaitu pohon permainan. Struktur data ini memuat semua variasi dan kemungkinan masa depan yang telah dipertimbangkan AlphaGo, dengan setiap langkah dan posisi dianotasi oleh penilaian jaringannya.

Saat penalarannya berkembang, AlphaGo memperbarui pohon permainan dan menyintesis informasi di dalamnya untuk memutuskan langkah. Untuk penalaran umum, sistem semestinya memelihara keadaan epistemik yang merepresentasikan apa yang dianggap mapan, apa yang diragukan, apa yang telah dikesampingkan, dan pertanyaan yang masih terbuka. Penalaran lalu dipahami sebagai rangkaian langkah yang mengubah keadaan epistemik untuk memajukan pengetahuan dan mengurangi ketidakpastian, termasuk memutuskan pertanyaan apa yang harus diajukan atau eksperimen apa yang harus dijalankan berikutnya.

Penalaran di dunia terbuka memang lebih sulit daripada bermain papan seperti Go atau catur. Dalam dunia nyata, keadaan saat ini hanya diketahui sebagian, rangkaian tindakan yang tersedia besar dan bervariasi, serta konsekuensi tindakan bersifat stokastik atau tidak diketahui.

Namun kemajuan terkini pada LLM dan model neural lain memberi kemampuan untuk menangani persoalan penalaran umum semacam itu. LLM dapat menyarankan cara menangani masalah berdasarkan apa yang diketahui dan sumber daya yang tersedia, berinteraksi dengan alat lewat API atau kode, serta membantu menilai apakah suatu klaim didukung bukti. Bagian independen dari sistem harus mengevaluasi setiap langkah berdasarkan seberapa besar ia benar-benar mengurangi ketidakpastian, dan memperbarui keyakinan hanya bila perubahan itu didukung bukti. Dengan aturan itu, model dapat mengakumulasi pengetahuan tersertifikasi dan memperbaiki kebijakan penalarannya dari pengalaman.

Graepel menegaskan, inteligensi mesin yang tepercaya tidak dicapai dengan memperbesar system 1. Skala menajamkan intuisi, tetapi tidak membuat intuisi lebih deliberatif. Langkah 37 bermakna karena mesin memegang posisi, menimbang kemungkinan masa depan, dan memilih langkah yang justru kemungkinan besar ditolak insting artifisialnya. Masyarakat membutuhkan langkah kreatif semacam itu di bidang penemuan obat, material, iklim, dan diagnosis, di mana papannya sama sekali berbeda dari papan Go dan tidak ada yang memberi aturannya.

Peringatan serupa juga berlaku pada sistem pengenalan yang bisa keliru membaca kondisi nyata, seperti sistem pengenalan wajah di bandara yang “tertipu” topeng. Wawasan semacam itu hanya akan didapat dari sistem yang bernalar, yang kesimpulannya lahir dari urutan bukti, inferensi, dan revisi keyakinan yang dapat diaudit, bukan dari cerita meyakinkan yang disusun setelah fakta.

Thore Graepel adalah chair of machine learning di University College London. Ia pernah menjadi anggota inti tim AlphaGo di DeepMind dan bekerja untuk memastikan AI bermanfaat bagi kesejahteraan manusia.

Ikuti Telset.id di Google NewsFollow

Komentar

Belum ada komentar.