Telset.id – Model AI tercanggih dunia ternyata belum siap menggantikan manusia di balik kemudi. Dalam proyek bernama DrivingBench, tiga ilmuwan komputer menguji model AI frontier seperti GPT-6 Astra milik OpenAI, Grok 4.6 dari xAI, dan Claude Fable 5.1 milik Anthropic untuk mengemudikan Toyota Corolla sungguhan di sebuah lintasan parkiran. Hasilnya, hanya satu model yang berhasil menyelesaikan seluruh lintasan.
Pengujian ini menjadi gambaran nyata sejauh mana kemampuan model AI besar ketika dihadapkan pada tugas mengemudi fisik. Meski dikenal punya kemampuan penalaran kompleks, mayoritas model justru gagal melewati tikungan pertama lintasan yang sederhana.
Setup proyek DrivingBench terbilang sederhana. Sebuah laptop yang terhubung internet berkomunikasi dengan perangkat “comma four” yang tersambung ke sistem kontrol Toyota. Model bahasa besar (LLM) mengirim perintah ke laptop berdasarkan telemetri GPS dan indikator status mobil lain, seperti sudut roda kemudi dan ban, yang diterima dari comma four.

Hanya GPT-6 Astra yang Berhasil Menuntaskan Lintasan
Dari seluruh percobaan, hanya GPT-6 Astra yang mampu menyelesaikan seluruh lintasan pada upaya kedua dalam waktu lima menit. Catatan itu terbilang sangat lambat karena mobil hanya menempuh jarak kurang dari 500 kaki. Model lainnya tampil jauh lebih buruk, dengan sebagian besar upaya gagal “melewati tikungan pertama.”
“Secara umum, kegagalan di sana adalah soal persepsi: membaca di sisi mana garis kerucut diagonal pertama berada di jalur,” catat para peneliti. Grok bahkan mengeluh setelah upaya pertamanya. “Mobil lebih lebar daripada yang terlihat di kamera. Lurus ke depan bukan jalur yang jelas; itu mengarah ke pot, dinding, atau kerucut merah di dekatnya,” ujarnya.
Meski demikian, ini menjadi pertama kalinya para peneliti berhasil membuat sistem tersebut bekerja sama sekali setelah beberapa upaya sebelumnya dengan generasi model AI frontier terdahulu. “Model frontier telah meningkat ke titik di mana mereka dapat mengemudikan kendaraan sungguhan di kehidupan nyata pada kecepatan yang cukup rendah,” simpul tim peneliti. “Meski keberhasilan model pada benchmark ini mengejutkan dan menggembirakan, hal ini juga menuntut kerja tambahan yang mendesak pada aspek keselamatan, alignment, dan evaluasi.”
Baca Juga:
Biaya Token dan Penolakan Model AI Jadi Sorotan
Pada putaran uji yang berhasil diselesaikan penuh, para peneliti mengaku menghabiskan US$7,74 atau setara sekitar Rp120 ribu untuk 6,6 juta token pada proses inferensi. Angka ini menunjukkan model AI OpenAI membutuhkan komputasi besar untuk mengolah data, bahkan ketika mobil hanya bergerak pada kecepatan 0,94 mph.
Jumlah itu mungkin terdengar kecil, tetapi karena mobil hanya menempuh jarak kurang dari 500 kaki, biaya tersebut bisa menumpuk dengan cepat. Menurut perhitungan The Register, biaya token tersebut setara dengan sekitar 500 kali biaya bahan bakar untuk mobil dengan efisiensi 25 mil per galon pada harga US$4,60 per galon.
Yang menarik, sejumlah LLM justru memperingatkan para peneliti bahwa mereka mungkin tidak dapat mengemudikan Toyota dengan aman. Karena itu, dibutuhkan sejumlah upaya meyakinkan agar model-model tersebut mau mengambil kendali sama sekali.
“Beberapa model (terutama GPT-6 Astra) kadang menolak mengemudikan mobil fisik, dengan alasan keselamatan (bahkan di parkiran yang benar-benar kosong, setelah diberi prompt dengan semua langkah keselamatan yang kami miliki termasuk batas kecepatan sangat rendah dan manusia siap menginjak rem),” tulis laporan tersebut. “Kami mencoba banyak perubahan prompt agar mereka konsisten mengemudi, misalnya mencoba menyebutnya sebagai ‘simulasi’ (tetapi kemudian dalam beberapa uji coba mereka melihat gambar nyata dan menyadari itu sungguhan, lalu mulai panik),” tambahnya.
Eksperimen ini menunjukkan bahwa model AI frontier yang tersedia secara komersial masih jauh dari siap mengantar pengguna ke kantor pada pagi hari. Mengingat implikasi keselamatan yang besar, belum lagi aspek hukumnya, kondisi ini justru bisa dipandang sebagai hal yang baik.
Pengujian DrivingBench juga menyoroti tantangan persepsi visual yang dihadapi model AI ketika berhadapan dengan lingkungan nyata. Garis kerucut, pot tanaman, dinding, dan kerucut merah di sekitar lintasan menjadi penghalang yang sulit ditafsirkan dengan benar oleh sebagian besar model. Kegagalan membaca sisi jalur pada tikungan pertama menjadi bukti bahwa kemampuan penalaran teks yang canggih tidak otomatis berbanding lurus dengan kemampuan navigasi spasial di dunia nyata.
Kendati demikian, keberhasilan GPT-6 Astra menuntaskan lintasan membuka peluang riset lanjutan. Para peneliti menekankan pentingnya pekerjaan tambahan pada keselamatan dan evaluasi sebelum model AI frontier dapat dipertimbangkan untuk aplikasi mengemudi yang lebih serius. Temuan ini sekaligus menjadi pengingat bahwa adopsi AI di kendaraan otonom membutuhkan pendekatan berlapis, bukan sekadar mengandalkan kecanggihan model bahasa.
Bagi industri, hasil DrivingBench menjadi sinyal bahwa pengembangan kendaraan otonom berbasis AI generatif masih berada di tahap awal. Di sisi lain, keberhasilan satu model menunjukkan bahwa pendekatan ini bukan mustahil, meski memerlukan biaya komputasi yang tidak kecil dan pengujian keselamatan yang jauh lebih ketat.





Komentar
Belum ada komentar.