šŸ“‘ Daftar Isi

Ilustrasi riset Nvidia tentang harness AI untuk tugas jangka panjang dengan skor sempurna ARC-AGI-3

Riset Nvidia: Harness Kunci Keberhasilan AI dalam Tugas Jangka Panjang

Penulis:Nur Hamzah
Terbit:
Diperbarui:
ā±ļø4 menit membaca
Bagikan:
  • Nvidia merilis riset yang menunjukkan harness lebih penting daripada model AI untuk long-horizon tasks
  • Dengan harness khusus, Claude Opus 5 mencapai skor 100% pada benchmark ARC-AGI-3
  • Tanpa harness, skor model hanya 30% yang menjadi hasil tertinggi di antara model lain
  • Komponen "supervisor" dalam harness berperan seperti CEO yang mengarahkan agen AI
  • OpenAI juga menemukan peningkatan skor 3x lipat hanya dengan tweak pengaturan harness
  • Databricks membuktikan harness dapat menggandakan biaya AI jika salah pemilihan
  • Nvidia membangun harness khusus bernama Agentic Variation Operators (AVO)
  • Nvidia menyediakan komponen harness terbuka di bawah merek Nemo

Telset.id – Nvidia merilis riset terbaru yang mengungkap bahwa komponen ā€œharnessā€ atau pembungkus perangkat lunak di sekitar model AI memegang peranan lebih penting daripada model itu sendiri dalam menyelesaikan tugas jangka panjang atau long-horizon tasks. Dalam pengujian menggunakan benchmark penalaran interaktif ARC-AGI-3, peneliti Nvidia berhasil mencapai skor sempurna 100% dengan memanfaatkan harness khusus yang dioptimalkan untuk manajemen memori dan dilengkapi komponen ā€œsupervisorā€.

Temuan ini menjadi sorotan karena tanpa harness, model Claude Opus 5 hanya mampu meraih skor 30%, yang justru menjadi hasil tertinggi di antara semua model yang diuji. Riset tersebut menegaskan bahwa pemilihan model memang penting, namun model itu sendiri—yang berperan sebagai ā€œotakā€ dari agen AI—hanyalah bagian kecil dari sistem agen yang utuh, terutama untuk tugas-tugas jangka panjang.

Peran Krusial Harness dalam Sistem Agen AI

Harness adalah pembungkus perangkat lunak di sekitar model AI yang mencakup perangkat, manajemen memori, dan aturan yang mengubah model mentah menjadi sesuatu yang dapat bertindak secara mandiri. Tanpa harness, sebuah model hanyalah mesin yang merespons perintah, bukan agen yang mampu mengambil keputusan berkelanjutan.

Adel El Hallak, wakil presiden produk di unit AI Nvidia, menjelaskan bahwa banyak pihak keliru memahami konsep agen AI. ā€œSecara umum, dunia menginterpretasikan agen hampir seperti API dari model,ā€ ujarnya kepada TechCrunch. Namun menurutnya, agen sebenarnya lebih dari sekadar itu. ā€œIni adalah model. Ini adalah perancah di sekitar model, yang kami sebut harness, yaitu seperangkat alat yang digunakannya. Ini adalah runtime beserta keterampilan dan pustaka terkait yang kami berikan aksesnya.ā€

Long-horizon tasks adalah tugas yang membutuhkan rentetan keputusan berkelanjutan, kadang berlangsung berhari-hari, untuk menghasilkan pekerjaan yang selesai. Ini berbeda dengan AI yang hanya melontarkan respons terhadap sebuah perintah. Menemukan cara agar AI dapat menyelesaikan tugas jangka panjang tanpa kehilangan fokus menjadi salah satu tujuan utama dalam riset agen AI.

Sebelumnya, Microsoft menerbitkan riset pada April yang menguji 19 LLM pada tugas jangka panjang yang melibatkan pengeditan dokumen. Hasilnya, semua model termasuk model frontier mengisi dokumen dengan berbagai kesalahan. Bahkan, model yang menyusun keputusan secara mandiri pernah tertangkap menghapus file pengguna, menghapus seluruh database, atau berperilaku kriminal—mulai dari kolusi hingga peretasan—untuk mencapai tujuan mereka.

Supervisor: Komponen Kunci dalam Harness

Pilihan peneliti Nvidia menggunakan benchmark penalaran interaktif ARC-AGI-3 sangat bermakna. Benchmark ini berisi serangkaian permainan 2D tanpa instruksi, di mana model harus mencari tahu cara bermain dan menang, mirip seperti cara manusia melakukannya. Skor 100% berarti model dapat mengalahkan permainan tersebut sebaik manusia.

OpenAI sempat terusik dengan skor buruk modelnya yang kurang dari 10% pada ARC-AGI-3, hingga melakukan riset sendiri pada bulan lalu. OpenAI menemukan bahwa hanya dengan mengubah dua pengaturan pada harness, skor model mereka meningkat tiga kali lipat. Namun, tidak ada model yang mendekati skor 100% seperti yang dicapai peneliti Nvidia.

Kunci keberhasilan Nvidia terletak pada penambahan komponen ā€œsupervisorā€ dalam harness. ā€œBagian yang lebih menarik adalah memperkenalkan agen pengawas selain agen utama yang mengerjakan tugas,ā€ kata El Hallak. Supervisor ini ā€œhampir bertindak seperti CEO untuk mendorong agen ketika ia keluar dari arah atau mulai menjelajahi jalur yang mungkin mengarah ke jalan buntu, atau mengeksplorasi ulang jalur yang sebelumnya telah dilalui.ā€

Meskipun konsep agen pengawas bukan hal baru, sebagian besar pengguna agen saat ini hanya mengandalkan satu lapisan untuk harness mereka, seperti Claude Code, Codex, atau Hermes. Peneliti Nvidia menciptakan harness khusus bernama Agentic Variation Operators (AVO). Perlu dicatat bahwa ini bukan produk baru Nvidia, melainkan hasil riset yang menunjukkan potensi optimalisasi harness.

Temuan Nvidia menambah bukti bahwa pilihan model bukanlah satu-satunya faktor dalam performa agen AI. Pada Juli, Databricks menerbitkan riset yang menunjukkan bahwa harness lebih berdampak pada biaya AI dibandingkan model itu sendiri. ā€œAnda dapat memilih model yang sama tetapi harness berbeda, dan Anda mendapatkan biaya yang jauh lebih besar jika menggunakan harness yang salah,ā€ kata CEO Databricks Ali Ghodsi. ā€œJadi Anda berpikir, oh, ini model mahal. Ini model murah. Tapi tunggu, harness mana yang Anda gunakan? Itu sendiri dapat menggandakan biaya Anda.ā€

Nvidia menegaskan bahwa harness terbuka, seperti halnya model terbuka, memberikan kendali lebih besar kepada pengguna. ā€œKami percaya, dan kami tunjukkan dengan ekosistem, bagaimana harness terbuka memungkinkan Anda memutar lebih banyak kenop untuk meningkatkan akurasi itu,ā€ kata El Hallak. ā€œIni terkait dengan OpenAI yang memperlambat pelatihan model mereka sebagai akibat dari model yang menciptakan pelanggaran keamanan.ā€ Ia menambahkan, ā€œKami percaya memiliki tumpukan agen terbuka—di mana Anda memiliki kendali atas harness, infrastruktur, dan runtime—adalah yang diperlukan untuk membawa ekosistem maju dan aman.ā€

Nvidia memproduksi berbagai komponen teknologi terbuka untuk membangun harness di bawah merek Nemo. Sebagian teknologi tersebut bersifat komersial, sementara banyak yang tersedia secara terbuka. Pendekatan ini sejalan dengan strategi Nvidia yang juga terlihat pada pengiriman chip H200 dan berbagai inisiatif AI lainnya.

Riset ini menjadi indikator penting bagi industri AI bahwa fokus pengembangan tidak hanya pada model, tetapi juga pada infrastruktur pendukung yang membuat model tersebut dapat bekerja secara optimal dalam skenario dunia nyata. Bagi pengembang dan perusahaan yang membangun sistem agen AI, pemahaman tentang peran harness menjadi semakin krusial untuk menghasilkan performa terbaik dengan biaya efisien.

Ikuti Telset.id di Google NewsFollow

Komentar

Belum ada komentar.