šŸ“‘ Daftar Isi

Ilustrasi jaringan saraf AI yang saling terhubung dalam sistem komputasi

Riset Tsinghua: Cache-to-Cache Bikin AI Kolaborasi 2,5 Kali Lebih Cepat

Penulis:Nur Hamzah
Terbit:
Diperbarui:
ā±ļø4 menit membaca
Bagikan:
  • Riset Tsinghua University memperkenalkan Cache-to-Cache (C2C), teknik pertukaran informasi antar model AI tanpa teks
  • C2C melewati proses bahasa tertulis dengan mengirim memori kerja langsung ke bank memori model kedua
  • Program Fuser menangani serah terima informasi antar model dengan struktur internal berbeda
  • Filter pintar mengatur lapisan mana yang menyerap informasi baru secara langsung
  • Model AI berjalan 100% hingga 150% lebih cepat pada tugas kolaboratif bersama
  • Akurasi meningkat hingga 14,2% saat model bekerja bersama
  • Metode hanya berfungsi pada model berbobot terbuka
  • Telah diterima di ICLR 2026 dengan kode sumber terbuka

Telset.id – Riset terbaru dari Tsinghua University memperkenalkan teknik Cache-to-Cache (C2C) yang memungkinkan dua model AI bertukar informasi internal tanpa perlu menghasilkan teks. Metode ini diklaim membuat model AI berjalan 100% hingga 150% lebih cepat saat menjalankan tugas kolaboratif bersama, atau setara sekitar dua setengah kali lebih cepat dibandingkan proses pertukaran teks konvensional.

Teknik ini menjawab salah satu inefisiensi utama yang muncul ketika beberapa model bahasa bekerja bersama dalam satu pipeline. Selama ini, ketika dua model AI berkolaborasi, salah satunya harus mengubah proses berpikirnya menjadi kalimat tertulis sebelum model lain dapat membacanya. Proses penulisan tersebut memakan waktu komputasi nyata dan membuang detail kecil yang tersimpan di dalam proses berpikir mentah model pertama.

Metode ini telah diterima di ICLR 2026 dan disertai kode sumber terbuka yang tersedia bagi para pengembang. Publikasi riset ini menjadi salah satu perkembangan yang menarik di tengah derasnya inovasi arsitektur AI, sejalan dengan berbagai eksperimen efisiensi model yang tengah berlangsung di industri.

Cara Kerja Cache-to-Cache

Setiap model AI menyimpan memori kerja atas semua yang telah diprosesnya, yang secara teknis dikenal sebagai cache. C2C melewati proses bahasa tertulis sepenuhnya dengan membiarkan satu model mengirimkan memori kerjanya langsung ke bank memori model kedua.

Sebuah program pendukung kecil bernama Fuser menangani proses serah terima ini, dengan membentuk ulang dan memutar informasi agar model kedua dapat benar-benar menggunakannya. Tantangannya, setiap model AI menyimpan memori dengan tata letak, ukuran, dan struktur internal yang berbeda satu sama lain. Menempatkan memori mentah satu model ke model lain secara langsung berpotensi membingungkan model penerima atau membuat jawabannya berantakan.

Untuk mencegah hal itu, C2C menyertakan filter pintar yang menentukan bagian memori masuk mana yang layak diserap segera. Sebagian lapisan internal menerima informasi baru langsung, sementara lapisan lain tetap bernalar secara mandiri tanpa gangguan dari luar.

AI chip on a lit circuit board

Pendekatan selektif ini menjadi pembeda utama C2C dibandingkan metode pertukaran informasi antar model yang sudah ada. Alih-alih memaksa seluruh lapisan menyerap data dari model lain, sistem ini membiarkan sebagian proses penalaran tetap berjalan independen sehingga kualitas jawaban tidak runtuh.

Klaim Peningkatan Performa dan Akurasi

Menurut para peneliti, konfigurasi ini membuat model AI berjalan antara 100% dan 150% lebih cepat selama tugas kolaboratif bersama. Angka batas atas tersebut setara dengan sekitar dua setengah kali lebih cepat dibandingkan proses bolak-balik pengetikan yang biasa.

Tim peneliti juga melaporkan peningkatan akurasi hingga 14,2% ketika model bekerja bersama, bukan beroperasi sepenuhnya sendiri. Dibandingkan dengan pengaturan lama di mana model masih berkomunikasi melalui teks tertulis, akurasi dilaporkan meningkat 3,1% hingga 5,4%.

Meski angkanya terdengar menjanjikan, riset ini tetap menyisakan catatan penting. Tim yang membangun sistem tersebut juga yang menjalankan seluruh pengujian yang membuktikan performanya. Seberapa besar percepatan yang benar-benar terjadi akan bergantung pada pengujian eksternal terhadap sistem ini.

Batasan Metode C2C

Pendekatan ini saat ini hanya berfungsi pada model berbobot terbuka (open-weight), karena membutuhkan akses langsung ke cache internal dan struktur lapisan sebuah model. Sebagian besar alat AI populer, jenis yang biasa digunakan orang untuk mengobrol secara online, menyembunyikan detail internal tersebut sepenuhnya dari pengguna luar.

Artinya, aplikasi sehari-hari seperti chatbot tertentu tidak dapat memakai jalan pintas ini kecuali pembuatnya sendiri membangunnya secara privat. Tidak ada pihak di luar perusahaan-perusahaan tersebut yang saat ini mengetahui secara pasti apakah ada yang sudah mulai menggunakan metode serupa secara internal.

Hands typing on a tablet with AI superimposed in text in front

Tim peneliti berargumen bahwa bahasa tertulis selalu memperlambat mesin karena memaksa mereka berpikir seperti manusia. Argumen itu patut disikapi dengan hati-hati, mengingat tim yang sama yang membangun sistem juga menjalankan setiap pengujian yang membuktikan sistem tersebut bekerja dengan baik.

Keterbatasan akses terhadap struktur internal model juga menjelaskan mengapa inovasi semacam ini lebih mudah muncul di ekosistem model terbuka. Pengembang yang bekerja dengan model tertutup harus menunggu dukungan resmi dari pemilik model jika ingin mengadopsi mekanisme serupa. Di sisi lain, pendekatan berbasis cache ini menunjukkan bahwa efisiensi komputasi kini menjadi medan kompetisi tersendiri, bukan sekadar soal ukuran parameter atau kemampuan penalaran model.

Bagi industri, hasil riset Tsinghua University ini menawarkan arah alternatif dalam menghemat waktu komputasi pada sistem yang melibatkan banyak model sekaligus. Namun, validasi independen tetap menjadi penentu apakah C2C akan diadopsi secara luas atau hanya berhenti sebagai eksperimen akademik. Kode sumber terbuka yang menyertai publikasi ini membuka peluang bagi peneliti lain untuk menguji ulang klaim tersebut, sekaligus mengukur sejauh mana metode ini dapat diterapkan di luar lingkungan pengujian awal.

Sejumlah pengembangan lain di ranah kecerdasan buatan juga tengah berjalan, termasuk eksperimen efisiensi model berskala kecil yang diklaim jauh lebih murah, sebagaimana dibahas dalam artikel AMD Diselidiki soal terkait dinamika chip dan komputasi. Perkembangan riset seperti C2C menegaskan bahwa persaingan di lapisan infrastruktur AI semakin ketat, dengan fokus tidak lagi hanya pada seberapa pintar sebuah model, tetapi juga seberapa efisien model-model itu bisa bekerja bersama.

[WIDGET]

Ikuti Telset.id di Google NewsFollow

Komentar

Belum ada komentar.