Telset.id – Nvidia telah merilis NeMo Switchyard, sebuah model router open source yang dapat memangkas biaya inferensi AI hingga 74 persen dibandingkan penggunaan model frontier secara penuh. Router ini bekerja dengan memilih model bahasa yang paling tepat untuk setiap permintaan, sehingga tugas sederhana tidak lagi memakai model besar yang mahal.
NeMo Switchyard hadir di tengah meningkatnya tekanan biaya yang dihadapi perusahaan enterprise seiring adopsi AI yang semakin masif. Dengan pendekatan ini, Nvidia menawarkan solusi yang tidak hanya efisien secara biaya, tetapi juga transparan dalam setiap pengambilan keputusan model yang digunakan.
Mekanisme Kerja NeMo Switchyard
NeMo Switchyard pada dasarnya adalah proxy yang menggunakan algoritma routing untuk menentukan model AI mana yang akan menerima setiap permintaan. Router ini menerima permintaan dari API OpenAI, Anthropic, dan Responses, kemudian menerjemahkannya antar platform serta mendokumentasikan model yang dipilih, alasan keputusan, penggunaan token, dan latensi untuk setiap panggilan.
Pendekatan ini berbeda dari metode satu-ukuran-untuk-semua yang umum digunakan, di mana semua tugas dikirim ke model terbesar. Nvidia mencontohkan Nemotron Parse, model satu miliar parameter yang dirancang khusus untuk mengekstrak struktur dari PDF, sebagai contoh tugas yang tidak memerlukan model frontier.

Hasil pengujian menunjukkan bahwa pendekatan ini mampu menekan biaya hingga 74 persen dengan hanya mengurangi akurasi sebesar 6 persen. Namun, penghematan ini datang dengan konsekuensi berupa tambahan latensi sekitar 700ms karena model penilai (judge model) harus membaca seluruh output.
NeMo Switchyard bergabung dalam lanskap yang semakin ramai dengan pemain seperti RouteLLM, LiteLLM, dan OpenRouter, serta upaya internal dari OpenAI dan AT&T. Bidang ini dinilai cukup potensial, terbukti dari rencana akuisisi OpenRouter oleh Stripe senilai lebih dari $7 miliar.
Biaya Tersembunyi dan Trade-off
Meskipun menjanjikan, pendekatan routing ini memiliki biaya tersembunyi. Pengujian LangChain terhadap Nemotron 3.5 Lightning menunjukkan bahwa model penilai mengonsumsi hingga 21,2 persen dari total biaya, hanya kalah dari biaya yang dikeluarkan untuk Claude Opus 4.8. Model penilai yang lebih teroptimasi bisa menghasilkan penghematan lebih besar, tetapi berisiko menghambat kasus penggunaan yang membutuhkan model AI dasar.
Varians biaya juga menjadi perhatian. Dalam pengujian, biaya berfluktuasi antara $2,16 hingga $3,61, pergerakan 67 persen yang dipengaruhi oleh kapan permintaan dinaikkan ke model yang lebih besar. Trade-off ini membuat biaya sulit diprediksi: routing memang menurunkan rata-rata pengeluaran, tetapi memperlebar distribusi di sekitarnya.

LangChain juga menyarankan agar Switchyard tidak digunakan untuk beban kerja pendek atau yang sensitif terhadap latensi. Nvidia sendiri melihat produk ini sebagai solusi open source terpaket dengan integrasi luas di ruang yang relatif terfragmentasi.
Strategi Nvidia di sini cukup jelas: dengan mengarahkan pekerjaan ke model open-weight yang lebih kecil, inferensi bergeser ke perangkat keras yang dimiliki enterprise—perangkat keras yang dijual Nvidia. Selain itu, inferensi yang lebih murah secara historis berarti lebih banyak inferensi, bukan lebih sedikit, sebuah hasil yang diinginkan perusahaan penjual akselerator untuk menarik enterprise yang masih ragu berinvestasi langsung pada perangkat keras AI.
Kehadiran NeMo Switchyard menambah opsi bagi perusahaan yang ingin mengoptimalkan biaya AI tanpa harus sepenuhnya bergantung pada model frontier. Dengan dokumentasi transparan dan kemampuan penyesuaian, router ini menawarkan kendali lebih besar atas biaya operasional AI, meskipun dengan konsekuensi latensi tambahan yang perlu dipertimbangkan.
Bagi enterprise yang tengah mengevaluasi strategi AI, keputusan untuk mengadopsi router seperti NeMo Switchyard akan bergantung pada prioritas antara penghematan biaya, akurasi, dan kecepatan respons. Nvidia tampaknya siap melayani ketiganya dengan pendekatan yang dapat disesuaikan.





Komentar
Belum ada komentar.