πŸ“‘ Daftar Isi

Ilustrasi model AI pembuat gambar Qwen Image 2.1 dari Alibaba Cloud dengan 7 miliar parameter

Alibaba Rilis Qwen Image 2.1, Model AI Gambar Ringan 7B Parameter

Penulis:Nur Hamzah
Terbit:
Diperbarui:
⏱️5 menit membaca
Bagikan:
  • Alibaba Cloud merilis Qwen Image 2.1, model AI gambar open-weight 7 miliar parameter
  • Berjalan di GPU konsumen seperti RTX 3090, RTX 4090, hingga RTX 3060
  • Klaim mengalahkan Nano Banana 2.0 berdasarkan benchmark internal
  • Unggul di Image Edit Arena sebagai model open source peringkat #1
  • Lisensi baru melarang penjualan ulang komersial model tanpa izin Alibaba

Telset.id – Alibaba Cloud merilis model AI pembuat gambar ringan terbaru bernama Qwen Image 2.1. Model berbobot terbuka (open-weight) ini hanya membawa 7 miliar parameter, sehingga mampu berjalan di kartu grafis konsumen generasi lama seperti RTX 3090. Meski berukuran ringan, pengembangnya mengklaim model ini lebih cakap dibanding sejumlah model closed-weight, termasuk Nano Banana 2.0 milik Google.

Klaim tersebut didasarkan pada benchmark internal mereka sendiri. Karena itu, dibutuhkan pengujian tambahan sebelum menyimpulkan kemampuan sesungguhnya. Meski demikian, laporan awal menyebut Qwen Image 2.1 sebagai model gambar yang cukup mumpuni, dengan dukungan transparansi native serta kemampuan menyatukan gambar dari berbagai gambar referensi.

Salah satu fitur yang menyita perhatian adalah perubahan pada perjanjian lisensi Qwen Image 2.1. Berbeda dari versi sebelumnya, lisensi kali ini secara eksplisit melarang penjualan ulang model secara komersial. Siapa pun yang ingin memakainya untuk keperluan tersebut harus memperoleh lisensi terpisah langsung dari pengembang.

Fitur dan Posisi Qwen Image 2.1

Qwen Image 2.1 menghadirkan sejumlah fitur baru yang memperkuat daya saingnya. Model ini mendukung transparansi native, sehingga dapat menghasilkan gambar dengan latar belakang transparan. Fitur ini berguna bagi seniman yang ingin memakai AI sebagai bagian dari karya lain, atau untuk produk print-on-demand seperti stiker.

Kemampuan penyuntingan gambar juga ditingkatkan, dengan dukungan hingga 10 gambar referensi. Salah satu contoh yang dikutip adalah memasukkan gambar seseorang, lalu memberi model gambar pakaian, dan model akan menyusun gambar orang tersebut mengenakan pakaian itu. Tim Qwen menjanjikan konsistensi antar gambar, dengan mempertahankan orang dan produk secara efektif.

Fitur paling menonjol dari Qwen Image 2.1 adalah ukurannya yang ringkas. Komponen pembuat visualnya hanya memiliki 7 miliar parameter, menjadikannya salah satu model paling ramping di kelasnya. Dalam pengujian perbandingan pihak pertama, satu-satunya model dengan parameter lebih sedikit adalah LongCat-Image yang dikembangkan Meituan dengan 6 miliar parameter. Sebagian besar model lain berukuran beberapa kali lipat, atau sepenuhnya closed-weight.

Pada benchmark internal yang sama, model ini mencetak skor 60,2 di Qwen Image Benchmark. Sebagai perbandingan, GPT Image 2.5 Sunburst dari OpenAI mencetak 67, Muse Image 62,34, dan Nano Banana 2.0 milik Google 59,82. Pengujian awal di AI Arena menunjukkan hasil yang tidak sekuat itu dalam kondisi benchmark yang kurang menguntungkan, tetapi tetap sangat dekat. Di sana, model ini meraih skor 1228, sementara Nano Banana 2 mencapai 1260.

Muse Image berada beberapa peringkat lebih tinggi dengan skor 1276, sedangkan GPT 65 Sunburst bertengger di puncak dengan skor 1423. Di ranah penyuntingan gambar, AI Arena menyebut Qwen Image 2.1 kini menjadi yang terbaik di antara opsi open-weight. Model ini menempati posisi #1 model open source di Image Edit Arena dan Text-to-Image Arena dengan 1367 poin. Secara keseluruhan, ia berada di peringkat #16, hanya terpaut 3 poin dari GPT-Image-1.5-high-fidelity di peringkat #15.

Hasil ini masih awal dan membutuhkan lebih banyak pengujian untuk mengonfirmasi atau membantah klaim tim Qwen. Sejauh ini, hasilnya tampak cukup dekat dengan kenyataan. Meski tidak diketahui berapa banyak parameter yang dipakai model proprietary untuk meraih skor lebih tinggi, Qwen Image 2.1 tampak menguntit mereka dengan bobot yang jauh lebih sederhana.

Berjalan di Perangkat Lokal

Laporan dari sejumlah pengguna awal Qwen Image 2.1 menyebut model ini berjalan lancar di kartu grafis konsumen. Anggota forum Hacker News bernama Vunderba, pengembang situs GenAI Showdown, mengklaim mampu mengonversi gambar 1MP memakai Qwen Image 2.1 dalam sekitar lima detik di RTX 4090.

Di subreddit Stable Diffusion, pengguna cgs019283 memuji kemampuannya dan menyatakan model ini dapat menghasilkan gambar 1MP dalam sekitar 25 detik di kartu grafis Nvidia seri 50 modern seperti RTX 5070 dan 5080. Namun, ia menyebut prosesnya bisa jauh lebih lama jika memakai banyak gambar referensi, dan penyuntingan gambar menjadi fungsi paling lambat dalam pengujiannya.

Pengguna lain menjalankan model ini di perangkat yang lebih tua dan jauh lebih ringan. Satu pengguna mengklaim memakainya untuk menghasilkan gambar resolusi 2K dalam sekitar 50 detik dengan Nvidia RTX 3060 dan memori 64GB. Ada pula pengguna yang beruntung memiliki RTX 6000 Pro, di mana perangkat keras bertenaga tersebut mampu menghasilkan gambar 1024 x 1024 hanya dalam beberapa detik.

Meski penyiapan dan penggunaan AI lokal masih jauh dari kemudahan platform berbasis cloud seperti Nano Banana milik Google dan model GPT Image dari OpenAI, hasil awal ini tampak impresif. Jika fiturnya bertahan dalam pengujian yang lebih ketat, mereka yang menginginkan pembuatan gambar cepat dan berkualitas namun berjalan lokal dengan kendali penuh tanpa akun cloud atau langganan bisa menjadikannya pesaing tangguh.

Dilema Lisensi

Dari semua komentar para pengguna awal Qwen Image 2.1, isu yang terus muncul adalah cara pengembang menangani lisensi. Rumusannya terkesan ambigu: β€œAnda diberikan lisensi terbatas non-eksklusif, berlaku di seluruh dunia, tidak dapat dialihkan, dan bebas royalti berdasarkan hak kekayaan intelektual kami atau hak lain yang kami miliki yang terkandung dalam Materi untuk menggunakan, mereproduksi, mendistribusikan, menyalin, membuat karya turunan, dan melakukan modifikasi terhadap Materi HANYA UNTUK TUJUAN NON-KOMERSIAL.”

Dokumen itu lalu menyatakan bahwa siapa pun yang ingin memakai β€œMateri” tersebut untuk tujuan komersial harus memperoleh lisensi dari tim Qwen khusus untuk penggunaan tersebut. Kekhawatiran di komunitas cukup besar hingga tim Qwen merilis pernyataan di Twitter/X. Mereka berterima kasih atas sambutan terhadap Qwen-Image-2.1 selama 24 jam terakhir dan menjawab pertanyaan soal lisensi, terutama terkait output model.

Jawabannya, output bukan bagian dari Materi yang dilisensikan. Pengguna tetap memegang hak atas gambar dan konten lain yang dihasilkan. Hal ini sebagian besar menjawab kebingungan. Apa pun yang dihasilkan model tidak diklasifikasikan sebagai materi berlisensi, sehingga tidak tercakup klausul tersebut.

Namun, ini berarti model itu sendiri tidak dapat dijual ulang tanpa lisensi dari Alibaba. Ketentuan ini cukup berbeda dari model Apache yang menjadi dasar Qwen Image orisinal, dan berpotensi memperluas definisi open-weight. Model ini jelas tidak sepenuhnya terbuka. Meski begitu, bagi sebagian besar orang hal ini bukan masalah. Qwen Image 2.1 dapat dijalankan di perangkat keras lokal untuk membuat gambar yang efektif dan memakainya sesuai keinginan.

Dengan desain seringan itu namun menawarkan kemampuan mengesankan, respons dari pengembang model closed-weight akan menarik untuk dicermati. Sebagai konteks pasar, Alibaba juga tengah memperluas ekosistem AI-nya, termasuk lewat chip Zhenwu V900 dan langkah ekspansi global QwenWork.

Ikuti Telset.id di Google NewsFollow

Komentar

Belum ada komentar.