Tencent telah melancarkan model WeMM-Embedding minggu ini, sebuah sistem multimodal dengan 2 bilion parameter yang sudah pun disepadukan ke dalam saluran paip carian, cadangan, dan e-dagang WeChat. Pelancaran ini penting kerana ia menunjukkan model yang memberikan kualiti capaian dunia nyata, kependaman (latency) rendah, dan saiz indeks yang kecil.

Mengapa terdapat keterujaan mengenai "kisah penggunaan" (deployment story)

Kebanyakan model AI baharu hadir dengan jadual penanda aras (benchmark) yang berkilat yang membandingkan skor pada set data yang dikurasi. Nombor-nombor tersebut membantu penyelidik membuktikan sesuatu, tetapi ia jarang diterjemahkan kepada metrik yang menggerakkan produk: seberapa cepat sesuatu pertanyaan dikembalikan, berapa banyak memori yang digunakan oleh indeks, dan sejauh mana model tersebut dapat menangani kandungan buatan pengguna yang bising (noisy). WeMM mengubah keadaan dengan menjadi komponen gred pengeluaran (production-grade) sejak hari pertama. Ia bukan eksperimen makmal yang menunggu pasukan hiliran untuk mengguna pakainya; ia sudah pun menggerakkan Channels, Moments, dan e-dagang.

Perkara teknikal yang perlu diperhatikan oleh pembangun

  • Pengendalian multimodal sebenar – Model ini menyerap teks, imej, bingkai video, dan gambar kenit (thumbnail) dokumen ke dalam satu ruang embedding tunggal. Seorang pengguna boleh menaip “sunset” dan mendapatkan klip video, foto, atau artikel berita yang sepadan tanpa perlu mencantumkan saluran paip teks-sahaja dan penglihatan-sahaja yang berasingan.

  • Saiz itu penting, tetapi bukan seperti yang anda fikirkan – Dengan 2 bilion parameter, model ini adalah “kecil” berbanding model 9 bilion ke atas yang mendominasi papan pendahulu. Namun, ia memenuhi bajet kependaman yang diperlukan untuk perkhidmatan interaktif. Model yang sesuai dengan perkakasan anda boleh mengatasi model yang lebih besar dan lebih perlahan dalam sistem langsung.

  • Embedding Matryoshka memberikan fleksibiliti dimensi – WeMM menyokong embedding “Matryoshka”, bermakna rangkaian yang sama boleh menghasilkan vektor dengan panjang yang berbeza, seperti dimensi 256 atau 512. Ujian menunjukkan bahawa pengurangan daripada 512 ke 256 dimensi mengekalkan hampir keseluruhan prestasi capaian sambil mengurangkan penggunaan memori sebanyak separuh, secara langsung menurunkan bil storan dan mempercepatkan carian jiran terdekat (nearest-neighbor searches).

Tiga peraturan pragmatik untuk membina sistem capaian (retrieval systems)

  1. Sahkan pada data anda sendiri – Penanda aras adalah bersih; data pengeluaran adalah kucar-kacir. Jika pengguna anda memuat naik tangkapan skrin, nota tulisan tangan, atau video resolusi rendah, jalankan model tersebut pada campuran tepat itu sebelum memutuskan ia sesuai.

  2. Anggap panjang vektor sebagai pengumpil kos – Vektor yang lebih besar meningkatkan kedua-dua pengiraan yang diperlukan untuk carian kesamaan (similarity search) dan ruang cakera untuk indeks. Mulakan dengan dimensi terkecil yang masih memenuhi sasaran kualiti anda. Tingkatkan skala hanya apabila anda melihat penurunan yang jelas dalam recall atau ketepatan (precision).

  3. Elakkan saluran paip yang terasing (siloed pipelines) – Membina pengekod (encoder) berasingan untuk setiap modaliti memaksa anda membina skema pemberat secara manual untuk peringkat kedudukan (ranking) akhir. Lapisan embedding universal menghapuskan kod penyambung tersebut, mengurangkan beban kejuruteraan, dan menjadikan ujian A/B lebih mudah.

Pertaruhan yang lebih luas

Bagi syarikat yang bergantung pada carian atau cadangan, pilihan model embedding boleh menentukan perbelanjaan infrastruktur. Bajet kependaman menjadi semakin ketat apabila jangkaan pengguna meningkat; model yang menambah walaupun beberapa milisaat bagi setiap pertanyaan boleh menyebabkan perkhidmatan jatuh di bawah tahap prestasi yang boleh diterima, yang membawa kepada kehilangan pelanggan (churn).

Keputusan Tencent untuk menjadikan pemberat (weights) sebagai sumber terbuka di bawah lesen Apache 2.0 juga mengubah lengkung kos bagi pembangun. Daripada merundingkan kontrak proprietari atau membina model dari awal, pasukan boleh memuat turun titik semak (checkpoint), melakukan penalaan halus (fine-tune) pada data khusus domain, dan menilai model tersebut terhadap beberapa kes kegagalan.

Di mana model ini mungkin kekurangan

Model ini mengendalikan empat modaliti—teks, imej, video, dan dokumen—tetapi tidak merangkumi setiap jenis input yang mungkin.

Apa yang perlu diperhatikan seterusnya

Kesimpulan

WeMM menunjukkan bahawa model embedding multimodal bersaiz sederhana boleh mengendalikan pertanyaan harian apabila ia dibina dengan mengambil kira kekangan pengeluaran. Bagi pembangun, mesejnya jelas: utamakan kualiti capaian dunia nyata, kekalkan dimensi vektor sekecil yang mungkin, dan satukan modaliti ke dalam satu lapisan embedding tunggal. Pilihan-pilihan tersebut dapat mengurangkan kependaman, mengecilkan kos storan dan, akhirnya, memberikan pengalaman yang lebih baik kepada pengguna akhir.