Tencent ने या आठवड्यात WeMM-Embedding मॉडेल लाँच केले आहे, जे २ अब्ज पॅरामीटर्स असलेले एक मल्टीमोडल (multimodal) सिस्टम आहे आणि ते आधीच WeChat च्या सर्च, शिफारस (recommendation) आणि ई-कॉमर्स पाइपलाईन्समध्ये समाविष्ट आहे. हे रिलीज महत्त्वाचे आहे कारण ते एक असे मॉडेल दर्शवते जे प्रत्यक्ष जगातील रिट्रिव्हल क्वालिटी (retrieval quality), कमी लॅटन्सी (low latency) आणि लहान इंडेक्स आकार प्रदान करते.
“डिप्लॉयमेंट स्टोरी” (deployment story) भोवती इतका गाजावाजा का?
बहुतेक नवीन AI मॉडेल्स निवडक डेटासेटवरील स्कोअरची तुलना करणाऱ्या चकचकीत बेंचमार्क टेबल्ससह येतात. ते आकडे संशोधकांना एखादा मुद्दा सिद्ध करण्यास मदत करतात, परंतु ते उत्पादनांना चालवणाऱ्या मेट्रिक्समध्ये (metrics) क्वचितच रूपांतरित होतात: क्वेरी किती वेगाने परत येते, इंडेक्स किती मेमरी वापरतो आणि मॉडेल गोंधळलेल्या (noisy), वापरकर्त्याने तयार केलेल्या कंटेंटशी किती चांगल्या प्रकारे जुळवून घेते. WeMM पहिल्या दिवसापासूनच प्रोडक्शन-ग्रेड घटक (production-grade component) बनून ही परिस्थिती बदलून टाकते. हे एखाद्या प्रयोगशाळेतील प्रयोग नाही ज्याची प्रतीक्षा एखादी टीम ते स्वीकारण्यासाठी करत आहे; ते आधीच Channels, Moments आणि ई-कॉमर्सला शक्ती प्रदान करते.
डेव्हलपर्सनी लक्षात घ्यावयाचे तांत्रिक मुद्दे
खरे मल्टीमोडल हँडलिंग (True multimodal handling) – हे मॉडेल मजकूर (text), प्रतिमा (images), व्हिडिओ फ्रेम्स आणि डॉक्युमेंट थंबनेल्स एकाच एम्बेडिंग स्पेसमध्ये (embedding space) समाविष्ट करते. वापरकर्ता “sunset” टाइप करू शकतो आणि केवळ मजकूर किंवा केवळ व्हिजन-ओन्ली पाइपलाईन्स एकत्र न जोडता, त्याशी जुळणारा व्हिडिओ क्लिप, फोटो किंवा बातमीचा लेख मिळवू शकतो.
आकार महत्त्वाचा आहे, पण तुम्ही विचार करता तसा नाही – ९ अब्ज पेक्षा जास्त पॅरामीटर्स असलेल्या मॉडेल्सच्या तुलनेत २ अब्ज पॅरामीटर्स असलेले हे मॉडेल "लहान" आहे. तरीही, ते इंटरअॅक्टिव्ह सेवांसाठी आवश्यक असलेल्या लॅटन्सी बजेटमध्ये बसते. तुमच्या हार्डवेअरमध्ये बसणारे मॉडेल प्रत्यक्ष सिस्टीममध्ये मोठ्या आणि संथ मॉडेलपेक्षा अधिक चांगली कामगिरी करू शकते.
Matryoshka एम्बेडिंग्समुळे डायमेंशनमध्ये लवचिकता मिळते – WeMM “Matryoshka” एम्बेडिंग्सना सपोर्ट करते, याचा अर्थ तेच नेटवर्क २५६ किंवा ५१२ डायमेंशन्ससारख्या वेगवेगळ्या लांबीचे वेक्टर्स आउटपुट देऊ शकते. चाचण्या असे दर्शवतात की ५१२ वरून २५६ डायमेंशन्समध्ये कमी केल्यास मेमरीचा वापर निम्म्याने कमी होतो आणि स्टोरेज खर्च थेट कमी होतो तसेच 'निअरस्ट-नेबर' (nearest-neighbor) शोध वेगवान होतो, तरीही रिट्रिव्हल परफॉर्मन्स जवळजवळ पूर्णपणे टिकून राहतो.
रिट्रिव्हल सिस्टीम तयार करण्यासाठी तीन व्यावहारिक नियम
१. तुमच्या स्वतःच्या डेटावर पडताळणी करा – बेंचमार्क्स स्वच्छ असतात; प्रोडक्शन डेटा विस्कळीत असतो. जर तुमचे वापरकर्ते स्क्रीनशॉट्स, हस्तलिखित नोट्स किंवा कमी रिझोल्यूशनचे व्हिडिओ अपलोड करत असतील, तर ते मॉडेल योग्य आहे की नाही हे ठरवण्यापूर्वी त्याच मिश्रणावर मॉडेल चालवून पहा.
२. वेक्टर लांबीला खर्चाचे साधन (cost lever) माना – मोठे वेक्टर्स सिमिलरिटी सर्चसाठी लागणारी कॉम्प्युट क्षमता आणि इंडेक्ससाठी लागणारी डिस्क स्पेस दोन्ही वाढवतात. तुमच्या क्वालिटी टार्गेटला साजेसे असलेले सर्वात लहान डायमेंशन वापरून सुरुवात करा. जेव्हा तुम्हाला रिकॉल (recall) किंवा प्रिसिजन (precision) मध्ये स्पष्ट घट दिसून येईल, तेव्हाच स्केल अप करा.
३. स्वतंत्र (siloed) पाइपलाईन्स टाळा – प्रत्येक मोडॅलिटीसाठी स्वतंत्र एनकोडर्स तयार केल्यामुळे तुम्हाला अंतिम रँकिंग स्टेजसाठी वेटिंग स्कीम्स (weighting schemes) स्वतः तयार कराव्या लागतात. एक युनिव्हर्सल एम्बेडिंग लेअर ते 'ग्लू कोड' (glue code) काढून टाकते, इंजिनिअरिंगचा ओव्हरहेड कमी करते आणि A/B टेस्टिंग सोपे करते.
व्यापक परिणाम
सर्च किंवा शिफारसींवर अवलंबून असलेल्या कंपन्यांसाठी, एम्बेडिंग मॉडेलची निवड पायाभूत सुविधांच्या (infrastructure) खर्चावर परिणाम करू शकते. वापरकर्त्यांच्या अपेक्षा वाढल्यामुळे लॅटन्सी बजेट कमी होत जाते; प्रति क्वेरी काही मिलीसेकंद जरी वाढले तरी सेवा स्वीकारार्ह कामगिरीच्या मर्यादेबाहेर जाऊ शकते, ज्यामुळे वापरकर्ते कमी होऊ शकतात (churn).
Apache 2.0 लायसन्स अंतर्गत वेट्स (weights) ओपन-सोर्स करण्याचा Tencent चा निर्णय डेव्हलपर्ससाठी खर्चाचा कल (cost curve) देखील बदलतो. प्रोप्रायटरी करार करण्यासाठी किंवा शून्यातून मॉडेल तयार करण्याऐवजी, टीम्स चेकपॉइंट डाउनलोड करू शकतात, ते डोमेन-विशिष्ट डेटावर फाईन-ट्यून करू शकतात आणि काही अयशस्वी प्रकरणांच्या (failure cases) आधारे त्याचे मूल्यमापन करू शकतात.
मॉडेल कुठे कमी पडू शकते
हे मॉडेल चार मोडॅलिटीज—मजकूर, प्रतिमा, व्हिडिओ आणि डॉक्युमेंट्स हाताळते—परंतु ते प्रत्येक संभाव्य इनपुट प्रकाराचा समावेश करत नाही.
पुढील काय पाहावे
थोडक्यात (Takeaway)
WeMM हे सिद्ध करते की जेव्हा उत्पादन मर्यादा लक्षात घेऊन बांधले जाते, तेव्हा मध्यम आकाराचे मल्टीमोडल एम्बेडिंग मॉडेल दैनंदिन क्वेरीज हाताळू शकते. डेव्हलपर्ससाठी संदेश स्पष्ट आहे: प्रत्यक्ष जगातील रिट्रिव्हल क्वालिटीला प्राधान्य द्या, वेक्टर डायमेंशन्स शक्य तितके लहान ठेवा आणि मोडॅलिटीजना एकाच एम्बेडिंग लेअरमध्ये एकत्रित करा. या निवडींमुळे लॅटन्सी कमी होऊ शकते, स्टोरेज खर्च कमी होऊ शकतो आणि सरतेशेवटी एंड-युजर्सना (end users) अधिक चांगला अनुभव मिळू शकतो.
