Tencent ने इस सप्ताह WeMM-Embedding मॉडल पेश किया है, जो एक 2 बिलियन-पैरामीटर वाला मल्टीमॉडल (multimodal) सिस्टम है और पहले से ही WeChat के सर्च, रिकमेंडेशन और ई-कॉमर्स पाइपलाइनों में शामिल है। यह रिलीज़ इसलिए महत्वपूर्ण है क्योंकि यह एक ऐसा मॉडल दिखाता है जो वास्तविक दुनिया में बेहतरीन रिट्रीवल क्वालिटी (retrieval quality), कम लेटेंसी (low latency) और छोटे इंडेक्स साइज प्रदान करता है।
"डिप्लॉयमेंट स्टोरी" (deployment story) को लेकर इतनी चर्चा क्यों है
अधिकांश नए AI मॉडल चमकदार बेंचमार्क टेबल के साथ आते हैं जो क्यूरेटेड डेटासेट्स पर स्कोर की तुलना करते हैं। वे नंबर शोधकर्ताओं को अपनी बात साबित करने में मदद करते हैं, लेकिन वे शायद ही कभी उन मेट्रिक्स में बदल पाते हैं जो उत्पादों को शक्ति देते हैं: जैसे कि एक क्वेरी कितनी तेज़ी से वापस आती है, एक इंडेक्स कितनी मेमोरी का उपयोग करता है, और मॉडल शोर वाले (noisy), यूजर-जेनरेटेड कंटेंट के साथ कितनी अच्छी तरह तालमेल बिठाता है। WeMM पहले दिन से ही एक प्रोडक्शन-ग्रेड कंपोनेंट बनकर इस परिदृश्य को बदल देता है। यह कोई लैब एक्सपेरिमेंट नहीं है जो किसी डाउनस्ट्रीम टीम द्वारा अपनाए जाने का इंतज़ार कर रहा हो; यह पहले से ही Channels, Moments और ई-कॉमर्स को पावर दे रहा है।
तकनीकी पहलू जिन्हें डेवलपर्स को ध्यान में रखना चाहिए
सच्चा मल्टीमॉडल हैंडलिंग (True multimodal handling) – यह मॉडल टेक्स्ट, इमेज, वीडियो फ्रेम और डॉक्यूमेंट थंबनेल को एक ही एम्बेडिंग स्पेस (embedding space) में समाहित करता है। एक यूजर "sunset" टाइप कर सकता है और अलग-अलग टेक्स्ट-ओनली और विजन-ओनली पाइपलाइनों को जोड़ने के बजाय सीधे एक मैचिंग वीडियो क्लिप, फोटो या न्यूज़ आर्टिकल प्राप्त कर सकता है।
साइज मायने रखता है, लेकिन उस तरह से नहीं जैसा आप सोचते हैं – 2 बिलियन पैरामीटर्स के साथ, यह मॉडल उन 9 बिलियन से अधिक पैरामीटर्स वाले मॉडल्स की तुलना में "छोटा" है जो लीडरबोर्ड पर हावी हैं। फिर भी, यह इंटरैक्टिव सेवाओं के लिए आवश्यक लेटेंसी बजट को पूरा करता है। एक मॉडल जो आपके हार्डवेयर में फिट बैठता है, वह लाइव सिस्टम में बड़े और धीमे मॉडल से बेहतर प्रदर्शन कर सकता है।
Matryoshka एम्बेडिंग्स आयामों में लचीलापन (dimension flexibility) प्रदान करती हैं – WeMM "Matryoshka" एम्बेडिंग्स का समर्थन करता है, जिसका अर्थ है कि एक ही नेटवर्क अलग-अलग लंबाई के वेक्टर्स आउटपुट कर सकता है, जैसे कि 256 या 512 डायमेंशन। टेस्ट दिखाते हैं कि 512 से 256 डायमेंशन पर आने से मेमोरी उपयोग को आधा करते हुए लगभग पूरी रिट्रीवल परफॉरमेंस बनी रहती है, जिससे सीधे स्टोरेज बिल कम होते हैं और नियरस्ट-नेबर (nearest-neighbor) सर्च तेज़ हो जाती है।
रिट्रीवल सिस्टम बनाने के लिए तीन व्यावहारिक नियम
अपने स्वयं के डेटा पर जांचें (Validate on your own data) – बेंचमार्क साफ-सुथरे होते हैं; प्रोडक्शन डेटा अव्यवस्थित होता है। यदि आपके यूजर्स स्क्रीनशॉट, हाथ से लिखे नोट्स या लो-रेज़ोल्यूशन वीडियो अपलोड करते हैं, तो इसे उपयुक्त मानने से पहले ठीक उसी तरह के मिक्स पर मॉडल चलाकर देखें।
वेक्टर की लंबाई को लागत के लीवर (cost lever) के रूप में देखें – बड़े वेक्टर्स समानता खोज (similarity search) के लिए आवश्यक कंप्यूट और इंडेक्स के लिए डिस्क स्पेस, दोनों को बढ़ाते हैं। सबसे छोटे डायमेंशन से शुरुआत करें जो आपके क्वालिटी टारगेट को पूरा करता हो। केवल तभी स्केल अप करें जब आप रिकॉल (recall) या प्रिसिजन (precision) में स्पष्ट गिरावट देखें।
साइलो पाइपलाइनों (siloed pipelines) से बचें – प्रत्येक मोडैलिटी के लिए अलग-अलग एनकोडर बनाने से आपको अंतिम रैंकिंग स्टेज के लिए वेटिंग स्कीम्स (weighting schemes) खुद तैयार करनी पड़ती हैं। एक यूनिवर्सल एम्बेडिंग लेयर उस 'ग्लू कोड' (glue code) की ज़रूरत को खत्म कर देती है, इंजीनियरिंग ओवरहेड को कम करती है और A/B टेस्टिंग को सरल बनाती है।
व्यापक हित (The broader stakes)
उन कंपनियों के लिए जो सर्च या रिकमेंडेशन पर निर्भर हैं, एम्बेडिंग मॉडल का चुनाव इंफ्रास्ट्रक्चर खर्च तय कर सकता है। जैसे-जैसे यूजर की उम्मीदें बढ़ती हैं, लेटेंसी बजट कम होता जाता है; एक मॉडल जो प्रति क्वेरी कुछ मिलीसेकंड भी जोड़ता है, वह सेवा को स्वीकार्य प्रदर्शन की सीमा से बाहर धकेल सकता है, जिससे यूजर कम (churn) हो सकते हैं।
Apache 2.0 लाइसेंस के तहत वेट्स (weights) को ओपन-सोर्स करने के Tencent के फैसले से डेवलपर्स के लिए लागत का ग्राफ भी बदल जाता है। प्रोप्राइटरी कॉन्ट्रैक्ट्स पर बातचीत करने या शून्य से मॉडल बनाने के बजाय, टीमें चेकपॉइंट डाउनलोड कर सकती हैं, इसे डोमेन-विशिष्ट डेटा पर फाइन-ट्यून कर सकती हैं, और कुछ फेलियर केसेस (failure cases) के खिलाफ इसका मूल्यांकन कर सकती हैं।
मॉडल कहाँ कम पड़ सकता है
मॉडल चार मोडैलिटीज़—टेक्स्ट, इमेज, वीडियो और डॉक्यूमेंट्स—को हैंडल करता है, लेकिन यह हर संभव इनपुट टाइप को कवर नहीं करता है।
आगे क्या देखने की ज़रूरत है
निष्कर्ष (Takeaway)
WeMM यह दर्शाता है कि एक मध्यम आकार का, मल्टीमॉडल एम्बेडिंग मॉडल दैनिक क्वेरीज़ को संभाल सकता है जब इसे प्रोडक्शन की सीमाओं को ध्यान में रखकर बनाया जाता है। डेवलपर्स के लिए संदेश स्पष्ट है: वास्तविक दुनिया की रिट्रीवल क्वालिटी को प्राथमिकता दें, वेक्टर डायमेंशन को यथासंभव छोटा रखें, और मोडैलिटीज़ को एक ही एम्बेडिंग लेयर में समेकित करें। ये विकल्प लेटेंसी को कम कर सकते हैं, स्टोरेज लागत घटा सकते हैं और अंततः एंड-यूज़र्स को बेहतर अनुभव दे सकते हैं।
