Tencent نے اس ہفتے WeMM-Embedding ماڈل متعارف کرایا ہے، جو کہ ایک 2 بلین پیرامیٹر والا ملٹی موڈل (multimodal) سسٹم ہے جو پہلے سے ہی WeChat کے سرچ، ری کمنڈیشن اور ای کامرس پائپ لائنز میں شامل ہے۔ یہ ریلیز اس لیے اہم ہے کیونکہ یہ ایک ایسا ماڈل دکھاتی ہے جو حقیقی دنیا میں بہترین ریٹریول (retrieval) کوالٹی، کم لیٹنسی (latency) اور چھوٹے انڈیکس سائز فراہم کرتا ہے۔

"ڈیپلائمنٹ اسٹوری" کے گرد ہائپ کی وجہ کیا ہے

زیادہ تر نئے AI ماڈلز چمکدار بینچ مارک ٹیبلز کے ساتھ آتے ہیں جو منتخب کردہ ڈیٹا سیٹس پر اسکورز کا موازنہ کرتے ہیں۔ وہ نمبر محققین کو اپنی بات ثابت کرنے میں مدد دیتے ہیں، لیکن وہ شاذ و نادر ہی ان میٹرکس میں تبدیل ہوتے ہیں جو مصنوعات کو طاقت دیتے ہیں: جیسے کہ ایک کوئری کتنی تیزی سے واپس آتی ہے، ایک انڈیکس کتنی میموری استعمال کرتا ہے، اور ماڈل شور والے (noisy) اور صارف کے تیار کردہ مواد کے ساتھ کتنی اچھی طرح نمٹتا ہے۔ WeMM پہلے دن سے ہی ایک پروڈکشن گریڈ کمپوننٹ بن کر اس منظر نامے کو بدل دیتا ہے۔ یہ کوئی لیب تجربہ نہیں ہے جو کسی ڈاؤن اسٹریم ٹیم کے اسے اپنانے کا انتظار کر رہا ہو؛ یہ پہلے سے ہی Channels، Moments اور ای کامرس کو طاقت دے رہا ہے۔

وہ تکنیکی پہلو جو ڈویلپرز کو نوٹ کرنے چاہئیں

  • حقیقی ملٹی موڈل ہینڈلنگ – یہ ماڈل ٹیکسٹ، تصاویر، ویڈیو فریمز اور دستاویز کے تھمب نیلز کو ایک ہی ایمبیڈنگ اسپیس (embedding space) میں شامل کرتا ہے۔ ایک صارف "sunset" ٹائپ کر سکتا ہے اور الگ الگ ٹیکسٹ-اونلی اور ویژن-اونلی پائپ لائنز کو جوڑے بغیر ایک مماثل ویڈیو کلپ، تصویر، یا نیوز آرٹیکل حاصل کر سکتا ہے۔

  • سائز اہمیت رکھتا ہے، لیکن اس طرح نہیں جیسا آپ سوچتے ہیں – 2 بلین پیرامیٹرز کے ساتھ، یہ ماڈل ان 9 بلین سے زائد پیرامیٹر والے ماڈلز کے مقابلے میں "چھوٹا" ہے جو لیڈر بورڈز پر حاوی ہیں۔ پھر بھی، یہ انٹرایکٹو سروسز کے لیے درکار لیٹنسی بجٹ پر پورا اترتا ہے۔ ایک ماڈل جو آپ کے ہارڈ ویئر کے مطابق ہو، وہ لائیو سسٹم میں ایک بڑے اور سست ماڈل سے بہتر کارکردگی دکھا سکتا ہے۔

  • Matryoshka ایمبیڈنگز ڈائمینشنل لچک فراہم کرتی ہیں – WeMM "Matryoshka" ایمبیڈنگز کو سپورٹ کرتا ہے، جس کا مطلب ہے کہ وہی نیٹ ورک مختلف لمبائی کے ویکٹرز (vectors) آؤٹ پٹ دے سکتا ہے، جیسے کہ 256 یا 512 ڈائمینشنز۔ ٹیسٹ سے پتہ چلتا ہے کہ 512 سے 256 ڈائمینشنز تک کم کرنے سے ریٹریول کی کارکردگی تقریباً مکمل برقرار رہتی ہے جبکہ میموری کا استعمال آدھا ہو جاتا ہے، جس سے اسٹوریج کے اخراجات براہ راست کم ہوتے ہیں اور نیئر ایسٹ نیبر (nearest-neighbor) سرچ تیز ہو جاتی ہے۔

ریٹریول سسٹم بنانے کے لیے تین عملی اصول

  1. اپنے ڈیٹا پر تصدیق کریں – بینچ مارکس صاف ستھرے ہوتے ہیں؛ جبکہ پروڈکشن ڈیٹا الجھا ہوا ہوتا ہے۔ اگر آپ کے صارفین اسکرین شاٹس، ہاتھ سے لکھے ہوئے نوٹس یا کم ریزولوشن والی ویڈیوز اپ لوڈ کرتے ہیں، تو اسے مکمل طور پر اپنانے کا فیصلہ کرنے سے پہلے اس مخصوص مکس پر ماڈل چلا کر دیکھیں۔

  2. ویکٹر کی لمبائی کو لاگت کے لیور کے طور پر لیں – بڑے ویکٹرز سیمیلرٹی سرچ کے لیے درکار کمپیوٹ اور انڈیکس کے لیے ڈسک اسپیس دونوں کو بڑھا دیتے ہیں۔ اس چھوٹی سے چھوٹی ڈائمینشن سے شروع کریں جو آپ کے کوالٹی ٹارگٹ پر پورا اترتی ہو۔ اس وقت تک اسکیل اپ نہ کریں جب تک آپ کو ریکال (recall) یا پریسیژن (precision) میں واضح کمی نظر نہ آئے۔

  3. علیحدہ پائپ لائنز سے بچیں – ہر موڈالٹی کے لیے الگ الگ انکوڈرز بنانے سے آپ کو فائنل رینکنگ اسٹیج کے لیے ویٹنگ اسکیمیں (weighting schemes) خود تیار کرنی پڑتی ہیں۔ ایک یونیورسل ایمبیڈنگ لیئر اس گلو کوڈ (glue code) کو ختم کر دیتی ہے، انجینئرنگ کے بوجھ کو کم کرتی ہے اور A/B ٹیسٹنگ کو سادہ بناتی ہے۔

وسیع تر اثرات

ان کمپنیوں کے لیے جو سرچ یا ری کمنڈیشن پر انحصار کرتی ہیں، ایمبیڈنگ ماڈل کا انتخاب انفراسٹرکچر کے اخراجات کا تعین کر سکتا ہے۔ جیسے جیسے صارفین کی توقعات بڑھتی ہیں، لیٹنسی بجٹ کم ہوتا جاتا ہے؛ ایک ایسا ماڈل جو فی کوئری چند ملی سیکنڈ بھی اضافہ کرے، وہ سروس کو قابل قبول کارکردگی کی حد سے باہر دھکیل سکتا ہے، جس سے صارفین کا نقصان (churn) ہو سکتا ہے۔

Tencent کا Apache 2.0 لائسنس کے تحت ویٹس (weights) کو اوپن سورس کرنے کا فیصلہ ڈویلپرز کے لیے لاگت کے رجحان کو بھی بدل دیتا ہے۔ پراپرائٹری معاہدوں پر بات چیت کرنے یا شروع سے ماڈل بنانے کے بجائے، ٹیمیں چیک پوائنٹ ڈاؤن لوڈ کر سکتی ہیں، اسے ڈومین سے متعلقہ ڈیٹا پر فائن ٹیون کر سکتی ہیں، اور چند ناکام کیسز کے خلاف اس کا جائزہ لے سکتی ہیں۔

جہاں ماڈل کمزور پڑ سکتا ہے

یہ ماڈل چار موڈالٹیز—ٹیکسٹ، تصاویر، ویڈیو، اور دستاویزات—کو ہینڈل کرتا ہے، لیکن ہر ممکنہ ان پٹ ٹائپ کا احاطہ نہیں کرتا۔

آگے کیا دیکھنا ہے

خلاصہ

WeMM یہ ثابت کرتا ہے کہ ایک مناسب سائز کا، ملٹی موڈل ایمبیڈنگ ماڈل روزانہ کی کوئریز کو سنبھال سکتا ہے جب اسے پروڈکشن کی حدود کو مدنظر رکھ کر بنایا جائے۔ ڈویلپرز کے لیے پیغام واضح ہے: حقیقی دنیا کی ریٹریول کوالٹی کو ترجیح دیں، ویکٹر ڈائمینشنز کو جتنا ممکن ہو سکے چھوٹا رکھیں، اور تمام موڈالٹیز کو ایک ہی ایمبیڈنگ لیئر میں یکجا کریں۔ یہ انتخاب لیٹنسی کو کم کر سکتے ہیں، اسٹوریج کے اخراجات کو گھٹا سکتے ہیں اور بالآخر اینڈ یوزرز کو بہتر تجربہ فراہم کر سکتے ہیں۔