أطلقت Tencent نموذج WeMM-Embedding هذا الأسبوع، وهو نظام متعدد الوسائط (multimodal) يحتوي على 2 مليار معلمة (parameter)، وهو مدمج بالفعل في مسارات البحث والتوصية والتجارة الإلكترونية في WeChat. ويكتسب هذا الإصدار أهمية كبرى لأنه يقدم نموذجًا يحقق جودة استرجاع في العالم الحقيقي، وزمن انتقال (latency) منخفض، وأحجام فهرسة صغيرة.
لماذا يثير "التحول نحو التطبيق العملي" كل هذا الضجيج
تصل معظم نماذج الذكاء الاصطناعي الجديدة مع جداول اختبارات مرجعية (benchmarks) براقة تقارن النتائج عبر مجموعات بيانات منسقة. تساعد هذه الأرقام الباحثين على إثبات وجهات نظرهم، لكنها نادرًا ما تترجم إلى المقاييس التي تشغل المنتجات الفعلية: مدى سرعة استجابة الاستعلام، وكمية الذاكرة التي يستهلكها الفهرس، ومدى قدرة النموذج على التعامل مع المحتوى غير المنظم الذي ينشئه المستخدمون. يغير WeMM قواعد اللعبة بكونه مكونًا جاهزًا للإنتاج (production-grade) منذ اليوم الأول؛ فهو ليس مجرد تجربة مخبرية تنتظر فريقًا آخر لتبنيها، بل هو المحرك الفعلي لخدمات Channels وMoments والتجارة الإلكترونية.
الجوانب التقنية التي يجب على المطورين ملاحظتها
معالجة حقيقية متعددة الوسائط – يستوعب النموذج النصوص والصور وإطارات الفيديو والصور المصغرة للمستندات في مساحة تضمين (embedding space) واحدة. يمكن للمستخدم كتابة "غروب الشمس" واسترجاع مقطع فيديو مطابق، أو صورة، أو مقال إخباري دون الحاجة إلى دمج مسارات منفصلة مخصصة للنصوص فقط وأخرى للرؤية فقط.
الحجم مهم، ولكن ليس بالطريقة التي تظنها – بـ 2 مليار معلمة، يُعد النموذج "صغيرًا" مقارنة بالنماذج التي تتجاوز 9 مليارات معلمة والتي تهيمن على لوحات الصدارة. ومع ذلك، فإنه يلبي ميزانيات زمن الانتقال (latency budgets) المطلوبة للخدمات التفاعلية. فالنموذج الذي يناسب أجهزتك يمكن أن يتفوق على نموذج أكبر وأبطأ في الأنظمة الحية.
تضمينات Matryoshka تمنح مرونة في الأبعاد – يدعم WeMM تضمينات "Matryoshka"، مما يعني أن الشبكة نفسها يمكنها إنتاج نواقل (vectors) بأطوال مختلفة، مثل 256 أو 512 بُعدًا. وتظهر الاختبارات أن خفض الأبعاد من 512 إلى 256 يحافظ على كامل أداء الاسترجاع تقريبًا مع تقليل استخدام الذاكرة إلى النصف، مما يقلل مباشرة من تكاليف التخزين ويسرع عمليات البحث عن الجيران الأقرب (nearest-neighbor searches).
ثلاث قواعد عملية لبناء أنظمة الاسترجاع
التحقق باستخدام بياناتك الخاصة – الاختبارات المرجعية نظيفة، أما بيانات الإنتاج فغير منظمة. إذا كان مستخدموك يرفعون لقطات شاشة، أو ملاحظات مكتوبة بخط اليد، أو فيديوهات منخفضة الدقة، فقم بتشغيل النموذج على هذا المزيج تحديدًا قبل أن تقرر أنه مناسب.
تعامل مع طول المتجه كأداة للتحكم في التكلفة – تزيد المتجهات الأكبر من كل من الحوسبة المطلوبة للبحث عن التشابه ومساحة القرص للفهرس. ابدأ بأصغر بُعد يلبي هدف الجودة الخاص بك، وقم بزيادته فقط عندما تلاحظ انخفاضًا واضحًا في الاستدعاء (recall) أو الدقة (precision).
تجنب المسارات المنعزلة – إن بناء مشفرات (encoders) منفصلة لكل وسيط يجبرك على تصميم مخططات أوزان يدويًا لمرحلة التصنيف النهائية. تلغي طبقة التضمين الموحدة الحاجة إلى أكواد الربط هذه، وتقلل من الأعباء الهندسية وتجعل اختبار A/B أبسط.
الرهانات الأوسع
بالنسبة للشركات التي تعتمد على البحث أو التوصية، فإن اختيار نموذج التضمين يمكن أن يحدد حجم الإنفاق على البنية التحتية. تضيق ميزانيات زمن الانتقال مع ارتفاع توقعات المستخدمين؛ فالنموذج الذي يضيف حتى بضعة أجزاء من الثانية لكل استعلام يمكن أن يدفع الخدمة إلى ما دون مستوى الأداء المقبول، مما يؤدي إلى فقدان العملاء (churn).
كما أن قرار Tencent بجعل الأوزان مفتوحة المصدر بموجب ترخيص Apache 2.0 يغير منحنى التكلفة للمطورين. فبدلاً من التفاوض على عقود ملكية أو بناء نموذج من الصفر، يمكن للفرق تنزيل نقطة التحقق (checkpoint)، وضبطها بدقة (fine-tune) على بيانات خاصة بالمجال، وتقييمها مقابل مجموعة من حالات الفشل.
أين قد يقصر النموذج
يتعامل النموذج مع أربعة وسائط — النصوص والصور والفيديو والمستندات — ولكنه لا يغطي كل نوع ممكن من المدخلات.
ما يجب مراقبته لاحقًا
الخلاصة
يثبت WeMM أن نموذج التضمين متعدد الوسائط متوسط الحجم يمكنه التعامل مع الاستعلامات اليومية عندما يتم بناؤه مع مراعاة قيود الإنتاج. بالنسبة للمطورين، الرسالة واضحة: أعطِ الأولوية لجودة الاسترجاع في العالم الحقيقي، وحافظ على أبعاد المتجهات أصغر ما يمكن، وادمج الوسائط في طبقة تضمين واحدة. هذه الاختيارات يمكن أن تقلل زمن الانتقال، وتخفض تكاليف التخزين، وتؤدي في النهاية إلى تقديم تجربة أفضل للمستخدمين النهائيين.
