لماذا ابتعدت Netflix عن الميزات المصممة يدويًا

على مدار معظم تاريخها، اعتمد مسار التوصيات في Netflix على آلاف السمات المحددة يدويًا—وهي متجهات عددية تصف المستخدمين والعناوين وكل تفاعل بينهما. أمضى المهندسون أسابيع في ترجمة نوع جديد من المحتوى—مثل الرياضة المباشرة أو البودكاست أو الألعاب—إلى مجموعة جديدة من الميزات قبل أن يتمكن النظام من البدء في التوصية بها. كانت هذه العملية مكلفة، وهشة، ويصعب مزامنتها مع التوسع السريع في كتالوج المحتوى.

لم تكن النماذج اللغوية الكبيرة (LLMs) الجاهزة تعمل بشكل مباشر. فقد كانت تميل نحو العناوين الأكثر شعبية، وتتخيل أحيانًا عناصر غير موجودة، وتواجه صعوبة في فرض قواعد العمل التي تحافظ على سلامة وملاءمة التوصيات. لذلك، قامت Netflix ببناء مسار مخصص يعتمد على LLM يحافظ على نقاط قوة النموذج اللغوي مع احترام قيود الإنتاج.

داخل GenRec: مسار تدريب مكون من مرحلتين

يتكون GenRec من مرحلتين متميزتين:

  1. ضبط النموذج الأساسي (Base model fine-tuning) – تبدأ Netflix من نموذج لغوي مفتوح الأوزان وتقوم بضبطه بدقة بناءً على بيانات المشاهدة الداخلية. يعلم هذا النموذج مفردات الكتالوج وأنماط سلوك المستخدم دون تغيير بنيته الأساسية.
  2. ترتيب التوصيات (Recommendation ranking) – تحول جولة ثانية من التدريب النموذج الذي تم ضبطه بدقة إلى نظام ترتيب (ranker) يقوم بتقييم العناوين المرشحة لمستخدم معين. تقوم Netflix بتحديث هذه المرحلة بشكل متكرر ليبقى النموذج مواكبًا للإصدارات الجديدة والاتجاهات المتغيرة.

يكمن الاختلاف الجوهري عن النظام القديم في كيفية تغذية النموذج بسجل المستخدم. فبدلاً من ضغط جلسات المشاهدة في متجهات كثيفة، يقوم GenRec بترجمة كل تفاعل—مدة التشغيل، أو الإعجاب أو عدم الإعجاب، أو التوقف المبكر—إلى جمل باللغة الإنجليزية البسيطة. ثم يقرأ النموذج الجلسة بأكملها كحوار قصير، ملتقطًا التحولات الطفيفة في تفضيلات النوع أو الحالة المزاجية دون الحاجة إلى أي هندسة ميزات صريحة.

مكاسب الأداء والكفاءة

في تجربة استمرت أربعة أسابيع عرضت 10% من حركة مرور Netflix لـ GenRec، حقق النظام الجديد ارتفاعات ذات دلالة إحصائية عبر مجموعتين من المقاييس:

  • التفاعل قصير المدى – ارتفاع بنسبة 0.115% في إشارات النقر والمشاهدة الأساسية التي تقود التوصيات اليومية.
  • المقاييس الأساسية طويلة المدى – زيادة بنسبة 0.006% في معدلات الاحتفاظ بالمشتركين ودرجات الرضا العام التي تهم العمل التجاري أكثر من غيرها.

أما في الاختبارات غير المتصلة (Offline)، فقد تحسنت جودة الترتيب على مجموعة بيانات محجوزة بنسبة 1.6% مقارنة بالخط المرجعي للإنتاج. والأكثر إثارة للإعجاب هو كفاءة البيانات: تطلبت مرحلة التدريب الثانية حوالي 1/40 من الأمثلة المصنفة التي يحتاجها المسار التقليدي للوصول إلى نفس مستوى الأداء.

للحفاظ على تكاليف الحوسبة تحت السيطرة، تقوم Netflix بتشغيل النموذج باستخدام vLLM، وهو مكدس خدمة (serving stack) يقوم بتقييم كل مرشح في تمريرة أمامية واحدة (single forward pass) بدلاً من توليد النص. كما يطبق النظام تصفية صارمة بحيث تشغل الأحداث ذات الإشارات العالية فقط نافذة سياق النموذج، مما يقلل من الرموز (tokens) غير الضرورية ويقلل من زمن الاستجابة (latency).

ماذا يعني التحول من «الميزات» إلى «السياق»

يعد GenRec جزءًا من حركة أوسع حيث تحل «هندسة السياق» محل الميزات المصممة يدويًا. فبدلاً من تصميم بنية مخصصة لكل مهمة توصية، يقرر المهندسون الإشارات التي سيتم إدراجها في مطالبة نصية (text prompt) ويتركون النموذج اللغوي يستنتج منها. يسرع هذا النهج عملية دمج أنواع المحتوى الجديدة: حيث يمكن وصف حلقة بودكاست أو مباراة بث مباشر في جملة واحدة وإضافتها فورًا إلى مجموعة التوصيات، متجاوزة بذلك عملية تحديد الميزات التي قد تستغرق شهورًا.

العقبات المتبقية

ليست أنظمة التوصية القائمة على LLM حلاً سحريًا. فميلها إلى المبالغة في التأكيد على العناصر الشائعة لا يزال يسبب انحيازًا في الكتالوج، كما أن الحاجة إلى وحدات معالجة رسومات (GPUs) قوية ترفع التكاليف التشغيلية. وحتى مع استخدام vLLM والتصفية الصارمة، فإن تشغيل نموذج لغوي كبير بمقياس Netflix يتطلب هندسة دقيقة لتحقيق أهداف زمن الاستجابة.