શા માટે Netflix એ હેન્ડ-ક્રાફ્ટેડ (hand-crafted) ફીચર્સથી અંતર રાખ્યું

તેના ઇતિહાસના મોટાભાગના સમય દરમિયાન, Netflix ની રેકમેન્ડેશન પાઇપલાઇન હજારો મેન્યુઅલી વ્યાખ્યાયિત એટ્રિબ્યુટ્સ (attributes) પર આધારિત હતી—જે ન્યુમેરિક વેક્ટર્સ (numeric vectors) હતા જે વપરાશકર્તાઓ, ટાઇટલ્સ અને તેમની વચ્ચેની દરેક ક્રિયાને વર્ણવે છે. એન્જિનિયરોએ સિસ્ટમ દ્વારા નવા કન્ટેન્ટ પ્રકારો—લાઇવ સ્પોર્ટ્સ, પોડકાસ્ટ અથવા ગેમ્સ—ની ભલામણ કરવાનું શરૂ કરતા પહેલા તેને ફીચર્સના નવા સેટમાં રૂપાંતરિત કરવામાં અઠવાડિયા વિતાવ્યા હતા. આ પ્રક્રિયા ખર્ચાળ, નાજુક અને કેટલોગના ઝડપી વિસ્તરણ સાથે સુમેળ સાધવામાં મુશ્કેલ હતી.

તૈયાર ઉપલબ્ધ લાર્જ લેંગ્વેજ મોડલ્સ (LLMs) સીધી રીતે કામ કરી શકતા નહોતા. તેઓ સૌથી લોકપ્રિય ટાઇટલ્સ તરફ ઝુકાવ ધરાવતા હતા, ક્યારેક અસ્તિત્વમાં ન હોય તેવી વસ્તુઓ વિશે ભ્રામક માહિતી (hallucinate) આપતા હતા, અને ભલામણોને સુરક્ષિત અને સુસંગત રાખતા બિઝનેસ નિયમોનું પાલન કરવામાં મુશ્કેલી અનુભવતા હતા. તેથી Netflix એ એક ખાસ (bespoke) LLM-આધારિત પાઇપલાઇન બનાવી જે પ્રોડક્શન મર્યાદાઓને ધ્યાનમાં રાખીને લેંગ્વેજ મોડલની શક્તિઓને જાળવી રાખે છે.

GenRec ની અંદર: બે તબક્કાની ટ્રેનિંગ પાઇપલાઇન

GenRec બે અલગ તબક્કાઓ ધરાવે છે:

  1. Base model fine-tuning – Netflix એક ઓપન-વેઇટ (open-weight) લેંગ્વેજ મોડલથી શરૂઆત કરે છે અને તેને આંતરિક વ્યુઇંગ ડેટા પર fine-tune કરે છે. આ મોડલના મુખ્ય આર્કિટેક્ચરમાં ફેરફાર કર્યા વિના તેને કેટલોગની શબ્દાવલિ અને વપરાશકર્તાના વર્તણૂકના પેટર્ન શીખવે છે.
  2. Recommendation ranking – ટ્રેનિંગનો બીજો રાઉન્ડ fine-tuned મોડલને એક ranker માં ફેરવે છે જે આપેલ વપરાશકર્તા માટે ઉમેદવાર ટાઇટલ્સને સ્કોર આપે છે. Netflix આ તબક્કાને વારંવાર રિફ્રેશ કરે છે જેથી મોડલ નવા રિલીઝ અને બદલાતા ટ્રેન્ડ્સ સાથે અપ-ટૂ-ડેટ રહે.

જૂની સિસ્ટમથી મુખ્ય તફાવત એ છે કે વપરાશકર્તાનો ઇતિહાસ મોડલને કેવી રીતે આપવામાં આવે છે. વૉચ સેશન્સને ડેન્સ વેક્ટર્સ (dense vectors) માં સંકુચિત કરવાને બદલે, GenRec દરેક ક્રિયા—પ્લે સમયગાળો, thumbs-up અથવા thumbs-down, વહેલું બંધ કરવું—ને સાદા અંગ્રેજી વાક્યોમાં રૂપાંતરિત કરે છે. ત્યારબાદ મોડલ આખા સેશનને એક ટૂંકા સંવાદ તરીકે વાંચે છે, જે કોઈપણ સ્પષ્ટ ફીચર એન્જિનિયરિંગ વગર જનર (genre) પસંદગી અથવા મૂડમાં આવતા સૂક્ષ્મ ફેરફારોને પકડી લે છે.

પ્રદર્શન અને કાર્યક્ષમતામાં વધારો

ચાર અઠવાડિયાના પ્રયોગમાં, જેમાં Netflix ના 10% ટ્રાફિકને GenRec સાથે જોડવામાં આવ્યો હતો, નવા સિસ્ટમે બે મેટ્રિક પરિવારોમાં આંકડાકીય રીતે નોંધપાત્ર વધારો દર્શાવ્યો:

  • Short-term engagement – દૈનિક ભલામણોને ચલાવતા પ્રાથમિક ક્લિક-થ્રુ (click-through) અને વૉચ-ટાઇમ સિગ્નલ્સમાં 0.115% નો વધારો.
  • Long-term core metrics – સબ્સ્ક્રાઇબર-રિટેન્શન (subscriber-retention) અને એકંદર સંતોષના સ્કોરમાં 0.006% નો વધારો, જે વ્યવસાય માટે સૌથી વધુ મહત્વપૂર્ણ છે.

ઓફલાઇન, પ્રોડક્શન બેઝલાઇન સાથે સરખામણીમાં, હોલ્ડ-આઉટ ડેટાસેટ પર રેન્કિંગની ગુણવત્તામાં 1.6% નો સુધારો થયો હતો. વધુ આશ્ચર્યજનક બાબત ડેટા કાર્યક્ષમતા છે: સમાન પ્રદર્શન સ્તર સુધી પહોંચવા માટે પરંપરાગત પાઇપલાઇનને જેટલા લેબલ કરેલા ઉદાહરણોની જરૂર હોય છે, તેના કરતા બીજા ટ્રેનિંગ સ્ટેજને અંદાજે 1/40 ભાગના ઉદાહરણોની જ જરૂર પડી હતી.

કમ્પ્યુટ બિલને નિયંત્રણમાં રાખવા માટે, Netflix મોડલને vLLM સાથે ચલાવે છે, જે એક સર્વિંગ સ્ટેક છે જે ટેક્સ્ટ જનરેટ કરવાને બદલે સિંગલ ફોરવર્ડ પાસમાં દરેક ઉમેદવારને સ્કોર આપે છે. સિસ્ટમ આક્રમક ફિલ્ટરિંગનો પણ ઉપયોગ કરે છે જેથી માત્ર હાઇ-સિગ્નલ ઇવેન્ટ્સ જ મોડલના કોન્ટેક્સ્ટ વિન્ડોમાં રહે, જેનાથી બિનજરૂરી ટોકન્સ ઘટાડી શકાય અને લેટન્સી (latency) ઓછી કરી શકાય.

"ફીચર્સ" થી "કોન્ટેક્સ્ટ" તરફના બદલાવનો અર્થ શું છે

GenRec એ એક વ્યાપક ચળવળનો ભાગ છે જ્યાં "કોન્ટેક્સ્ટ એન્જિનિયરિંગ" (context engineering) હેન્ડ-ક્રાફ્ટેડ ફીચર્સનું સ્થાન લે છે. દરેક રેકમેન્ડેશન કાર્ય માટે ખાસ આર્કિટેક્ચર ડિઝાઇન કરવાને બદલે, એન્જિનિયરો નક્કી કરે છે કે ટેક્સ્ટ પ્રોમ્પ્ટમાં કયા સિગ્નલ્સ ઉમેરવા અને લેંગ્વેજ મોડલને તેના પર વિચાર કરવા દે છે. આ અભિગમ નવા કન્ટેન્ટ પ્રકારોના ઓનબોર્ડિંગને ઝડપી બનાવે છે: પોડકાસ્ટ એપિસોડ અથવા લાઇવ-સ્ટ્રીમ કરેલી ગેમને એક વાક્યમાં વર્ણવી શકાય છે અને તે તરત જ રેકમેન્ડેશન પૂલમાં જોડાઈ શકે છે, જેનાથી મહિનાઓ લાંબો ફીચર-ડેફિનેશન સ્પ્રીન્ટ ટાળી શકાય છે.

બાકી રહેલા અવરોધો

LLM-આધારિત રેકમેન્ડર્સ કોઈ જાદુઈ લાકડી (silver bullet) નથી. લોકપ્રિય વસ્તુઓ પર વધુ ભાર મૂકવાની તેમની વૃત્તિ હજુ પણ કેટલોગમાં પક્ષપાત પેદા કરે છે, અને શક્તિશાળી GPUs ની જરૂરિયાત ઓપરેશનલ ખર્ચ વધારે છે. vLLM અને આક્રમક ફિલ્ટરિંગ હોવા છતાં, Netflix ના સ્કેલ પર લાર્જ લેંગ્વેજ મોડલ સર્વ કરવા માટે લેટન્સી લક્ષ્યોને પહોંચી વળવા માટે સાવચેત એન્જિનિયરિંગની જરૂર પડે છે.