Sawan Dasari દ્વારા કરવામાં આવેલ એક નવા arXiv અભ્યાસમાં, જે 4,000 પ્રયોગો પર આધારિત છે, તે દર્શાવે છે કે મોટાભાગના મશીન-લર્નિંગ વર્કલોડ્સ માટે એક અનુમાનિત પિરિયોડિક-રીટ્રેનિંગ (periodic-retraining) શેડ્યૂલ અત્યાધુનિક ડ્રિફ્ટ-ડિટેક્શન (drift-detection) પાઇપલાઇન્સ કરતા વધુ સારું પરિણામ આપે છે—સિવાય કે મોડેલ ઇન્ક્રીમેન્ટલી (incrementally) શીખી શકતું હોય.

રીટ્રેનિંગનો પ્રશ્ન અત્યારે શા માટે મહત્વનો છે

એકવાર મોડેલ તૈનાત (deploy) થઈ જાય પછી, વાસ્તવિક દુનિયાનો ડેટા ભાગ્યે જ સ્થિર રહે છે. ગ્રાહકોની પસંદગીઓ બદલાય છે, છેતરપિંડીની પદ્ધતિઓ બદલાય છે અને સેન્સર રીડિંગ્સમાં ડ્રિફ્ટ આવે છે. આ કોન્સેપ્ટ ડ્રિફ્ટ (concept drift) આગાહી કરવાની ક્ષમતાને ઝડપથી ઘટાડી શકે છે, જે આવક પેદા કરતી સિસ્ટમને જવાબદારી (liability) માં બદલી શકે છે. કંપનીઓ સામાન્ય રીતે ત્રણમાંથી એક રીતે પ્રતિસાદ આપે છે: નિશ્ચિત સમયપત્રક પર રીટ્રેનિંગ કરવું, જ્યારે ભૂલની મર્યાદા (error threshold) ઓળંગાય ત્યારે રીટ્રેનિંગ શરૂ કરવી, અથવા ડેટાના ફેરફારોને ઓળખતી ડ્રિફ્ટ-ડિટેક્શન અલ્ગોરિધમ ચલાવવી. દરેક અભિગમ કમ્પ્યુટ, એન્જિનિયરિંગ પ્રયાસ અને લેટન્સી બજેટનો વપરાશ કરે છે, છતાં ઉદ્યોગમાં કયો અભિગમ ખરેખર અસરકારક છે તે અંગે બહુ ઓછી સહમતિ છે.

અભ્યાસે શેની તુલના કરી

સંશોધને સિન્થેટિક અને વાસ્તવિક ડેટાસેટ્સના વિશાળ સેટ પર ચાર નીતિઓનું મૂલ્યાંકન કર્યું:

  1. કોઈ રીટ્રેનિંગ નહીં (No retraining) – મોડેલ તેના મૂળ તાલીમ ડેટા પર કાયમ માટે ચાલે છે.
  2. પિરિયોડિક રીટ્રેનિંગ (Periodic retraining) – મોડેલો નિશ્ચિત શેડ્યૂલ (દૈનિક, સાપ્તાહિક, વગેરે) પર રિફ્રેશ કરવામાં આવે છે.
  3. એરર-થ્રેશોલ્ડ ટ્રિગરિંગ (Error-threshold triggering) – જ્યારે પરફોર્મન્સ મેટ્રિક પૂર્વ-નિર્ધારિત મર્યાદા કરતા વધી જાય ત્યારે જ રીટ્રેનિંગ શરૂ થાય છે.
  4. ડ્રિફ્ટ-ડિટેક્શન (Drift-detection) – એક અલ્ગોરિધમ આંકડાકીય ફેરફારો માટે આવતા ડેટાનું નિરીક્ષણ કરે છે અને ડ્રિફ્ટ જણાય ત્યારે રીટ્રેનિંગ શરૂ કરે છે.

ટીમે એવા મોડેલો પર દરેક નીતિનું પરીક્ષણ કર્યું જે કાં તો ઇન્ક્રીમેન્ટલ લર્નિંગને સપોર્ટ કરે છે (તેઓ નવા ડેટા સાથે સતત અપડેટ થઈ શકે છે) અથવા કરતા નથી (તેમને સંપૂર્ણ રીટ્રેનિંગની જરૂર પડે છે).

આર્કિટેક્ચર નીતિ કરતા વધુ મહત્વનું છે

જ્યારે મોડેલ ઇન્ક્રીમેન્ટલ લર્નિંગને સપોર્ટ કરે છે, ત્યારે અભ્યાસમાં જાણવા મળ્યું કે રીટ્રેનિંગ નીતિનું બહુ મહત્વ રહેતું નથી—મોડેલ સતત તાજા ડેટાનો સમાવેશ કરે છે અને ચોકસાઈ જાળવી રાખે છે. તેનાથી વિપરીત, સ્ટેટિક-ટ્રેનિંગ મોડેલો માટે, નીતિની પસંદગી પ્રયોગો દરમિયાન ચોકસાઈમાં 15 થી 55 ટકા પોઈન્ટ્સનો તફાવત લાવે છે. બીજા શબ્દોમાં કહીએ તો, મોડેલની તરત જ શીખવાની ક્ષમતા પ્રભાવી છે; શેડ્યૂલ ત્યારે જ નિર્ણાયક બને છે જ્યારે તે ક્ષમતાનો અભાવ હોય.

સ્ટેટિક મોડેલો માટે સરળ પદ્ધતિ સ્માર્ટ પદ્ધતિ કરતા વધુ સારી છે

જે મોડેલો ઇન્ક્રીમેન્ટલી શીખી શકતા નથી, તેમના માટે પિરિયોડિક શેડ્યૂલ એરર-થ્રેશોલ્ડ અને ડ્રિફ્ટ-ડિટેક્શન બંને પદ્ધતિઓ કરતા સતત શ્રેષ્ઠ સાબિત થયું, પછી ભલે ડ્રિફ્ટ અચાનક (ડિસ્ટ્રિબ્યુશનમાં તીવ્ર ફેરફાર) હોય કે ધીમો (ધીમો વિકાસ) હોય. "સ્માર્ટ" પાઇપલાઇન્સ માટે વધારાના મોનિટરિંગ ઇન્ફ્રાસ્ટ્રક્ચર અને ટ્યુનિંગની જરૂર હતી, અને તેઓ લેટન્સીને વળતર આપવા માટે પૂરતા વહેલા ડ્રિફ્ટ પકડી શકતા નહોતા. અનુમાનિતતા (Predictability) નિર્ણાયક ફાયદો સાબિત થઈ: ટીમો અગાઉથી સંસાધનો ફાળવી શકતી હતી અને રિએક્ટિવ સિસ્ટમ્સમાં રહેલા "રાહ જુઓ અને જુઓ" ના વિલંબથી બચી શકતી હતી.

કમ્પ્યુટ બજેટ અને લેટન્સી અવિભાજ્ય છે

રીટ્રેનિંગ મફત નથી. પ્રયોગોએ એકંદર કમ્પ્યુટ બજેટ પર રીટ્રેનિંગના સમયગાળાની અસર માપી છે. જ્યારે લેટન્સી અને બજેટને સ્વતંત્ર રીતે મોડેલ કરવામાં આવ્યા, ત્યારે ટીમો પાસે અપેક્ષિત રીટ્રેનિંગ ક્ષમતાના લગભગ અડધા જ સંસાધનો બાકી રહ્યા—લાંબા તાલીમ સમયગાળાના છુપા ખર્ચને કારણે ઇન્ફરન્સ (inference) માટે ફાળવેલા સંસાધનો વપરાઈ ગયા. બોધપાઠ સ્પષ્ટ છે: કોઈપણ રીટ્રેનિંગ વ્યૂહરચનાનું મૂલ્યાંકન તેની સમય અને કમ્પ્યુટ કિંમત સાથે કરો, માત્ર અલગ ચોકસાઈ વધારવાના સાધન તરીકે નહીં.

આ તારણો વાસ્તવિક દુનિયાના ઉપયોગના કિસ્સાઓમાં કેવી રીતે લાગુ પડે છે

  • ફ્રોડ ડિટેક્શન (Fraud detection) – છેતરપિંડીના પેટર્ન ઝડપથી બદલાય છે, પરંતુ અભ્યાસ સૂચવે છે કે કસ્ટમ ડ્રિફ્ટ-ડિટેક્શન પાઇપલાઇન બનાવવાથી વધુ વિશ્વસનીય પિરિયોડિક કેડન્સ (દા.ત., દરરોજ રાત્રે) છે જે હુમલાઓ પાછળ રહી શકે છે.
  • પર્સનલાઇઝેશન (Personalization) – અહીં પ્રાથમિકતા મોડેલ આર્કિટેક્ચરની છે. ઇન્ક્રીમેન્ટલ-લર્નિંગ અલ્ગોરિધમ (online gradient updates, streaming factorization, વગેરે) તૈનાત કરો. જ્યારે મોડેલ સતત નવા ઇન્ટરેક્શનને ગ્રહણ કરી શકે છે, ત્યારે શેડ્યૂલ અંગેની ચર્ચા સમાપ્ત થઈ જાય છે.
  • ફોરકાસ્ટિંગ (Forecasting) – ટાઈમ-સીરીઝ ફોરકાસ્ટ માટે ઘણીવાર હેવીવેઇટ મોડેલો (દા.ત., deep LSTMs) ની જરૂર પડે છે જે ઇન્ક્રીમેન્ટલી અપડેટ કરી શકાતા નથી. આવા કિસ્સાઓમાં, બજેટ પ્લાનિંગમાં સંપૂર્ણ તાલીમ વિન્ડોનો સમાવેશ થવો જોઈએ; અન્યથા, સિસ્ટમ તે ડેટાથી પાછળ રહી જશે જેની તે આગાહી કરવાનો પ્રયાસ કરે છે.

નિષ્કર્ષ

જો તમારું મોડેલ ઇન્ક્રીમેન્ટલી શીખી શકતું હોય, તો તે ક્ષમતામાં રોકાણ કરો અને ડેટાને વહેવા દો. જો તે ન કરી શકતું હોય, તો જટિલ ડ્રિફ્ટ-ડિટેક્શન પાઇપલાઇન્સ છોડી દો અને કમ્પ્યુટ અને લેટન્સી ખર્ચને અગાઉથી ધ્યાનમાં રાખીને નિયમિત, અનુમાનિત રીટ્રેનિંગ સમયપત્રક અપનાવો. હજારો પ્રયોગો દ્વારા સમર્થિત સૌથી સરળ અભિગમ, ઓવર-એન્જિનિયર્ડ સોલ્યુશન્સના છુપા ખર્ચ વિના ઉચ્ચ ચોકસાઈ આપે છે.