ABSeeker ની નવી “Answer-Backtracked Credit Assignment” (ABC) પદ્ધતિ લાંબા ગાળાના સર્ચ એજન્ટ્સને માત્ર અંતિમ જવાબ માટે જ નહીં, પરંતુ દરેક વ્યક્તિગત સ્ટેપ માટે ક્રેડિટ મેળવવામાં મદદ કરે છે, અને તેની સાથે તાલીમ પામેલું 4 બિલિયન-પેરામીટર મોડેલ પહેલેથી જ ઘણા મોટા સ્પર્ધકોની બરાબરી કરી શકે છે અથવા તેમને વટાવી શકે છે.

આ સફળતા મહત્વની છે કારણ કે મોટાભાગના હાલના એજન્ટ્સનું મૂલ્યાંકન માત્ર કાર્યના અંતે કરવામાં આવે છે. જો અંતિમ જવાબ સાચો હોય, તો આખી પ્રક્રિયાને સારી માનવામાં આવે છે; જો તે ખોટો હોય, તો આખી શ્રેણીને ખરાબ માનવામાં આવે છે. આ 'બધું અથવા કંઈ નહીં' (all-or-nothing) પ્રકારનો પ્રતિસાદ વાસ્તવિક લર્નિંગ સિગ્નલને છુપાવે છે—જેમ કે સારા મૂવ્સ જેની પછી ભૂલ થઈ હોય, અથવા નકામી ક્લિક્સ જે નસીબજોગે સાચા પરિણામ તરફ દોરી જાય. ABSeeker નો અભિગમ આ નિયમોને બદલી નાખે છે.

જૂની પદ્ધતિ શા માટે અપૂરતી છે

જ્યારે કોઈ એજન્ટ સર્ચ કરે છે, કોડ લખે છે અથવા પુરાવા એકત્રિત કરે છે, ત્યારે તે સામાન્ય રીતે ઘણા કાર્યો કરે છે: ક્વેરીઝ આપવી, પેજ ખોલવા, કમાન્ડ્સ ચલાવવા, સિસ્ટમ સ્ટેટ તપાસવા વગેરે. પંદર-સ્ટેપની પ્રક્રિયામાં, એક નાની ભૂલ અંતિમ જવાબને બગાડી શકે છે, ભલે તેના પહેલાના સ્ટેપ્સ યોગ્ય હોય. તેનાથી વિપરીત, સાચા જવાબ સાથે સમાપ્ત થતી પ્રક્રિયા કદાચ માત્ર નસીબ પર આધારિત હોઈ શકે છે, જેમાં મોટાભાગના સ્ટેપ્સ કોઈ મૂલ્ય ઉમેરતા નથી. માત્ર અંતિમ પરિણામ પર તાલીમ આપવાથી મોડેલ આખી પ્રક્રિયાને એક સિંગલ 'બ્લેક બોક્સ' તરીકે લેવા માટે મજબૂર બને છે, જેનાથી તે શીખવું મુશ્કેલ બને છે કે કયા સબ-બિહેવિયર્સ ખરેખર ઉપયોગી છે.

આ પરિસ્થિતિ સોફ્ટવેર એન્જિનિયરિંગમાં ડીબગિંગ (debugging) જેવી જ છે. ડેવલપર્સ દરેક લાઇનને ટ્રેસ કરે છે, નિષ્ફળ જતી કોલને અલગ કરે છે અને તેને સુધારે છે. જોકે, એજન્ટ્સને તેમના આંતરિક કાર્યનો આવો કોઈ "રસીદ" (receipt) આપવામાં આવ્યો નથી. તે ઓડિટ ટ્રેલ વગર, ડેવલપર્સ એ કહી શકતા નથી કે સુધારો વધુ સારા તર્કને કારણે છે કે માત્ર સંજોગોવશાત, અને તેઓ ખરાબ આદતોને પદ્ધતિસર સુધારી શકતા નથી.

ABC ક્રેડિટ અસાઇનમેન્ટને કેવી રીતે ફરીથી ગોઠવે છે

Answer-Backtracked Credit Assignment સાચા અંતિમ જવાબથી ઉલટી દિશામાં કામ કરે છે. તે પહેલા એ આવશ્યક સંકેતોને બહાર કાઢે છે જેના પર જવાબ નિર્ભર છે—જેમ કે પુરાવાના ચોક્કસ ભાગો, મધ્યવર્તી પરિણામો અથવા સ્ટેટ ચેક્સ. ત્યારબાદ તે રેકોર્ડ કરેલા ટ્રેસ દ્વારા પાછળ જાય છે, અને તે સંકેતોના આધારે દરેક ક્રિયાને સ્કોર આપે છે. જે ક્રિયા સીધી રીતે જરૂરી સંકેતમાં ફાળો આપે છે તેને પોઝિટિવ ક્રેડિટ મળે છે; બિનજરૂરી અથવા નુકસાનકારક ક્રિયાને નેગેટિવ અથવા શૂન્ય સ્કોર મળે છે.

આ સ્કોરિંગ પર બે તાલીમ પદ્ધતિઓ (training regimes) આધારિત છે:

  • ABC-SFT (Supervised Fine-Tuning) લોસ ફંક્શનને ફરીથી વજન આપે છે જેથી વધુ ક્રેડિટ ધરાવતા સ્ટેપ્સ મોડેલને વધુ મજબૂત રીતે પ્રભાવિત કરે છે. મોડેલ એવા કાર્યોને પ્રાધાન્ય આપવાનું શીખે છે જે ઐતિહાસિક રીતે ઉપયોગી સંકેતો તરફ દોરી ગયા હોય.
  • ABC-GRPO (Gradient-based Reward Policy Optimization) દરેક સ્ટેપના સ્કોરને રિઇન્ફોર્સમેન્ટ લર્નિંગ માટે રિવોર્ડ સિગ્નલ તરીકે લે છે, જે સર્ચના તે ચોક્કસ ભાગોને મજબૂત બનાવે છે જેણે જવાબ મેળવવામાં મદદ કરી હતી.

બાઈનરી પાસ/ફેલ લેબલને યોગદાનના વિગતવાર નકશામાં ફેરવીને, ABC મોડેલને ઘણું સમૃદ્ધ લર્નિંગ સિગ્નલ આપે છે.

પ્રારંભિક પરિણામો ઘણું કહી જાય છે

સંશોધકોએ ABC ને એક મધ્યમ 4 બિલિયન-પેરામીટર મોડેલમાં લાગુ કર્યું, જે કોન્ટેક્સ્ટ-મેનેજમેન્ટ લેયરથી સજ્જ હતું જે સતત બદલાતા સર્ચ સ્ટેટને ટ્રેક રાખે છે. એવા બેન્ચમાર્ક ટાસ્ક માં જે પરંપરાગત રીતે ઘણા મોટા એજન્ટ્સને ફાયદો આપે છે, ત્યાં ABC-તાલીમ પામેલું મોડેલ કાં તો તે મોટા સિસ્ટમોની બરાબરી કરે છે અથવા તેમને વટાવી જાય છે. આ પ્રદર્શનમાં વધારો મોડેલનું કદ વધાર્યા વગર થયો છે, જે સૂચવે છે કે વધુ સારું ક્રેડિટ અસાઇનમેન્ટ કાચા પેરામીટર કાઉન્ટનું સ્થાન લઈ શકે છે.

મુખ્ય વાત સરળ છે: મોડેલને શું કામ કરી ગયું તેની સ્પષ્ટ રસીદ આપો, અને તે સમાન તાલીમ ડેટામાંથી વધુ મૂલ્ય મેળવી શકે છે.

વાસ્તવિક દુનિયાના એજન્ટ્સ માટે આનો અર્થ શું છે

કોઈપણ એજન્ટ જે મલ્ટી-સ્ટેપ કામ કરે છે—કોડિંગ આસિસ્ટન્ટ્સ, લિટરેચર-રિવ્યુ બોટ્સ, કસ્ટમર-સપોર્ટ ટૂલ્સ—તે તેના કાર્યોના ટ્રેસ પર આધાર રાખે છે. ABC દર્શાવે છે કે તે ટ્રેસને સાચવવો અને તેનું મૂલ્યાંકન કરવું એ માત્ર એક વધારાનું ફીચર નથી; તે અસરકારક લર્નિંગ માટે આવશ્યક છે.

  • કોડિંગ એજન્ટ્સ માટે પ્લાન, દરેક ઇશ્યુ કરેલ કમાન્ડ અને કોડને વેલિડેટ કરતા ટેસ્ટ રિઝલ્ટ્સને લોગ કરવાની જરૂર છે.
  • રિસર્ચ એજન્ટ્સ એ તેમણે મોકલેલી ક્વેરીઝ, તેમણે ખોલેલા સોર્સ અને તેમણે મેળવેલા પુરાવાઓને જાળવી રાખવા જોઈએ.
  • સપોર્ટ એજન્ટ્સ એ દરેક સ્ટેટ ચેક અને નિર્ણયના મુદ્દાઓને રેકોર્ડ કરવા જોઈએ જે ઉકેલ તરફ દોરી જાય છે.

જ્યારે આ ટ્રેસ ઉપલબ્ધ હોય છે, ત્યારે ABC ચોકસાઈથી ક્રેડિટ અસાઇન કરી શકે છે, જેનાથી મોડેલ સારી આદતોને મજબૂત બનાવી શકે છે અને નસીબજોગોથી મળેલી શોર્ટકટ્સને છોડી શકે છે, જે અન્યથા કૌશલ્ય તરીકે ભૂલથી માનવામાં આવી શકે છે.

વિરોધ પક્ષના મુદ્દાઓ અને વ્યવહારિક અવરોધો

ABC ના ફાયદા વધારાની જટિલતા સાથે આવે છે.

નિષ્કર્ષ

Answer-Backtracked Credit Assignment એ એજન્ટ્સને સર્ચ, કોડિંગ અને તર્ક કરવાનું કેવી રીતે શીખવવામાં આવે છે તે બાબતમાં સંપૂર્ણ પરિવર્તન લાવે છે. માત્ર અંતિમ પરિણામને બદલે, પ્રક્રિયા દરમિયાન લેવામાં આવેલા સાચા પગલાઓને પુરસ્કૃત કરીને, તે મધ્યમ કદના મોડેલને પણ ખૂબ મોટા મોડેલ્સ જેટલી જ અસરકારક રીતે શીખવામાં સક્ષમ બનાવે છે. જે લોકો એવા એજન્ટ્સ બનાવી રહ્યા છે જેમને બહુ-પગલાંવાળું (multi-step) કાર્ય કરવું પડે છે, તેમના માટે ટ્રેસ-સેન્ટ્રિક (trace-centric) તાલીમ પદ્ધતિ અપનાવવી એ વૈકલ્પિક નથી—તે વિશ્વસનીય, ઓડિટેબલ અને અંતે વધુ સ્માર્ટ AI તરફ જવાનો માર્ગ છે.