ABSeeker ची नवीन “Answer-Backtracked Credit Assignment” (ABC) पद्धत लाँग-हॉरायझन सर्च एजंट्सना (long-horizon search agents) केवळ अंतिम उत्तराऐवजी प्रत्येक वैयक्तिक पायरीसाठी क्रेडिट मिळवून देते, आणि या पद्धतीने प्रशिक्षित केलेले ४ अब्ज पॅरामीटर असलेले मॉडेल आधीच मोठ्या स्पर्धकांच्या बरोबरीने किंवा त्यांच्यापेक्षा सरस कामगिरी करू शकते.

हा शोध महत्त्वाचा आहे कारण सध्याचे बहुतेक एजंट्स केवळ कार्याच्या शेवटी तपासले जातात. जर अंतिम उत्तर बरोबर असेल तर संपूर्ण प्रक्रिया 'चांगली' मानली जाते; जर ते चुकीचे असेल तर संपूर्ण क्रम 'वाईट' मानला जातो. हा 'सर्व किंवा काहीच नाही' (all-or-nothing) असा फीडबॅक खरा लर्निंग सिग्नल लपवून ठेवतो—जसे की एखादी चांगली कृती ज्यानंतर चुकून चूक झाली, किंवा काही निरुपयोगी क्लिक्स ज्यामुळे योगायोगाने योग्य निकाल मिळाला. ABSeeker चा दृष्टिकोन हा नियम बदलतो.

जुनी पद्धत अपुरी का पडते

जेव्हा एखादा एजंट शोध घेतो, कोड लिहितो किंवा पुरावे गोळा करतो, तेव्हा तो सहसा अनेक कृती करतो: क्वेरी पाठवणे, पेजेस उघडणे, कमांड्स चालवणे, सिस्टमची स्थिती तपासणे इत्यादी. पंधरा पायऱ्यांच्या प्रक्रियेत, जरी आधीच्या पायऱ्या योग्य असल्या तरी, एक चुकीची पायरी अंतिम उत्तर बिघडवू शकते. याउलट, योग्य उत्तराने संपलेली प्रक्रिया केवळ नशिबावर अवलंबून असू शकते, ज्यामध्ये बहुतेक पायऱ्यांचे कोणतेही मूल्य नसते. केवळ अंतिम निकालावर आधारित प्रशिक्षण मॉडेलला संपूर्ण प्रक्रियेकडे (trajectory) एक 'ब्लॅक बॉक्स' म्हणून पाहण्यास भाग पाडते, ज्यामुळे नेमके कोणते उप-वर्तन (sub-behaviors) खरोखर उपयुक्त आहेत हे शिकणे कठीण होते.

ही परिस्थिती सॉफ्टवेअर इंजिनिअरिंगमधील 'डीबगिंग' (debugging) सारखी आहे. डेव्हलपर्स प्रत्येक ओळ तपासतात, त्रुटी शोधतात आणि ती सुधारतात. मात्र, एजंट्सना त्यांच्या अंतर्गत कामाचा असा कोणताही तुलनात्मक "पावती" (receipt) किंवा पुरावा दिलेला नसतो. त्या ऑडिट ट्रेलशिवाय, सुधारणा ही चांगल्या तर्कशक्तीमुळे झाली आहे की केवळ योगायोगाने, हे डेव्हलपर्स सांगू शकत नाहीत आणि ते वाईट सवयी पद्धतशीरपणे सुधारू शकत नाहीत.

ABC क्रेडिट असाइनमेंट कशी सुधारते

Answer-Backtracked Credit Assignment हे योग्य अंतिम उत्तरापासून उलट दिशेने काम करते. हे प्रथम उत्तरासाठी आवश्यक असलेले महत्त्वाचे संकेत (clues) शोधते—जसे की विशिष्ट पुरावे, मध्यवर्ती निकाल किंवा स्टेट चेक्स. त्यानंतर, ते रेकॉर्ड केलेल्या ट्रॅस (trace) मधून मागे जाते आणि प्रत्येक कृतीला त्या संकेतांच्या आधारे गुण देते. ज्या कृतीने आवश्यक संकेतांमध्ये थेट योगदान दिले आहे, तिला सकारात्मक क्रेडिट मिळते; तर निरुपयोगी किंवा हानिकारक कृतीला नकारात्मक किंवा शून्य गुण मिळतात.

या स्कोरिंगवर आधारित दोन प्रशिक्षण पद्धती (training regimes) आहेत:

  • ABC-SFT (Supervised Fine-Tuning) लॉस फंक्शनचे (loss function) पुनर्वजन करते जेणेकरून जास्त क्रेडिट असलेल्या पायऱ्यांचा मॉडेलवर अधिक प्रभाव पडेल. ज्या कृतींमुळे ऐतिहासिकदृष्ट्या उपयुक्त संकेत मिळाले आहेत, त्यांना प्राधान्य देण्यास मॉडेल शिकते.
  • ABC-GRPO (Gradient-based Reward Policy Optimization) प्रत्येक पायरीच्या गुणांना रिइन्फोर्समेंट लर्निंगसाठी (reinforcement learning) रिवॉर्ड सिग्नल म्हणून वापरते, ज्यामुळे उत्तरासाठी मदत करणाऱ्या शोध प्रक्रियेतील विशिष्ट भागांना बळकटी मिळते.

केवळ पास/फेल अशा लेबलऐवजी योगदानाचे सविस्तर मॅप तयार करून, ABC मॉडेलला अधिक समृद्ध लर्निंग सिग्नल देते.

सुरुवातीचे निकाल प्रभावी आहेत

संशोधकांनी ABC चा वापर एका मध्यम ४ अब्ज पॅरामीटर असलेल्या मॉडेलवर केला, ज्यामध्ये बदलत्या शोध स्थितीचा मागोवा घेणारी 'कॉन्टेक्स्ट-मॅनेजमेंट लेयर' (context-management layer) होती. पारंपारिकपणे मोठ्या एजंट्सना अनुकूल असलेल्या बेंचमार्क टास्कमध्ये, ABC-प्रशिक्षित मॉडेलने मोठ्या सिस्टम्सना बरोबरी दिली किंवा त्यांना मागे टाकले. मॉडेलचा आकार न वाढवता ही कामगिरी साध्य झाली, ज्यावरून असे सूचित होते की चांगले क्रेडिट असाइनमेंट हे केवळ पॅरामीटरच्या संख्येला पर्याय ठरू शकते.

मुख्य निष्कर्ष साधा आहे: मॉडेलला नेमके काय यशस्वी झाले याची स्पष्ट 'पावती' द्या, आणि ते त्याच प्रशिक्षण डेटाचा अधिक चांगल्या प्रकारे वापर करू शकेल.

वास्तविक जगातील एजंट्ससाठी याचा अर्थ काय

बहु-पायरीचे काम करणारे कोणतेही एजंट—जसे की कोडिंग असिस्टंट, लिटरेचर-रिव्ह्यू बॉट्स, कस्टमर-सपोर्ट टूल्स—त्यांच्या कृतींच्या ट्रॅसवर अवलंबून असतात. ABC हे दर्शवते की त्या ट्रॅसचे जतन करणे आणि त्याचे मूल्यांकन करणे ही केवळ एक अतिरिक्त सुविधा नसून, प्रभावी शिक्षणासाठी ते अत्यावश्यक आहे.

  • कोडिंग एजंट्सना प्लॅन, प्रत्येक कमांड आणि कोडची पडताळणी करणारे टेस्ट रिझल्ट्स लॉग करणे आवश्यक आहे.
  • रिसर्च एजंट्सनी त्यांनी पाठवलेल्या क्वेरीज, त्यांनी उघडलेली सोर्स आणि त्यांनी काढलेले पुरावे जतन केले पाहिजेत.
  • सपोर्ट एजंट्सनी प्रत्येक स्टेट चेक आणि निर्णयाचा मुद्दा रेकॉर्ड केला पाहिजे जो निराकरणापर्यंत पोहोचण्यास मदत करतो.

जेव्हा हे ट्रॅस उपलब्ध असतात, तेव्हा ABC अचूकपणे क्रेडिट देऊ शकते, ज्यामुळे मॉडेलला चांगल्या सवयींना बळकटी देण्यास आणि योगायोगाने मिळालेल्या शॉर्टकटना (जे अन्यथा कौशल्य समजले जाऊ शकतात) काढून टाकण्यास मदत होते.

प्रतिवाद आणि व्यावहारिक अडथळे

ABC चे फायदे वाढीव जटिलतेसह येतात.

सारांश

Answer-Backtracked Credit Assignment ही पद्धत एजंट्सना शोधणे, कोडिंग करणे आणि तर्क करणे कसे शिकवायचे, याच्या पारंपारिक पद्धतीला पूर्णपणे बदलून टाकते. केवळ अंतिम निकालाऐवजी प्रक्रियेतील योग्य पाऊल उचलल्याबद्दल बक्षीस देऊन, ही पद्धत मध्यम आकाराच्या मॉडेलला मोठ्या मॉडेल्सइतकेच प्रभावीपणे शिकण्यास सक्षम करते. ज्यांना अनेक टप्प्यांची कामे करणारे एजंट्स तयार करायचे आहेत, त्यांच्यासाठी 'ट्रेस-केंद्रित' (trace-centric) प्रशिक्षण पद्धती स्वीकारणे हा केवळ एक पर्याय नसून, विश्वासार्ह, ऑडिट करण्यायोग्य आणि शेवटी अधिक बुद्धिमान AI कडे जाण्याचा तो मार्ग आहे.