एका नवीन “प्रोअॅक्टिव्ह मेमरी” (proactive memory) मॉड्यूलमुळे लार्ज-लँग्वेज-मॉडेल (LLM) एजंट्सना मूळ मॉडेलचे फाईन-ट्यूनिंग न करताच कामाच्या गरजा, वातावरणाशी संबंधित तथ्ये आणि मागील चुकांचा मागोवा घेणे शक्य झाले आहे. बेंचमार्क चाचण्यांमध्ये, या जोडणीमुळे Sonnet 4.5 च्या स्कोअरमध्ये Terminal-Bench 2.0 वर 8.3 टक्क्यांनी आणि τ2-Bench suite वर 6.8 अंकांनी वाढ झाली; तसेच, एका SETA-प्रशिक्षित मेमरी एजंटने न पाहिलेल्या समस्यांवर फ्रोजन मॉडेलचा pass@1 स्कोअर 37.6% वरून 41.1% पर्यंत वाढवला.

एजंट्स दिशा का चुकतात

जेव्हा एखादा LLM-चालित एजंट बहु-स्तरीय प्रक्रिया फॉलो करतो, तेव्हा त्याची अंतर्गत “स्थिती” (state) क्षीण होत जाते. संशोधक याला “बिहेवियरल स्टेट डिके” (behavioral state decay) म्हणतात: मॉडेल पूर्वीच्या सूचना, महत्त्वाच्या तथ्या किंवा स्वतः केलेल्या चुका विसरते. परिणामी, चुकीच्या निर्णयांची एक साखळी तयार होते, ज्यामुळे काम पूर्ण होण्यापूर्वीच ते अर्धवट पडते.

यावर सामान्य उपाय म्हणजे कॉन्टेक्स्ट विंडो (context window) वाढवणे—म्हणजेच मॉडेल एकाच वेळी ज्या मजकुराचा विचार करू शकते तो भाग वाढवणे. परंतु, काम विंडोच्या मर्यादेबाहेर गेल्यास हे केवळ तात्पुरते ठरते; जुनी माहिती वगळली जाते आणि क्षय पुन्हा सुरू होतो.

गरज असेल तेव्हाच काम करणारी आठवण

ही नवीन पद्धत एक हलका (lightweight) सहाय्यक मेमरी एजंट जोडते, जो मुख्य मॉडेलच्या तर्क प्रक्रियेवर (reasoning trace) लक्ष ठेवतो आणि आवश्यकतेनुसार लक्ष्यित सूचना (targeted reminders) देतो. मागील माहितीची एक स्थिर यादी (static list) काढण्याऐवजी, मेमरी मॉड्यूल कधी आणि काय समोर आणायचे हे ठरवते, आणि मुख्य मॉडेल भरकटत असल्याचे दिसल्यावरच ते कार्य करते.

मेमरी लर्नर स्वतंत्रपणे प्रशिक्षित केला जात असल्याने, मुख्य ॲक्शन मॉडेल 'फ्रोजन' (frozen) राहते. हा अभ्यास दर्शवतो की, ही विभागणी लाँग-होरिझन बेंचमार्क्सवर लक्षणीय सुधारणा घडवून आणते, ज्यामुळे हे सिद्ध होते की प्रोअॅक्टिव्ह रिमाइंडर्स मर्यादित कॉन्टेक्स्ट विंडोची भरपाई करू शकतात.

आकडेवारी काय सांगते

  • Terminal-Bench 2.0: Sonnet 4.5 त्याच्या बेसलाइनपेक्षा 8.3 पॉईंट्सने वाढले आहे.
  • τ2-Bench suite: त्याच मॉडेलमध्ये 6.8 पॉईंट्सची सुधारणा झाली आहे.
  • Held-out चाचण्यांवरील Pass@1: SETA-प्रशिक्षित मेमरी एजंट फ्रोजन मॉडेलचा स्कोअर 37.6% वरून 41.1% पर्यंत वाढवतो.

या सुधारणा मुख्य मॉडेलच्या कोणत्याही अतिरिक्त फाईन-ट्यूनिंगशिवाय घडतात, त्यामुळे मेमरी घटक सध्याच्या उपयोजनांमध्ये (deployments) सहजपणे बदलता (swap) येऊ शकतो.

सध्याच्या कार्याच्या मर्यादा

प्रयोगांमध्ये खालील गोष्टींची चाचणी करण्यात आलेली नाही:

  • स्केल (Scale): मल्टी-बिलियन-पॅरामीटर मॉडेल्स किंवा लाखो स्टेप्स चालणाऱ्या कामांमध्ये मेमरी मॉड्यूल अशाच प्रकारे काम करेल, याचा अद्याप कोणताही पुरावा नाही.
  • उत्पादन खर्च (Production cost): आठवणी साठवणे आणि पुन्हा मिळवणे यामुळे अतिरिक्त भार (overhead) वाढतो, परंतु वास्तविक प्रणालीमध्ये आवश्यक असलेल्या अतिरिक्त मेमरी किंवा कम्प्युटचे प्रमाण या अभ्यासात मोजले गेलेले नाही.

पुढे काय पाहावे?

भविष्यातील बेंचमार्क सूट्सना केवळ कच्च्या कॉन्टेक्स्टच्या आकारापेक्षा अधिक गोष्टी मोजाव्या लागतील. 'स्टेट डिके' (state decay) ट्रॅक करणाऱ्या आणि सक्रिय रिमांडर सिस्टम्सना महत्त्व देणाऱ्या चाचण्यांमुळे एजंटच्या दीर्घकालीन विश्वासार्हतेचे स्पष्ट चित्र मिळेल. संशोधकांना हे देखील दाखवून द्यावे लागेल की प्रोअॅक्टिव्ह मेमरी मॉडेलचा आकार आणि कार्यात्मक खर्च या दोन्ही बाबतीत कार्यक्षमतेने स्केल होऊ शकते.

थोडक्यात: एक लहान, स्वतंत्रपणे प्रशिक्षित मेमरी मॉड्यूल लार्ज-लँग्वेज-मॉडेल एजंट्ससाठी 'वॉचडॉग' (watchdog) म्हणून काम करू शकते, जे काम विस्कळीत होण्यापूर्वीच भरकटलेली दिशा शोधून ती सुधारू शकते.