ایک نیا "پروایکٹو میموری" ماڈیول لارج لینگویج ماڈل ایجنٹس کو بنیادی ماڈل کی فائن ٹیوننگ کے بغیر کام کی ضروریات، ماحول کے حقائق اور ماضی کی ناکامیوں پر نظر رکھنے کی اجازت دیتا ہے۔ بینچ مارک ٹیسٹوں میں، اس اضافے نے Terminal-Bench 2.0 پر Sonnet 4.5 کے اسکور کو 8.3 فیصد پوائنٹس اور τ2-Bench سوٹ پر 6.8 پوائنٹس تک بڑھا دیا؛ ایک SETA-تربیت یافتہ میموری ایجنٹ نے غیر دیکھے گئے مسائل پر ایک فروزن ماڈل کے pass@1 کو 37.6% سے بڑھا کر 41.1% کر دیا۔

ایجنٹس اپنا رخ کیوں بھٹک جاتے ہیں

جب ایک LLM سے چلنے والا ایجنٹ کثیر المراحل طریقہ کار پر عمل کرتا ہے، تو اس کی اندرونی "اسٹیٹ" (state) کمزور پڑنے لگتی ہے۔ محققین اسے "بیہیویئرل اسٹیٹ ڈیکے" (behavioral state decay) کہتے ہیں: ماڈل سابقہ ہدایات، اہم حقائق، یا اپنی کی گئی غلطیوں کو بھول جاتا ہے۔ اس کا نتیجہ غلط فیصلوں کے ایک ایسے تسلسل کی صورت میں نکلتا ہے جو کسی کام کو مکمل ہونے سے بہت پہلے ہی منسوخ کر دیتا ہے۔

عام حل کانٹیکسٹ ونڈو (context window) کو بڑا کرنا ہے—یعنی متن کا وہ حصہ جس پر ماڈل ایک وقت میں توجہ دے سکتا ہے۔ یہ صرف اس وقت تک مدد کرتا ہے جب تک کام اس ونڈو کی حد سے باہر نہ نکل جائے؛ اس کے بعد پرانی معلومات ختم ہو جاتی ہیں اور کمی کا عمل دوبارہ شروع ہو جاتا ہے۔

ایک ایسی یاد دہانی جو صرف ضرورت پڑنے پر کام کرتی ہے

نیا طریقہ کار ایک ہلکا پھلکا معاون میموری ایجنٹ شامل کرتا ہے جو مرکزی ماڈل کے استدلال کے سراغ (reasoning trace) پر نظر رکھتا ہے اور مخصوص یاد دہانیاں فراہم کرتا ہے۔ ماضی کے ٹکڑوں کی ایک مستقل فہرست نکالنے کے بجائے، میموری ماڈیول یہ فیصلہ کرتا ہے کہ کب اور کیا سامنے لانا ہے، اور یہ صرف اس وقت عمل کرتا ہے جب مرکزی ماڈل بھٹکتا ہوا محسوس ہوتا ہے۔

چونکہ میموری لرنر الگ سے تربیت یافتہ ہوتا ہے، اس لیے بنیادی ایکشن ماڈل فروزن رہتا ہے۔ مطالعہ ظاہر کرتا ہے کہ یہ علیحدگی طویل مدتی بینچ مارکس پر اب بھی نمایاں فوائد فراہم کرتی ہے، جو یہ ثابت کرتی ہے کہ پروایکٹو یاد دہانیاں ایک محدود کانٹیکسٹ ونڈو کی تلافی کر سکتی ہیں۔

اعداد و شمار کیا کہتے ہیں

  • Terminal-Bench 2.0: Sonnet 4.5 اپنے بیس لائن سے 8.3 پوائنٹس اوپر چلا جاتا ہے۔
  • τ2-Bench suite: یہی ماڈل 6.8 پوائنٹس بہتر ہو جاتا ہے۔
  • Held-out ٹیسٹوں پر Pass@1: ایک SETA-تربیت یافتہ میموری ایجنٹ فروزن ماڈل کو 37.6% سے بڑھا کر 41.1% کر دیتا ہے۔

یہ بہتری مرکزی ماڈل کی کسی بھی اضافی فائن ٹیوننگ کے بغیر حاصل ہوتی ہے، اس لیے میموری کمپوننٹ کو موجودہ تعینات کردہ نظاموں میں لگایا یا ہٹایا جا سکتا ہے۔

موجودہ کام کی حدود

تجربات درج ذیل چیزوں کی جانچ پڑتال تک نہیں پہنچ پائے:

  • اسکیل (Scale): ابھی تک اس بات کا کوئی ثبوت نہیں ہے کہ میموری ماڈیول اربوں پیرامیٹرز والے ماڈلز یا لاکھوں مراحل تک چلنے والے کاموں کے ساتھ بھی اسی طرح کام کرتا ہے۔
  • پروڈکشن لاگت: یاد دہانیوں کو محفوظ کرنے اور دوبارہ حاصل کرنے سے اضافی بوجھ (overhead) پڑتا ہے، لیکن مطالعہ میں حقیقی دنیا کے نظام میں درکار اضافی میموری یا کمپیوٹ کی مقدار کا تعین نہیں کیا گیا ہے۔

آگے کیا دیکھنا ہے

مستقبل کے بینچ مارک سوٹس کو محض کانٹیکسٹ کے سائز سے زیادہ چیزوں کی پیمائش کرنے کی ضرورت ہوگی۔ وہ ٹیسٹ جو واضح طور پر اسٹیٹ ڈیکے کو ٹریک کرتے ہیں اور فعال یاد دہانی کے نظاموں کو اہمیت دیتے ہیں، ایجنٹ کی طویل مدتی بھروسہ مندی کی زیادہ واضح تصویر پیش کریں گے۔ محققین کو یہ بھی دکھانا ہوگا کہ پروایکٹو میموری ماڈل کے سائز اور آپریشنل لاگت، دونوں لحاظ سے موثر طریقے سے اسکیل ہوتی ہے۔

خلاصہ: ایک چھوٹا، الگ سے تربیت یافتہ میموری ماڈیول لارج لینگویج ماڈل ایجنٹس کے لیے ایک 'واچ ڈاگ' کے طور پر کام کر سکتا ہے، جو کام کے بے ترتیب ہونے سے پہلے ہی اس کے بھٹکنے کو پکڑ کر درست کر سکتا ہے۔