ఒక కొత్త “ప్రోయాక్టివ్ మెమరీ” (proactive memory) మాడ్యూల్, లార్జ్-లాంగ్వేజ్-మోడల్ ఏజెంట్లు కోర్ మోడల్‌ను ఫైన్-ట్యూనింగ్ చేయకుండానే టాస్క్ అవసరాలు, ఎన్విరాన్మెంట్ వాస్తవాలు మరియు గత వైఫల్యాలను ట్రాక్ చేయడానికి అనుమతిస్తుంది. బెంచ్‌మార్క్ పరీక్షలలో, ఈ జోడింపు Terminal-Bench 2.0లో Sonnet 4.5 స్కోరును 8.3 పర్సంటేజ్ పాయింట్లు మరియు τ2-Bench సూట్‌లో 6.8 పాయింట్లు పెంచింది; SETA-ట్రైన్ చేయబడిన మెమరీ ఏజెంట్, చూడని సమస్యలపై (unseen problems) ఒక ఫ్రోజన్ మోడల్ యొక్క pass@1 ని 37.6% నుండి 41.1%కి పెంచింది.

ఏజెంట్లు ఎందుకు దారి తప్పిపోతాయి

ఒక LLM-ఆధారిత ఏజెంట్ బహుళ-దశల ప్రక్రియను అనుసరిస్తున్నప్పుడు, దాని అంతర్గత “స్టేట్” (state) క్షీణిస్తుంది. పరిశోధకులు దీనిని “బిహేవియరల్ స్టేట్ డికే” (behavioral state decay) అని పిలుస్తారు: అంటే మోడల్ మునుపటి సూచనలను, కీలక వాస్తవాలను లేదా ఇప్పటికే చేసిన తప్పులను మర్చిపోతుంది. దీని ఫలితంగా తప్పుడు నిర్ణయాల గొలుసు ఏర్పడి, పని పూర్తి కావడానికి చాలా ముందే అది ఆగిపోతుంది.

దీనికి సాధారణ పరిష్కారం కాంటెక్స్ట్ విండోను (context window)—అంటే మోడల్ ఒకేసారి గమనించగల టెక్స్ట్ భాగాన్ని—పెద్దదిగా చేయడం. అయితే, టాస్క్ ఆ విండో పరిధిని దాటినంత వరకు మాత్రమే అది సహాయపడుతుంది; పాత సమాచారం తొలగించబడుతుంది మరియు క్షీణత మళ్ళీ మొదలవుతుంది.

అవసరమైనప్పుడు మాత్రమే పనిచేసే రిమైండర్

ఈ కొత్త విధానం ఒక తేలికపాటి అసిస్టెంట్ మెమరీ ఏజెంట్‌ను జోడిస్తుంది, ఇది ప్రధాన మోడల్ యొక్క రీజనింగ్ ట్రేస్‌ను గమనిస్తూ, అవసరమైనప్పుడు లక్షిత రిమైండర్‌లను అందిస్తుంది. గత స్నిప్పెట్ల స్థిరమైన జాబితాను తీసుకునే బదులు, ఈ మెమరీ మాడ్యూల్ ఎప్పుడు మరియు ఏమిటి అనేది నిర్ణయిస్తుంది; ప్రధాన మోడల్ దారి తప్పినట్లు అనిపించినప్పుడు మాత్రమే ఇది స్పందిస్తుంది.

మెమరీ లర్నర్ విడిగా శిక్షణ పొందుతుంది కాబట్టి, ప్రాథమిక యాక్షన్ మోడల్ ఫ్రోజన్ (frozen) గానే ఉంటుంది. లాంగ్-హోరైజన్ బెంచ్‌మార్క్‌లపై ఈ విభజన గణనీయమైన లాభాలను చూపుతుందని ఈ అధ్యయనం నిరూపిస్తుంది, తద్వారా ప్రోయాక్టివ్ రిమైండర్‌లు పరిమిత కాంటెక్స్ట్ విండోను భర్తీ చేయగలవని స్పష్టమవుతుంది.

అంకెలు ఏం చెబుతున్నాయి

  • Terminal-Bench 2.0: Sonnet 4.5 తన బేస్‌లైన్ కంటే 8.3 పాయింట్లు పెరిగింది.
  • τ2-Bench suite: అదే మోడల్ 6.8 పాయింట్లు మెరుగుపడింది.
  • Held-out టెస్టులపై Pass@1: SETA-ట్రైన్ చేయబడిన మెమరీ ఏజెంట్ ఒక ఫ్రోజన్ మోడల్‌ను 37.6% నుండి 41.1%కి పెంచుతుంది.

ఈ పెరుగుదలలు ప్రధాన మోడల్‌కు ఎటువంటి అదనపు ఫైన్-ట్యూనింగ్ లేకుండానే జరుగుతాయి, కాబట్టి మెమరీ భాగాన్ని ఇప్పటికే ఉన్న డిప్లాయ్‌మెంట్‌లలో సులభంగా మార్చుకోవచ్చు (swap in or out).

ప్రస్తుత పరిశోధన యొక్క పరిమితులు

ప్రయోగాలు ఈ క్రింది అంశాలను పరీక్షించలేదు:

  • స్కేల్ (Scale): మల్టీ-బిలియన్-పారామీటర్ మోడల్స్ లేదా మిలియన్ల దశల వరకు సాగే టాస్క్‌లతో ఈ మెమరీ మాడ్యూల్ కూడా అదే విధంగా పనిచేస్తుందని ఇంకా ఎటువంటి ఆధారాలు లేవు.
  • ప్రొడక్షన్ ఖర్చు (Production cost): రిమైండర్‌లను నిల్వ చేయడం మరియు తిరిగి పొందడం వల్ల అదనపు భారం (overhead) పెరుగుతుంది, కానీ వాస్తవ ప్రపంచ వ్యవస్థలో అవసరమయ్యే అదనపు మెమరీ లేదా కంప్యూట్ సామర్థ్యాన్ని ఈ అధ్యయనం లెక్కించలేదు.

తదుపరి ఏమి గమనించాలి

భవిష్యత్తు బెంచ్‌మార్క్ సూట్‌లు కేవలం కాంటెక్స్ట్ పరిమాణాన్ని మాత్రమే కాకుండా మరిన్ని అంశాలను కొలవాల్సి ఉంటుంది. స్టేట్ డికే (state decay) ను స్పష్టంగా ట్రాక్ చేసే మరియు యాక్టివ్ రిమైండర్ సిస్టమ్‌లకు రివార్డ్ ఇచ్చే పరీక్షలు, ఏజెంట్ యొక్క దీర్ఘకాలిక విశ్వసనీయత గురించి స్పష్టమైన చిత్రాన్ని అందిస్తాయి. ప్రోయాక్టివ్ మెమరీ మోడల్ పరిమాణం మరియు నిర్వహణ ఖర్చు రెండింటిలోనూ సమర్థవంతంగా స్కేల్ అవుతుందని పరిశోధకులు నిరూపించాల్సి ఉంటుంది.

ముఖ్య అంశం: ఒక చిన్న, విడిగా శిక్షణ పొందిన మెమరీ మాడ్యూల్, లార్జ్-లాంగ్వేజ్-మోడల్ ఏజెంట్‌లకు ఒక వాచ్‌డాగ్‌లా (watchdog) పనిచేసి, టాస్క్ దారి తప్పకముందే లోపాలను గుర్తించి సరిచేయగలదు.