ABSeeker యొక్క కొత్త “Answer-Backtracked Credit Assignment” (ABC) పద్ధతి, లాంగ్-హారిజన్ సెర్చ్ ఏజెంట్లు కేవలం చివరి సమాధానం కోసం మాత్రమే కాకుండా, ప్రతి వ్యక్తిగత దశకు క్రెడిట్ పొందేలా చేస్తుంది. దీనితో శిక్షణ పొందిన 4 బిలియన్-పారామీటర్ల మోడల్ ఇప్పటికే చాలా పెద్ద పోటీదారులతో సమానంగా లేదా వాటిని మించి పనిచేయగలదు.

ఈ విప్లవాత్మక మార్పు ఎందుకు ముఖ్యమంటే, ప్రస్తుతం ఉన్న చాలా ఏజెంట్లు కేవలం పని ముగిసిన తర్వాత మాత్రమే అంచనా వేయబడతాయి. చివరి సమాధానం సరైనదైతే, మొత్తం ప్రక్రియ మంచిదని గుర్తించబడుతుంది; అది తప్పు అయితే, మొత్తం క్రమం చెడ్డదని గుర్తించబడుతుంది. ఈ 'అన్నీ లేదా ఏమీ లేని' (all-or-nothing) ఫీడ్‌బ్యాక్ అసలైన లెర్నింగ్ సిగ్నల్‌ను దాచివేస్తుంది—అంటే, ఒక తప్పు తర్వాత జరిగిన మంచి కదలికలు లేదా అదృష్టవశాత్తూ సరైన ఫలితానికి దారితీసిన పనికిరాని క్లిక్‌లు వంటివి గుర్తించబడవు. ABSeeker యొక్క విధానం ఈ నియమాలను మారుస్తుంది.

పాత విధానం ఎందుకు సరిపోదు

ఒక ఏజెంట్ సెర్చ్ చేసినప్పుడు, కోడ్ రాసినప్పుడు లేదా ఆధారాలను సేకరించినప్పుడు, అది సాధారణంగా అనేక చర్యలు తీసుకుంటుంది: క్వెరీలను జారీ చేయడం, పేజీలను తెరవడం, కమాండ్లను రన్ చేయడం, సిస్టమ్ స్థితిని తనిఖీ చేయడం మొదలైనవి. పదిహేను దశల ప్రక్రియలో, ముందున్న దశలు సరిగ్గా ఉన్నప్పటికీ, ఒకే ఒక తప్పు చివరి సమాధానాన్ని దెబ్బతీస్తుంది. దీనికి విరుద్ధంగా, సరైన సమాధానంతో ముగిసిన ప్రక్రియలో చాలా దశలు ఎటువంటి విలువను జోడించకపోయినా, అది కేవలం అదృష్టం వల్ల జరిగి ఉండవచ్చు. కేవలం చివరి ఫలితంపై మాత్రమే శిక్షణ ఇవ్వడం వల్ల, మోడల్ మొత్తం ప్రక్రియను ఒకే బ్లాక్ బాక్స్‌గా పరిగణించాల్సి వస్తుంది, దీనివల్ల ఏ ఉప-ప్రవర్తనలు (sub-behaviors) నిజంగా ఉపయోగకరమైనవో తెలుసుకోవడం కష్టమవుతుంది.

ఈ పరిస్థితి సాఫ్ట్‌వేర్ ఇంజనీరింగ్‌లోని డీబగ్గింగ్‌ను పోలి ఉంటుంది. డెవలపర్లు ప్రతి లైన్‌ను తనిఖీ చేస్తారు, విఫలమైన కాల్‌ను వేరు చేస్తారు మరియు దానిని సరిచేస్తారు. అయితే, ఏజెంట్లకు వారి అంతర్గత పనికి సంబంధించి అటువంటి "రసీదు" (receipt) ఇవ్వబడలేదు. ఆ ఆడిట్ ట్రయల్ లేకపోతే, మెరుగుదల అనేది మెరుగైన రీజనింగ్ వల్ల వచ్చిందా లేదా కేవలం యాదృచ్ఛికంగా వచ్చిందా అని డెవలపర్లు చెప్పలేరు మరియు వారు తప్పుడు అలవాట్లను క్రమబద్ధంగా సరిదిద్దలేరు.

ABC క్రెడిట్ అసైన్‌మెంట్‌ను ఎలా మారుస్తుంది

Answer-Backtracked Credit Assignment అనేది సరైన చివరి సమాధానం నుండి వెనక్కి పనిచేస్తుంది. ఇది మొదట సమాధానం దేనిపై ఆధారపడి ఉందో ఆ ముఖ్యమైన క్లూలను—నిర్దిష్ట ఆధారాలు, మధ్యంతర ఫలితాలు లేదా స్టేట్ చెక్‌లను—సేకరిస్తుంది. ఆ తర్వాత, రికార్డ్ చేయబడిన ట్రేస్ ద్వారా వెనక్కి వెళ్తూ, ప్రతి చర్యను ఆ క్లూలతో పోల్చి స్కోరు చేస్తుంది. అవసరమైన క్లూకు నేరుగా సహకరించిన చర్యకు పాజిటివ్ క్రెడిట్ లభిస్తుంది; సంబంధం లేని లేదా హానికరమైన చర్యకు నెగటివ్ లేదా సున్నా స్కోరు లభిస్తుంది.

ఈ స్కోరింగ్ ఆధారంగా రెండు శిక్షణ విధానాలు ఉన్నాయి:

  • ABC-SFT (Supervised Fine-Tuning) అనేది లాస్ ఫంక్షన్‌ను రీ-వెయిట్ చేస్తుంది, తద్వారా ఎక్కువ క్రెడిట్ ఉన్న దశలు మోడల్‌పై మరింత బలంగా ప్రభావం చూపుతాయి. గతంలో ఉపయోగకరమైన క్లూలకు దారితీసిన చర్యలకు ప్రాధాన్యత ఇవ్వడం మోడల్ నేర్చుకుంటుంది.
  • ABC-GRPO (Gradient-based Reward Policy Optimization) అనేది ప్రతి దశ స్కోర్‌లను రీఇన్‌ఫోర్స్‌మెంట్ లెర్నింగ్ కోసం రివార్డ్ సిగ్నల్‌గా పరిగణిస్తుంది, తద్వారా సమాధానం రావడానికి సహాయపడిన సెర్చ్ యొక్క నిర్దిష్ట భాగాలను బలోపేతం చేస్తుంది.

బైనరీ పాస్/ఫెయిల్ లేబుల్‌ను సహకారం యొక్క వివరణాత్మక మ్యాప్‌గా మార్చడం ద్వారా, ABC మోడల్‌కు చాలా గొప్ప లెర్నింగ్ సిగ్నల్‌ను అందిస్తుంది.

ప్రారంభ ఫలితాలు స్పష్టంగా చెబుతున్నాయి

పరిశోధకులు సెర్చ్ స్టేట్‌ను ట్రాక్ చేసే కాంటెక్స్ట్-మేనేజ్‌మెంట్ లేయర్‌తో కూడిన ఒక సాధారణ 4 బిలియన్-పారామీటర్ల మోడల్‌కు ABCని వర్తింపజేశారు. సాధారణంగా చాలా పెద్ద ఏజెంట్లకు అనుకూలమైన బెంచ్‌మార్క్ టాస్క్‌లలో, ABC-శిక్షణ పొందిన మోడల్ ఆ పెద్ద సిస్టమ్‌లతో సమానంగా లేదా వాటి కంటే మెరుగ్గా పనిచేసింది. మోడల్ పరిమాణాన్ని పెంచకుండానే ఈ పనితీరు మెరుగుపడింది, ఇది మెరుగైన క్రెడిట్ అసైన్‌మెంట్ అనేది ముడి పారామీటర్ల సంఖ్యకు ప్రత్యామ్నాయంగా ఉండవచ్చని సూచిస్తుంది.

దీని నుండి తేలికైన సారాంశం ఏమిటంటే: మోడల్‌కు ఏమి పని చేసిందో స్పష్టమైన రసీదును ఇస్తే, అది అదే శిక్షణ డేటా నుండి ఎక్కువ విలువను పొందగలదు.

నిజ ప్రపంచ ఏజెంట్లకు దీని అర్థం ఏమిటి

మల్టీ-స్టెప్ పనులను చేసే ఏ ఏజెంట్ అయినా—కోడింగ్ అసిస్టెంట్లు, లిటరేచర్-రివ్యూ బాట్లు, కస్టమర్-సపోర్ట్ టూల్స్—అది చేసే చర్యల ట్రేస్‌పై ఆధారపడి ఉంటుంది. ఆ ట్రేస్‌ను భద్రపరచడం మరియు అంచనా వేయడం అనేది కేవలం ఒక అదనపు ఫీచర్ మాత్రమే కాదు; అది సమర్థవంతమైన అభ్యాసానికి (learning) చాలా అవసరం అని ABC చూపుతోంది.

  • కోడింగ్ ఏజెంట్లు ప్లాన్, జారీ చేసిన ప్రతి కమాండ్ మరియు కోడ్‌ను ధృవీకరించే టెస్ట్ ఫలితాలను లాగ్ చేయాలి.
  • రీసెర్చ్ ఏజెంట్లు తాము పంపిన క్వెరీలను, తెరిచిన మూలాలను (sources) మరియు సేకరించిన ఆధారాలను భద్రపరచుకోవాలి.
  • సపోర్ట్ ఏజెంట్లు పరిష్కారానికి దారితీసిన ప్రతి స్టేట్ చెక్ మరియు నిర్ణయ పాయింట్‌ను రికార్డ్ చేయాలి.

ఈ ట్రేస్‌లు అందుబాటులో ఉన్నప్పుడు, ABC క్రెడిట్‌ను ఖచ్చితంగా కేటాయించగలదు, తద్వారా మోడల్ మంచి అలవాట్లను బలోపేతం చేసుకోవడానికి మరియు నైపుణ్యంగా పొరపాటున భావించే అదృష్టపు షార్ట్‌కట్‌లను వదిలివేయడానికి అనుమతిస్తుంది.

ప్రతికూల అంశాలు మరియు ఆచరణాత్మక అడ్డంకులు

ABC ప్రయోజనాలతో పాటు అదనపు సంక్లిష్టత కూడా వస్తుంది.

ముగింపు

Answer-Backtracked Credit Assignment అనేది ఏజెంట్లకు సెర్చ్ చేయడం, కోడింగ్ చేయడం మరియు రీజనింగ్ చేయడం నేర్పించే విధానాన్ని పూర్తిగా మార్చేస్తుంది. కేవలం చివరి ఫలితాన్ని మాత్రమే కాకుండా, ప్రక్రియలో చేసే సరైన అడుగులకు ప్రతిఫలం ఇవ్వడం ద్వారా, ఇది ఒక మధ్యస్థ పరిమాణం కలిగిన మోడల్ కూడా చాలా పెద్ద మోడల్స్ అంత సమర్థవంతంగా నేర్చుకునేలా చేస్తుంది. బహుళ దశల పనులను నిర్వహించాల్సిన ఏజెంట్లను రూపొందించే ఎవరికైనా, trace-centric training regimeని అనుసరించడం అనేది కేవలం ఒక ఎంపిక మాత్రమే కాదు—అది నమ్మదగిన, ఆడిటబుల్ మరియు అంతిమంగా మరింత తెలివైన AIని నిర్మించే మార్గం.