ABSeeker యొక్క కొత్త “Answer-Backtracked Credit Assignment” (ABC) పద్ధతి, లాంగ్-హారిజన్ సెర్చ్ ఏజెంట్లు కేవలం చివరి సమాధానం కోసం మాత్రమే కాకుండా, ప్రతి వ్యక్తిగత దశకు క్రెడిట్ పొందేలా చేస్తుంది. దీనితో శిక్షణ పొందిన 4 బిలియన్-పారామీటర్ల మోడల్ ఇప్పటికే చాలా పెద్ద పోటీదారులతో సమానంగా లేదా వాటిని మించి పనిచేయగలదు.
ఈ విప్లవాత్మక మార్పు ఎందుకు ముఖ్యమంటే, ప్రస్తుతం ఉన్న చాలా ఏజెంట్లు కేవలం పని ముగిసిన తర్వాత మాత్రమే అంచనా వేయబడతాయి. చివరి సమాధానం సరైనదైతే, మొత్తం ప్రక్రియ మంచిదని గుర్తించబడుతుంది; అది తప్పు అయితే, మొత్తం క్రమం చెడ్డదని గుర్తించబడుతుంది. ఈ 'అన్నీ లేదా ఏమీ లేని' (all-or-nothing) ఫీడ్బ్యాక్ అసలైన లెర్నింగ్ సిగ్నల్ను దాచివేస్తుంది—అంటే, ఒక తప్పు తర్వాత జరిగిన మంచి కదలికలు లేదా అదృష్టవశాత్తూ సరైన ఫలితానికి దారితీసిన పనికిరాని క్లిక్లు వంటివి గుర్తించబడవు. ABSeeker యొక్క విధానం ఈ నియమాలను మారుస్తుంది.
పాత విధానం ఎందుకు సరిపోదు
ఒక ఏజెంట్ సెర్చ్ చేసినప్పుడు, కోడ్ రాసినప్పుడు లేదా ఆధారాలను సేకరించినప్పుడు, అది సాధారణంగా అనేక చర్యలు తీసుకుంటుంది: క్వెరీలను జారీ చేయడం, పేజీలను తెరవడం, కమాండ్లను రన్ చేయడం, సిస్టమ్ స్థితిని తనిఖీ చేయడం మొదలైనవి. పదిహేను దశల ప్రక్రియలో, ముందున్న దశలు సరిగ్గా ఉన్నప్పటికీ, ఒకే ఒక తప్పు చివరి సమాధానాన్ని దెబ్బతీస్తుంది. దీనికి విరుద్ధంగా, సరైన సమాధానంతో ముగిసిన ప్రక్రియలో చాలా దశలు ఎటువంటి విలువను జోడించకపోయినా, అది కేవలం అదృష్టం వల్ల జరిగి ఉండవచ్చు. కేవలం చివరి ఫలితంపై మాత్రమే శిక్షణ ఇవ్వడం వల్ల, మోడల్ మొత్తం ప్రక్రియను ఒకే బ్లాక్ బాక్స్గా పరిగణించాల్సి వస్తుంది, దీనివల్ల ఏ ఉప-ప్రవర్తనలు (sub-behaviors) నిజంగా ఉపయోగకరమైనవో తెలుసుకోవడం కష్టమవుతుంది.
ఈ పరిస్థితి సాఫ్ట్వేర్ ఇంజనీరింగ్లోని డీబగ్గింగ్ను పోలి ఉంటుంది. డెవలపర్లు ప్రతి లైన్ను తనిఖీ చేస్తారు, విఫలమైన కాల్ను వేరు చేస్తారు మరియు దానిని సరిచేస్తారు. అయితే, ఏజెంట్లకు వారి అంతర్గత పనికి సంబంధించి అటువంటి "రసీదు" (receipt) ఇవ్వబడలేదు. ఆ ఆడిట్ ట్రయల్ లేకపోతే, మెరుగుదల అనేది మెరుగైన రీజనింగ్ వల్ల వచ్చిందా లేదా కేవలం యాదృచ్ఛికంగా వచ్చిందా అని డెవలపర్లు చెప్పలేరు మరియు వారు తప్పుడు అలవాట్లను క్రమబద్ధంగా సరిదిద్దలేరు.
ABC క్రెడిట్ అసైన్మెంట్ను ఎలా మారుస్తుంది
Answer-Backtracked Credit Assignment అనేది సరైన చివరి సమాధానం నుండి వెనక్కి పనిచేస్తుంది. ఇది మొదట సమాధానం దేనిపై ఆధారపడి ఉందో ఆ ముఖ్యమైన క్లూలను—నిర్దిష్ట ఆధారాలు, మధ్యంతర ఫలితాలు లేదా స్టేట్ చెక్లను—సేకరిస్తుంది. ఆ తర్వాత, రికార్డ్ చేయబడిన ట్రేస్ ద్వారా వెనక్కి వెళ్తూ, ప్రతి చర్యను ఆ క్లూలతో పోల్చి స్కోరు చేస్తుంది. అవసరమైన క్లూకు నేరుగా సహకరించిన చర్యకు పాజిటివ్ క్రెడిట్ లభిస్తుంది; సంబంధం లేని లేదా హానికరమైన చర్యకు నెగటివ్ లేదా సున్నా స్కోరు లభిస్తుంది.
ఈ స్కోరింగ్ ఆధారంగా రెండు శిక్షణ విధానాలు ఉన్నాయి:
- ABC-SFT (Supervised Fine-Tuning) అనేది లాస్ ఫంక్షన్ను రీ-వెయిట్ చేస్తుంది, తద్వారా ఎక్కువ క్రెడిట్ ఉన్న దశలు మోడల్పై మరింత బలంగా ప్రభావం చూపుతాయి. గతంలో ఉపయోగకరమైన క్లూలకు దారితీసిన చర్యలకు ప్రాధాన్యత ఇవ్వడం మోడల్ నేర్చుకుంటుంది.
- ABC-GRPO (Gradient-based Reward Policy Optimization) అనేది ప్రతి దశ స్కోర్లను రీఇన్ఫోర్స్మెంట్ లెర్నింగ్ కోసం రివార్డ్ సిగ్నల్గా పరిగణిస్తుంది, తద్వారా సమాధానం రావడానికి సహాయపడిన సెర్చ్ యొక్క నిర్దిష్ట భాగాలను బలోపేతం చేస్తుంది.
బైనరీ పాస్/ఫెయిల్ లేబుల్ను సహకారం యొక్క వివరణాత్మక మ్యాప్గా మార్చడం ద్వారా, ABC మోడల్కు చాలా గొప్ప లెర్నింగ్ సిగ్నల్ను అందిస్తుంది.
ప్రారంభ ఫలితాలు స్పష్టంగా చెబుతున్నాయి
పరిశోధకులు సెర్చ్ స్టేట్ను ట్రాక్ చేసే కాంటెక్స్ట్-మేనేజ్మెంట్ లేయర్తో కూడిన ఒక సాధారణ 4 బిలియన్-పారామీటర్ల మోడల్కు ABCని వర్తింపజేశారు. సాధారణంగా చాలా పెద్ద ఏజెంట్లకు అనుకూలమైన బెంచ్మార్క్ టాస్క్లలో, ABC-శిక్షణ పొందిన మోడల్ ఆ పెద్ద సిస్టమ్లతో సమానంగా లేదా వాటి కంటే మెరుగ్గా పనిచేసింది. మోడల్ పరిమాణాన్ని పెంచకుండానే ఈ పనితీరు మెరుగుపడింది, ఇది మెరుగైన క్రెడిట్ అసైన్మెంట్ అనేది ముడి పారామీటర్ల సంఖ్యకు ప్రత్యామ్నాయంగా ఉండవచ్చని సూచిస్తుంది.
దీని నుండి తేలికైన సారాంశం ఏమిటంటే: మోడల్కు ఏమి పని చేసిందో స్పష్టమైన రసీదును ఇస్తే, అది అదే శిక్షణ డేటా నుండి ఎక్కువ విలువను పొందగలదు.
నిజ ప్రపంచ ఏజెంట్లకు దీని అర్థం ఏమిటి
మల్టీ-స్టెప్ పనులను చేసే ఏ ఏజెంట్ అయినా—కోడింగ్ అసిస్టెంట్లు, లిటరేచర్-రివ్యూ బాట్లు, కస్టమర్-సపోర్ట్ టూల్స్—అది చేసే చర్యల ట్రేస్పై ఆధారపడి ఉంటుంది. ఆ ట్రేస్ను భద్రపరచడం మరియు అంచనా వేయడం అనేది కేవలం ఒక అదనపు ఫీచర్ మాత్రమే కాదు; అది సమర్థవంతమైన అభ్యాసానికి (learning) చాలా అవసరం అని ABC చూపుతోంది.
- కోడింగ్ ఏజెంట్లు ప్లాన్, జారీ చేసిన ప్రతి కమాండ్ మరియు కోడ్ను ధృవీకరించే టెస్ట్ ఫలితాలను లాగ్ చేయాలి.
- రీసెర్చ్ ఏజెంట్లు తాము పంపిన క్వెరీలను, తెరిచిన మూలాలను (sources) మరియు సేకరించిన ఆధారాలను భద్రపరచుకోవాలి.
- సపోర్ట్ ఏజెంట్లు పరిష్కారానికి దారితీసిన ప్రతి స్టేట్ చెక్ మరియు నిర్ణయ పాయింట్ను రికార్డ్ చేయాలి.
ఈ ట్రేస్లు అందుబాటులో ఉన్నప్పుడు, ABC క్రెడిట్ను ఖచ్చితంగా కేటాయించగలదు, తద్వారా మోడల్ మంచి అలవాట్లను బలోపేతం చేసుకోవడానికి మరియు నైపుణ్యంగా పొరపాటున భావించే అదృష్టపు షార్ట్కట్లను వదిలివేయడానికి అనుమతిస్తుంది.
ప్రతికూల అంశాలు మరియు ఆచరణాత్మక అడ్డంకులు
ABC ప్రయోజనాలతో పాటు అదనపు సంక్లిష్టత కూడా వస్తుంది.
ముగింపు
Answer-Backtracked Credit Assignment అనేది ఏజెంట్లకు సెర్చ్ చేయడం, కోడింగ్ చేయడం మరియు రీజనింగ్ చేయడం నేర్పించే విధానాన్ని పూర్తిగా మార్చేస్తుంది. కేవలం చివరి ఫలితాన్ని మాత్రమే కాకుండా, ప్రక్రియలో చేసే సరైన అడుగులకు ప్రతిఫలం ఇవ్వడం ద్వారా, ఇది ఒక మధ్యస్థ పరిమాణం కలిగిన మోడల్ కూడా చాలా పెద్ద మోడల్స్ అంత సమర్థవంతంగా నేర్చుకునేలా చేస్తుంది. బహుళ దశల పనులను నిర్వహించాల్సిన ఏజెంట్లను రూపొందించే ఎవరికైనా, trace-centric training regimeని అనుసరించడం అనేది కేవలం ఒక ఎంపిక మాత్రమే కాదు—అది నమ్మదగిన, ఆడిటబుల్ మరియు అంతిమంగా మరింత తెలివైన AIని నిర్మించే మార్గం.
