Mbinu mpya ya ABSeeker ya “Answer-Backtracked Credit Assignment” (ABC) inaruhusu wakala wa utafutaji wa muda mrefu (long-horizon search agents) kupata sifa kwa kila hatua ya mtu binafsi badala ya jibu la mwisho pekee, na model yenye vigezo bilioni 4 iliyofundishwa kwa mbinu hiyo inaweza tayari kulingana au kuzidi washindani wakubwa zaidi.

Mageuzi haya ni muhimu kwa sababu wakala wengi waliopo hivi sasa hupimwa tu mwishoni mwa kazi. Ikiwa jibu la mwisho ni sahihi, mzunguko mzima unatajwa kuwa mzuri; ikiwa ni kosa, mfuatano mzima unatajwa kuwa mbaya. Maoni hayo ya "kila kitu au hakuna kitu" huficha ishara halisi ya kujifunza—hatua nzuri zinazofuatiwa na kosa, au vibonyezo visivyo na maana ambavyo kwa bahati nzuri vinapelekea matokeo sahihi. Mtazamo wa ABSeeker unabadilisha kanuni hiyo.

Kwa nini mbinu ya zamani haitoshi

Wakala anapotafuta, kuandika kodi, au kukusanya ushahidi, kwa kawaida huchukua hatua nyingi: kutoa maswali, kufungua kurasa, kuendesha amri, kukagua hali ya mfumo, na kadhalika. Katika mzunguko wa hatua kumi na tano, hatua moja mbaya inaweza kuharibu jibu la mwisho, hata kama hatua zilizotangulia zilikuwa sahihi. Kinyume chake, mzunguko unaomalizika na jibu sahihi unaweza kuwa umetekemea bahati, huku hatua nyingi zisizoongeza thamani. Kufundishwa kwa kutumia matokeo ya mwisho pekee huilazimisha model kutazama mfuatano mzima kama sanduku jeusi (black box) moja, jambo linalofanya iwe vigumu kujifunza ni tabia gani ndogo ambazo ni muhimu kweli.

Hali hii inafanana na kutafuta na kurekebisha makosa (debugging) katika uhandisi wa programu. Watengenezaji hufuatilia kila mstari, hutenga sehemu inayofeli, na kuirekebisha. Hata hivyo, wakala wamepewa mfuatano wa kazi zao za ndani unaolingana na huo. Bila mfuatano huo wa ukaguzi, watengenezaji hawawezi kujua ikiwa uboreshaji unatokana na uwezo bora wa kufikiri au bahati tu, na hawawezi kusahihisha tabia mbaya kwa utaratibu.

Jinsi ABC inavyobadilisha ugawaji wa sifa

Answer-Backtracked Credit Assignment inafanya kazi kinyume kuanzia jibu sahihi la mwisho. Kwanza, inatoa vidokezo muhimu ambavyo jibu linategemea—vipande maalum vya ushahidi, matokeo ya kati, au ukaguzi wa hali. Kisha inarudi nyuma kupitia mfuatano uliorekodiwa, ikipima kila hatua dhidi ya vidokezo hivyo. Hatua inayochangia moja kwa moja kidokezo kinachohitajika inapata sifa chanya; hatua isiyo na maana au inayodhuru inapokea alama hasi au sifuri.

Mbinu mbili za mafunzo zinajengwa juu ya upimaji huu:

  • ABC-SFT (Supervised Fine-Tuning) inabadilisha uzito wa loss function ili hatua zenye sifa kubwa ziwe na ushawishi mkubwa zaidi kwenye model. Model inajifunza kutoa kipaumbele kwa hatua ambazo kihistoria zilielekeza kwenye vidokezo muhimu.
  • ABC-GRPO (Gradient-based Reward Policy Optimization) inachukulia alama za kila hatua kama ishara ya tuzo kwa ajili ya reinforcement learning, ikisisitiza sehemu mahususi za utafutaji ambazo zilisaidia jibu kutokea.

Kwa kubadilisha lebo ya kupita/kufeli (binary pass/fail) kuwa ramani ya kina ya mchango, ABC inampa model ishara tajiri zaidi ya kujifunza.

Matokeo ya awali yanaonyesha mengi

Watafiti walitumia ABC kwenye model ndogo yenye vigezo bilioni 4 iliyowekwa na tabaka la usimamizi wa muktadha (context-management layer) inayofuatilia hali inayobadilika ya utafutaji. Katika kazi za kulinganisha (benchmark tasks) ambazo kwa kawaida hupendelea wakala wakubwa zaidi, model iliyofundishwa kwa ABC ililingana au ilifanya vizuri zaidi kuliko mifumo hiyo mikubwa. Ongezeko hilo la utendaji lilikuja bila kuongeza ukubwa wa model, jambo linaloashiria kuwa ugawaji bora wa sifa unaweza kuchukua nafasi ya idadi ghafi ya vigezo (parameter count).

Funzo kuu ni rahisi: mpe model mfuatano wa wazi wa kile kilichofanya kazi, na inaweza kutoa thamani zaidi kutoka kwa kiasi kilekile cha data ya mafunzo.

Hii inamaanisha nini kwa wakala wa ulimwengu halisi

Wakala wowote unaofanya kazi ya hatua nyingi—wasaidizi wa uandishi wa kodi, roboti wa mapitio ya fasihi, zana za huduma kwa wateja—hutegemea mfuatano wa hatua zake. ABC inaonyesha kuwa kuhifadhi na kutathmini mfuatano huo si kitu cha ziada cha hiari; ni muhimu kwa ajili ya kujifunza kwa ufanisi.

  • Wakala wa uandishi wa kodi wanahitaji kuweka kumbukumbu ya mpango, kila amri iliyotolewa, na matokeo ya majaribio yanayothibitisha kodi hiyo.
  • Wakala wa utafiti lazima wahifadhi maswali waliotuma, vyanzo walivyofungua, na ushahidi waliochukua.
  • Wakala wa huduma wanapaswa kurekodi kila ukaguzi wa hali na hatua ya maamuzi iliyopelekea utatuzi.

Mfuatano huu unapopatikana, ABC inaweza kugawa sifa kwa usahihi, ikiruhusu model kuimarisha tabia nzuri na kuacha njia za mkato za bahati ambazo vinginevyo zingechukuliwa kuwa ujuzi.

Hoja pinzani na vikwazo vya kivitendo

Faida za ABC huja na utata wa ziada.

Hitimisho

Answer-Backtracked Credit Assignment inageuza mwelekeo wa jinsi tunavyofundisha wakala kutafuta, kuandika kodi, na kufikiri. Kwa kutoa zawadi kwa hatua sahihi zinazochukuliwa njiani badala ya kulenga matokeo ya mwisho pekee, inaruhusu mfano wenye ukubwa wa wastani kujifunza kwa ufanisi sawa na mifano mikubwa zaidi. Kwa yeyote anayeunda wakala wanaopaswa kufanya kazi za hatua nyingi, kuanza mfumo wa mafunzo unaozingatia kumbukumbu za hatua (trace-centric) si jambo la hiari—ndiyo njia ya kupata AI inayoweza kuaminika, inayoweza kukaguliwa, na hatimaye yenye akili zaidi.