Chombo kipya cha Claude cha Deep Research kinaweza kutumia token milioni 6.57 katika mwito mmoja—jambo ambalo ni lawezekana tu kwa bajeti kubwa ya uchakataji (compute). Mfumo huu si modeli ya lugha ya monolithic; unafanya kazi kama pipeline ya JavaScript ya map-reduce inayotandaza utafiti, inachukua data, inapinga madai dhidi ya wahakiki watatu huru, na kisha inaunganisha ripoti.

Kwa nini usanifu huu ni muhimu

Wasaidizi wengi wa utafiti wanaochochewa na AI huwasilisha kiolesura kimoja cha "uliza-na-jibu", wakiruhusu modeli kutengeneza maandishi na marejeo kwa mkupuo mmoja. Claude Deep Research inageuza mfumo huo kabisa. Inagawanya kazi katika hatua tofauti na zilizopangwa, na kuilazimisha modeli kufuata mfumo wa programu (software harness). Wabunifu waliitengeneza ili kudhibiti hali ya kutengeneza habari za uongo (hallucinations) huku bado ikitoa majibu tajiri yenye vyanzo. Mbinu hii inatokana na mfumo wa kutafuta hitilafu (bug-hunting) uliowezeshwa, ambapo nadharia hutengenezwa na kisha inajaribiwa makusudi kupingwa. Katika istilahi za utafiti, dai huzaliwa, kisha mawakala watatu wapinzani wanajaribu kulipinga kabla halijafikia hatua ya mwisho ya muhtasari.

Mtiririko wa map-reduce

  1. Fan-out search – Mratibu (orchestrator) huanzisha wafanyakazi sambamba wanaoulizia mfululizo wa vyanzo vya data.
  2. Fetch data – Kila mfanyakazi huchukua vipande vya habari ghafi, metadata, na taarifa zozote zilizopangwa zinazopatikana.
  3. Adversarial verification – Mawakala watatu huru wanapokea kila dai, kila mmoja akiagizwa kusema refuted (imepingwa) ikiwa hauna uhakika. Dai huendelea tu ikiwa imepata kura za kutosha za kukubaliwa.
  4. Synthesis – Madai yaliyobaki huunganishwa kuwa ripoti ya JSON ya mwisho ambayo mtumiaji anaweza kuibadilisha kuwa maandishi ya kawaida.

Ndani ya mfumo (harness)

Mfumo huu (harness) ni tabaka jembamba la kodi linalofafanua kile ambacho modeli ya lugha inaweza kufanya. Sheria zake zinaonekana kama seti ya kazi zilizopangwa:

  • SCOPE – Modeli inapokea maelezo mafupi ya swali la utafiti.
  • SEARCH – Lazima itoe orodha ya utambulisho wa vyanzo, wala si maandishi ya kawaida.
  • EXTRACT – Kwa kila chanzo, modeli inarudisha nukuu ya neno kwa neno inayounga mkono dai lolote linalofuata.
  • VERDICT – Inatengeneza kitu cha JSON (JSON object) chenye dai, nukuu inayounga mkono, na alama ya uaminifu.
  • REPORT – Hatua ya mwisho huunganisha madai yote yaliyothibitishwa kuwa katika hati moja.

Mfumo huu unasisitiza evidence binding: dai lisilo na nukuu sahihi hutupwa kiotomatiki. Pia unaonyesha policy constants ambazo zinaweza kurekebishwa bila kubadilisha kodi—jinsi ambavyo dai linahitaji kura za kukubaliwa, idadi ya vyanzo ambavyo mfumo unaweza kusoma, au idadi ya juu ya madai yanayoweza kuendelea kwenye uhakiki.

Hatua ya uchujaji (triage) ipo kati ya uchukuaji (extraction) na uhakiki. Badala ya kutuma kila dai kwa mawakala wapinzani wenye gharama kubwa, mfumo huyaweka katika mpangilio kulingana na umuhimu na ubora wa chanzo, kisha hutuma tu 25 bora zaidi. Uchujaji huu unazuia matumizi ya token na gharama za uchakataji zisizidi udhibiti.

Uhakiki wa kishindani katika vitendo

Hatua ya uhakiki imekusudiwa kuwa kali. Kila mmoja wa mawakala watatu anapokea dai lile lile na nukuu yake ya chanzo, kisha anafanya kazi chini ya seti ya maelekezo inayomwambia achukulie dai hilo ni la uongo isipokuwa apate ushahidi thabiti. Ikiwa wakala yeyote hana uhakika, anapiga kura ya refuted. Dai lazima likusanye idadi inayoweza kurekebishwa ya kura za affirmed (zilizothibitishwa) ili liendelee.

Wakati wa majaribio yasiyo rasmi, tabaka la kishindani liligundua dai lililokosea kusoma kipimo cha jumla (aggregate metric) kama alama maalum ya usahihi (precision score). Modeli ilikuwa imetengeneza taarifa ya kujiamini kuhusu usahihi, lakini chanzo kiliripoti tu kipimo cha jumla.

Kile usanifu unachofichua kuhusu ujenzi wa mifumo ya AI

  1. Tenga udhibiti kutoka kwa uwezo wa kufikiri – Modeli inabaki na jukumu la uwezo wa kufikiri (inference); mfumo (harness) unasisitiza nidhamu ya mchakato.
  2. Violesura vilivyopangwa (typed interfaces) hupunguza uongo (hallucination) – Kwa kudai matokeo ya JSON na nukuu sahihi, mfumo huondoa mkengeuko wa maandishi ya kawaida.
  3. Kuchuja madai kabla ya hatua ya gharama kubwa ya uhakiki hupunguza matumizi ya token na gharama za uchakataji.
  4. Chukulia ingizo la nje kama lisiloaminika – Kila nukuu ya chanzo inakaguliwa tena na mawakala huru, kuzuia hati moja yenye hitilafu isiharibu jibu lote.

Kanuni hizi zinaakisi mabadiliko mapana kuelekea usanifu wa “model-outside-the-model”, ambapo kodi ya kiamini (deterministic code) inashughulikia uratibu, uhalali, na ugawaji wa rasilimali badala ya modeli ya lugha ya uwezekano (probabilistic language model).

Changamoto zinazoweza kutokea na maswali ya wazi

Nguvu ya mtiririko huu—ukali wake—pia huleta changamoto.

Hoja nyingine ya utata ni utegemezi wa nukuu za neno kwa neno. Si maarifa yote yanayopatikana katika maneno yaliyonyooka; baadhi ya ufahamu hutokea tu baada ya kuunganisha maelezo kutoka nyaraka nyingi.

Nini cha kufuatilia baadaye

Claude’s Deep Research bado iko katika hatua ya utafiti, lakini usanifu wake unaashiria mustakabali ambapo mifumo mikubwa ya lugha (large language models) itajumuishwa katika mifumo ya utendaji (pipelines) inayodhibitiwa kwa karibu badala ya kuachwa kujiongoza yenyewe. Viashiria muhimu vya kufuatilia ni pamoja na:

  • Vipimo vya ufanisi wa token – Je, kiwango cha msingi cha token 6.57 M kitapungua kadiri mfumo unavyopata mantiki zaidi ya uchujaji wa upendeleo?
  • Mielekeo ya ucheleweshaji (latency trends) – Mfumo unaweza kutoa ripoti kamili kwa haraka kiasi gani wakati mawakala watatu wa uhakiki wanashiriki katika mchakato?

Hitimisho

Claude’s Deep Research inaonyesha kuwa mfumo wa lugha unaweza kutoa majibu ya kuaminika na yanayozingatia vyanzo wakati unapowekwa katika mfumo wa hatua nyingi uliodhibitiwa. Mafanikio ya kweli hayako kwenye ukubwa wa mfumo; bali ni programu inayozunguka inayolazimisha mfumo kuthibitisha kila dai, kupanga ushahidi kabla ya kutumia rasilimali za kompyuta, na kuchukulia kila kipande cha habari cha nje kama cha kutiliwa shaka hadi mawakala watatu wakubaliane vinginevyo. Kwa yeyote anayetengeneza zana zinazoendeshwa na AI, funzo ni wazi: uache mfumo ufikiri, lakini uache kodi iamue kile kinachoweza kusemwa.