Claude નું નવું Deep Research ટૂલ એક જ કોલમાં 6.57 મિલિયન ટોકન્સ સુધીનો ડેટા પ્રોસેસ કરી શકે છે—જે માત્ર વિશાળ કમ્પ્યુટ બજેટ દ્વારા જ શક્ય છે. આ સિસ્ટમ કોઈ મોનોલિથિક લેંગ્વેજ મોડલ નથી; તે એક કડક JavaScript map-reduce પાઇપલાઇન તરીકે કામ કરે છે જે સર્ચને વિસ્તૃત કરે છે, ડેટા મેળવે છે, દાવાઓને ત્રણ સ્વતંત્ર વેરિફાયર્સ સામે ચકાસે છે અને પછી રિપોર્ટ તૈયાર કરે છે.

આ આર્કિટેક્ચર શા માટે મહત્વનું છે

મોટાભાગના AI-સંચાલિત રિસર્ચ આસિસ્ટન્ટ્સ એક સિંગલ "પ્રશ્ન-અને-જવાબ" ઇન્ટરફેસ રજૂ કરે છે, જે મોડલને એકસાથે ટેક્સ્ટ અને સાઇટેશન જનરેટ કરવા દે છે. Claude નું Deep Research આ મોડલને સંપૂર્ણપણે બદલી નાખે છે. તે કાર્યને અલગ-અલગ, ટાઇપ્ડ તબક્કાઓમાં વિભાજિત કરે છે અને મોડલને સોફ્ટવેર હાર્નેસ (harness) નું પાલન કરવા માટે મજબૂર કરે છે. ડિઝાઇનરોએ તેને હેલ્યુસિનેશન (hallucinations) ને નિયંત્રણમાં રાખવા અને સાથે સાથે સમૃદ્ધ, સોર્સ સાથેના જવાબો આપવા માટે બનાવ્યું છે. આ અભિગમ એક ઓટોમેટેડ બગ-હન્ટિંગ ફ્રેમવર્ક પરથી આવે છે, જ્યાં એક પરિકલ્પના (hypothesis) જનરેટ કરવામાં આવે છે અને પછી તેને જાણીજોઈને ખોટી સાબિત કરવાનો પ્રયાસ કરવામાં આવે છે. રિસર્ચની દ્રષ્ટિએ જોઈએ તો, એક દાવો રજૂ થાય છે, અને પછી ત્રણ એડવર્સરીયલ એજન્ટ્સ તેને અંતિમ સિન્થેસિસ સુધી પહોંચતા પહેલા જ નકારવાનો પ્રયાસ કરે છે.

The map-reduce flow

  1. Fan-out search – ઓર્કેસ્ટ્રેટર સમાંતર વર્કર્સ બનાવે છે જે ડેટાના વિવિધ સ્ત્રોતોમાંથી ક્વેરી કરે છે.
  2. Fetch data – દરેક વર્કર કાચા સ્નિપેટ્સ, મેટાડેટા અને ઉપલબ્ધ કોઈપણ સ્ટ્રક્ચર્ડ માહિતી મેળવે છે.
  3. Adversarial verification – ત્રણ સ્વતંત્ર એજન્ટ્સ દરેક દાવાને મેળવે છે, જેમાં દરેકને અનિશ્ચિત હોવા પર refuted (ખંડિત) ગણવાની સૂચના આપવામાં આવે છે. દાવો ત્યારે જ ટકી શકે છે જો તે પૂરતા હકારાત્મક મતો મેળવે.
  4. Synthesis – ટકી રહેલા દાવાઓને એક અંતિમ JSON રિપોર્ટમાં જોડવામાં આવે છે જેને યુઝર ગદ્ય (prose) તરીકે જોઈ શકે છે.

Inside the harness

હાર્નેસ એ કોડનું એક પાતળું સ્તર છે જે વ્યાખ્યાયિત કરે છે કે લેંગ્વેજ મોડલ શું કરી શકે છે. તેના નિયમો સ્ટ્રક્ચર્ડ કાર્યોના સેટ તરીકે દેખાય છે:

  • SCOPE – મોડલને સંશોધન પ્રશ્નનું સંક્ષિપ્ત વર્ણન મળે છે.
  • SEARCH – તેણે સ્ત્રોત ઓળખકર્તાઓની (source identifiers) યાદી આપવી જોઈએ, ક્યારેય ફ્રી-ફોર્મ ટેક્સ્ટ નહીં.
  • EXTRACT – દરેક સ્ત્રોત માટે, મોડલ શબ્દશઃ અવતરણ (verbatim quote) આપે છે જે કોઈપણ અનુગામી દાવાને સમર્થન આપે છે.
  • VERDICT – તે એક JSON ઓબ્જેક્ટ બનાવે છે જેમાં દાવો, સમર્થન આપતું અવતરણ અને કોન્ફિડન્સ સ્કોર હોય છે.
  • REPORT – અંતિમ તબક્કો તમામ વેરિફાઇડ દાવાઓને એક સિંગલ ડોક્યુમેન્ટમાં સમાવિષ્ટ કરે છે.

હાર્નેસ evidence binding (પુરાવા જોડાણ) લાગુ કરે છે: ચોક્કસ અવતરણ વગરના દાવાને આપમેળે નકારી દેવામાં આવે છે. તે policy constants પણ પ્રદાન કરે છે જેને કોડ બદલ્યા વિના એડજસ્ટ કરી શકાય છે—દાખલા તરીકે, દાવાને કેટલા હકારાત્મક મતોની જરૂર છે, સિસ્ટમ કેટલા સ્ત્રોતો વાંચી શકે છે, અથવા વેરિફિકેશન માટે કેટલા મહત્તમ દાવા આગળ વધી શકે છે.

એક્સટ્રેક્શન અને વેરિફિકેશન વચ્ચે એક ટ્રાયજ (triage) સ્ટેપ હોય છે. દરેક દાવાને ખર્ચાળ એડવર્સરીયલ એજન્ટ્સ પાસે મોકલવાને બદલે, સિસ્ટમ તેમને મહત્વ અને સ્ત્રોતની ગુણવત્તા મુજબ રેન્ક આપે છે, અને પછી માત્ર ટોચના 25 ને જ આગળ મોકલે છે. આ ફિલ્ટરિંગ ટોકન વપરાશ અને કમ્પ્યુટ ખર્ચને અનિયંત્રિત થતો અટકાવે છે.

Adversarial verification in practice

વેરિફિકેશન તબક્કો જાણીજોઈને કડક રાખવામાં આવ્યો છે. ત્રણેય એજન્ટોમાંથી દરેકને સમાન દાવો અને તેનું સ્ત્રોત અવતરણ મળે છે, અને પછી તે એવા ઇન્સ્ટ્રક્શન સેટ હેઠળ કામ કરે છે જે તેને જ્યાં સુધી નિર્ણાયક પુરાવા ન મળે ત્યાં સુધી દાવો ખોટો હોવાનું માની લેવા કહે છે. જો કોઈ એજન્ટ અનિશ્ચિત હોય, તો તે refuted માટે વોટ આપે છે. દાવાને ટકી રહેવા માટે નિર્ધારિત સંખ્યામાં affirmed (પુષ્ટિ થયેલ) મતો મેળવવા જરૂરી છે.

અનૌપચારિક પરીક્ષણ દરમિયાન, એડવર્સરીયલ લેયરે એક એવો દાવો પકડ્યો હતો જેણે એગ્રીગેટ મેટ્રિકને ચોક્કસ પ્રિસિઝન સ્કોર તરીકે ખોટી રીતે વાંચ્યો હતો. મોડલે પ્રિસિઝન વિશે આત્મવિશ્વાસપૂર્ણ નિવેદન આપ્યું હતું, પરંતુ સ્ત્રોતે માત્ર એગ્રીગેટ મેટ્રિક જ રિપોર્ટ કર્યો હતો.

What the design reveals about AI system building

  1. કંટ્રોલને રીઝનિંગથી અલગ કરો – મોડલ ઇન્ફરન્સ (inference) માટે જવાબદાર રહે છે; હાર્નેસ પ્રક્રિયાનું શિસ્તબદ્ધ પાલન કરાવે છે.
  2. ટાઇપ્ડ ઇન્ટરફેસ હેલ્યુસિનેશન ઘટાડે છે – JSON આઉટપુટ અને ચોક્કસ અવતરણોની માંગ કરીને, સિસ્ટમ ફ્રી-ફોર્મ ડ્રિફ્ટને દૂર કરે છે.
  3. ખર્ચાળ વેરિફિકેશન સ્ટેપ પહેલા દાવાઓને ફિલ્ટર કરવાથી ટોકન વપરાશ અને કમ્પ્યુટ ખર્ચ ઘટે છે.
  4. બાહ્ય ઇનપુટને અવિશ્વસનીય ગણો – દરેક સ્ત્રોત અવતરણને સ્વતંત્ર એજન્ટો દ્વારા ફરીથી તપાસવામાં આવે છે, જેથી કોઈ એક ક્ષતિગ્રસ્ત દસ્તાવેજ જવાબને દૂષિત ન કરી શકે.

આ સિદ્ધાંતો "model-outside-the-model" આર્કિટેક્ચર તરફના વ્યાપક ફેરફારને પ્રતિબિંબિત કરે છે, જ્યાં પ્રોબેબિલિસ્ટિક લેંગ્વેજ મોડલને બદલે ડેટરમિનિસ્ટિક કોડ ઓર્કેસ્ટ્રેશન, વેલિડેશન અને રિસોર્સ એલોકેશન સંભાળે છે.

Potential downsides and open questions

પાઇપલાઇનની શક્તિ—તેની કડકતા—પડકારો પણ લાવે છે.

વિવાદનો બીજો મુદ્દો શબ્દશઃ અવતરણો (verbatim quotes) પરની નિર્ભરતા છે. બધું જ જ્ઞાન ચોક્કસ શબ્દોમાં હોતું નથી; કેટલાક આંતરદૃષ્ટિ અનેક દસ્તાવેજોના સંશ્લેષણ પછી જ મળે છે.

આગળ શું જોવું

Claude નું Deep Research હજુ પણ સંશોધન તબક્કામાં છે, પરંતુ તેની આર્કિટેક્ચર એવા ભવિષ્યનો સંકેત આપે છે જ્યાં લાર્જ લેંગ્વેજ મોડલ્સને સ્વયં-નિર્દેશિત કરવાને બદલે સખત રીતે નિયંત્રિત પાઇપલાઇન્સમાં સમાવિષ્ટ કરવામાં આવે છે. દેખરેખ રાખવા માટેના મુખ્ય સૂચકોમાં નીચેનાનો સમાવેશ થાય છે:

  • Token-efficiency metrics – શું હાર્નેસ વધુ પસંદગીયુક્ત ટ્રાયજ લોજિક (selective triage logic) મેળવશે ત્યારે 6.57 M ટોકન બેઝલાઇન ઘટશે?
  • Latency trends – જ્યારે ત્રણ વેરિફિકેશન એજન્ટ્સ લૂપમાં હોય ત્યારે સિસ્ટમ કેટલી ઝડપથી સંપૂર્ણ રિપોર્ટ આપી શકે છે?

મુખ્ય સારાંશ

Claude નું Deep Research દર્શાવે છે કે જ્યારે લેંગ્વેજ મોડલને શિસ્તબદ્ધ, બહુ-તબક્કાવાર પાઇપલાઇનમાં મર્યાદિત રાખવામાં આવે ત્યારે તે વિશ્વસનીય અને સ્ત્રોત-આધારિત જવાબો આપી શકે છે. સાચી સફળતા મોડલના કદમાં નથી; તે તેની આસપાસનું સોફ્ટવેર છે જે મોડલને દરેક દાવાને સાબિત કરવા, કમ્પ્યુટ ખર્ચ કરતા પહેલા પુરાવાઓને ક્રમ આપવા અને જ્યાં સુધી ત્રણ એજન્ટો સહમત ન થાય ત્યાં સુધી દરેક બાહ્ય સ્નિપેટને શંકાસ્પદ ગણવા માટે મજબૂર કરે છે. AI-સંચાલિત સાધનો બનાવનાર કોઈપણ વ્યક્તિ માટે, પાઠ સ્પષ્ટ છે: મોડલને વિચારવા દો, પરંતુ તે શું કહી શકે છે તેનો નિર્ણય કોડને લેવા દો.