Claude चे नवीन Deep Research टूल एका सिंगल कॉलमध्ये ६.५७ दशलक्ष (million) tokens वापरू शकते—जे केवळ प्रचंड 'compute budget' मुळे शक्य आहे. ही प्रणाली एक 'monolithic language model' नाही; ती एका कडक JavaScript map-reduce pipeline प्रमाणे कार्य करते जी शोध (searches) विस्तारते, डेटा मिळवते, दाव्यांची (claims) तीन स्वतंत्र पडताळणीकर्त्यांशी (verifiers) तुलना करते आणि शेवटी अहवाल तयार करते.

आर्किटेक्चर का महत्त्वाचे आहे

बहुतेक AI-आधारित रिसर्च असिस्टंट्स एक साधे "प्रश्न आणि उत्तर" (ask-and-answer) इंटरफेस देतात, ज्यामुळे मॉडेल एकाच वेळी मजकूर आणि संदर्भ (citations) तयार करू शकते. Claude चे Deep Research हे मॉडेल पूर्णपणे उलट करते. ते कामाचे वेगवेगळ्या, विशिष्ट टप्प्यांमध्ये विभाजन करते आणि मॉडेलला एका 'software harness' चे पालन करण्यास भाग पाडते. समृद्ध आणि स्रोतांवर आधारित उत्तरे देतानाच 'hallucinations' (चुकीची माहिती निर्माण होणे) नियंत्रित ठेवण्यासाठी डिझाइनर्सनी हे तयार केले आहे. हा दृष्टिकोन एका स्वयंचलित 'bug-hunting framework' वरून आला आहे, जिथे प्रथम एक गृहितक (hypothesis) तयार केले जाते आणि नंतर ते जाणीवपूर्वक खोडून काढण्याचा प्रयत्न केला जातो. संशोधनाच्या भाषेत सांगायचे तर, एक दावा (claim) तयार होतो आणि अंतिम संश्लेषणापर्यंत (synthesis) पोहोचण्यापूर्वी तीन 'adversarial agents' तो खोडून काढण्याचा प्रयत्न करतात.

map-reduce प्रवाह

  1. Fan-out search – ऑर्केस्ट्रेटर (orchestrator) समांतर वर्कर्स तयार करतो जे विविध डेटा स्रोतांना क्वेरी करतात.
  2. Fetch data – प्रत्येक वर्कर कच्चा मजकूर (raw snippets), मेटाडेटा आणि उपलब्ध असलेली कोणतीही स्ट्रक्चर्ड माहिती गोळा करतो.
  3. Adversarial verification – तीन स्वतंत्र एजंट्सना प्रत्येक दावा प्राप्त होतो, ज्यांना अनिश्चिततेच्या वेळी तो refuted (नाकारलेला) मानण्याची सूचना दिली जाते. जर दाव्याला पुरेसे सकारात्मक मते मिळाले तरच तो टिकतो.
  4. Synthesis – टिकलेले दावे एकत्र करून एक अंतिम JSON रिपोर्ट तयार केला जातो, जो वापरकर्ता मजकूर (prose) म्हणून पाहू शकतो.

harness च्या आत

harness हा कोडचा एक पातळ थर आहे जो लँग्वेज मॉडेल काय करू शकते हे ठरवतो. त्याचे नियम संरचित कामांच्या संचाच्या स्वरूपात दिसतात:

  • SCOPE – मॉडेलला संशोधन प्रश्नाचे संक्षिप्त वर्णन मिळते.
  • SEARCH – मॉडेलने केवळ सोर्स आयडेंटिफायर्सची (source identifiers) यादी द्यावी, कधीही मुक्त मजकूर (free-form text) देऊ नये.
  • EXTRACT – प्रत्येक स्रोतासाठी, मॉडेलने कोणताही दावा सिद्ध करण्यासाठी मूळ शब्दशः अवतरण (verbatim quote) द्यावे.
  • VERDICT – हे दावा, आधारभूत अवतरण आणि कॉन्फिडन्स स्कोअर (confidence score) असलेला एक JSON ऑब्जेक्ट तयार करते.
  • REPORT – अंतिम टप्प्यात सर्व पडताळणी केलेले दावे एकाच दस्तऐवजात एकत्रित केले जातात.

harness evidence binding लागू करते: अचूक अवतरण नसलेला दावा आपोआप बाद केला जातो. हे policy constants देखील उपलब्ध करून देते जे कोड न बदलता बदलता येतात—उदा. एखाद्या दाव्याला किती सकारात्मक मते आवश्यक आहेत, सिस्टम किती स्रोत वाचू शकते, किंवा पडताळणीसाठी जाणाऱ्या दाव्यांची कमाल संख्या किती असावी.

एक्सट्रॅक्शन (extraction) आणि व्हेरिफिकेशन (verification) च्या दरम्यान एक 'triage step' असतो. प्रत्येक दावा महागड्या 'adversarial agents' कडे पाठवण्याऐवजी, सिस्टम त्यांचे महत्त्व आणि स्रोतांच्या गुणवत्तेनुसार रँकिंग करते आणि फक्त टॉप 25 दावे पुढे पाठवते. या निवडीमुळे (culling) टोकन वापर आणि कॉम्प्युट खर्च नियंत्रणाबाहेर जाण्यापासून रोखला जातो.

प्रत्यक्ष वापरातील adversarial verification

पडताळणीचा टप्पा जाणीवपूर्वक कठोर ठेवला आहे. तीनही एजंट्सना तोच दावा आणि त्याचे मूळ अवतरण मिळते, आणि त्यानंतर ते अशा सूचनांच्या आधारे काम करतात की जोपर्यंत निर्णायक पुरावा मिळत नाही तोपर्यंत दावा चुकीचाच आहे असे मानले जावे. जर एखादा एजंट अनिश्चित असेल, तर तो refuted असे मत देतो. टिकण्यासाठी दाव्याला ठराविक संख्येने affirmed (मान्य) मते मिळवणे आवश्यक असते.

अनौपचारिक चाचणीदरम्यान, 'adversarial layer' ने असा एक दावा पकडला ज्याने 'aggregate metric' ला चुकीच्या पद्धतीने 'specific precision score' म्हणून वाचले होते. मॉडेलने अचूकतेबद्दल (precision) एक आत्मविश्वासाने भरलेला विधान तयार केले होते, परंतु मूळ स्रोत केवळ 'aggregate metric' ची माहिती देत होता.

AI सिस्टम निर्मितीबद्दल हे डिझाइन काय सांगते

  1. नियंत्रण आणि तर्क (reasoning) वेगळे करा – मॉडेल केवळ 'inference' साठी जबाबदार राहते; harness प्रक्रियेतील शिस्त पाळते.
  2. Typed interfaces मुळे hallucinations कमी होतात – JSON आउटपुट आणि अचूक अवतरणांची मागणी करून, ही प्रणाली मुक्त मजकुरातील विचलनामुळे (free-form drift) होणाऱ्या चुका टाळते.
  3. महागड्या पडताळणी टप्प्यापूर्वी दावे फिल्टर केल्यामुळे टोकन वापर आणि कॉम्प्युट खर्च कमी होतो.
  4. बाह्य इनपुटवर विश्वास ठेवू नका – प्रत्येक स्रोताचे अवतरण स्वतंत्र एजंट्सद्वारे पुन्हा तपासले जाते, ज्यामुळे एखादा चुकीचा दस्तऐवज संपूर्ण उत्तराला दूषित करण्यापासून रोखला जातो.

ही तत्त्वे "model-outside-the-model" आर्किटेक्चरकडे होणाऱ्या व्यापक बदलाचे प्रतिबिंब आहेत, जिथे संभाव्यतेवर आधारित (probabilistic) लँग्वेज मॉडेलऐवजी 'deterministic code' ऑर्केस्ट्रेशन, प्रमाणीकरण (validation) आणि संसाधन वाटप (resource allocation) हाताळते.

संभाव्य तोटे आणि उघडे प्रश्न

या पाइपलाइनची ताकद—त्याची कठोरता—च आव्हाने देखील घेऊन येते.

वादाचा दुसरा मुद्दा म्हणजे शब्दशः अवतरणांवर (verbatim quotes) अवलंबून राहणे. सर्व ज्ञान नेमक्या शब्दांत नसते; काही निष्कर्ष अनेक कागदपत्रांचे संश्लेषण (synthesizing) केल्यानंतरच समोर येतात.

पुढे काय पाहावे

Claude चे Deep Research अजूनही संशोधन टप्प्यात आहे, परंतु त्याची रचना अशा भविष्याकडे संकेत देते जिथे लार्ज लँग्वेज मॉडेल्सना स्वतःच्या मर्जीने चालण्याऐवजी काटेकोरपणे नियंत्रित केलेल्या पाइपलाइनमध्ये अंतर्भूत केले जाईल. लक्ष ठेवण्यासारखे महत्त्वाचे निर्देशक खालीलप्रमाणे आहेत:

  • टोकन-कार्यक्षमता मेट्रिक्स (Token-efficiency metrics) – जसा हार्नेसमध्ये अधिक निवडक ट्रायज लॉजिक (selective triage logic) येईल, तशी 6.57 M टोकनची बेसलाइन कमी होईल का?
  • लॅटन्सी ट्रेंड्स (Latency trends) – जेव्हा तीन पडताळणी एजंट्स (verification agents) कार्यरत असतात, तेव्हा सिस्टम किती वेगाने संपूर्ण अहवाल देऊ शकते?

निष्कर्ष

Claude चे Deep Research हे दर्शवते की जेव्हा लँग्वेज मॉडेलला एका शिस्तबद्ध, बहु-स्तरीय पाइपलाइनमध्ये मर्यादित ठेवले जाते, तेव्हा ते विश्वासार्ह आणि स्त्रोतांवर आधारित उत्तरे देऊ शकते. खरा breakthrough मॉडेलच्या आकारात नसून, सभोवतालच्या सॉफ्टवेअरमध्ये आहे, जे मॉडेलला प्रत्येक दावा सिद्ध करण्यास भाग पाडते, कम्प्युट खर्च करण्यापूर्वी पुराव्यांना क्रमवारी देते आणि जोपर्यंत तीन एजंट्स तसे मानत नाहीत, तोपर्यंत प्रत्येक बाह्य उतारा संशयास्पद मानतो. AI-आधारित साधने तयार करणाऱ्यांसाठी धडा स्पष्ट आहे: मॉडेलला विचार करू द्या, पण ते काय बोलू शकते याचा निर्णय कोडला घेऊ द्या.