Claude-এর নতুন Deep Research টুল একটি মাত্র কলে ৬.৫৭ মিলিয়ন টোকেন ব্যবহার করতে পারে—যা কেবল একটি বিশাল কম্পিউট বাজেট দিয়েই সম্ভব। এই সিস্টেমটি কোনো একটি একক (monolithic) ল্যাঙ্গুয়েজ মডেল নয়; এটি একটি কঠোর JavaScript map-reduce পাইপলাইন হিসেবে কাজ করে যা সার্চগুলোকে ছড়িয়ে দেয় (fan out), ডেটা সংগ্রহ করে, তিনটি স্বতন্ত্র ভেরিফায়ারের কাছে দাবিগুলোকে যাচাই করে এবং শেষে একটি রিপোর্ট তৈরি করে।
কেন এই আর্কিটেকচারটি গুরুত্বপূর্ণ
বেশিরভাগ AI-চালিত রিসার্চ অ্যাসিস্ট্যান্ট একটি একক "জিজ্ঞাসা এবং উত্তর" (ask-and-answer) ইন্টারফেস প্রদান করে, যেখানে মডেলটি একবারে টেক্সট এবং সাইটেশন তৈরি করে। Claude-এর Deep Research এই মডেলটিকে সম্পূর্ণ উল্টে দেয়। এটি কাজটিকে আলাদা এবং নির্দিষ্ট (typed) ধাপে বিভক্ত করে এবং মডেলটিকে একটি সফটওয়্যার হারনেস (harness) মেনে চলতে বাধ্য করে। ডিজাইনাররা এটি এমনভাবে তৈরি করেছেন যাতে সমৃদ্ধ এবং তথ্যসূত্রযুক্ত উত্তর দেওয়ার পাশাপাশি হ্যালুসিনেশন (hallucination) নিয়ন্ত্রণে রাখা যায়। এই পদ্ধতিটি একটি স্বয়ংক্রিয় বাগ-হান্টিং ফ্রেমওয়ার্ক থেকে এসেছে, যেখানে একটি হাইপোথিসিস তৈরি করা হয় এবং তারপর সেটি ইচ্ছাকৃতভাবে ভুল প্রমাণ করার চেষ্টা করা হয়। গবেষণার ভাষায় বলতে গেলে, একটি দাবি (claim) তৈরি হয়, তারপর তিনটি অ্যাডভারসারিয়াল এজেন্ট (adversarial agents) চূড়ান্ত সংশ্লেষণের (synthesis) আগে সেটিকে বাতিল করার চেষ্টা করে।
map-reduce ফ্লো
- Fan-out search – অর্কেস্ট্রেটর সমান্তরাল কর্মী (parallel workers) তৈরি করে যারা বিভিন্ন ডেটা সোর্স থেকে তথ্য অনুসন্ধান করে।
- Fetch data – প্রতিটি কর্মী র (raw) স্নিপেট, মেটাডেটা এবং যেকোনো উপলব্ধ স্ট্রাকচার্ড তথ্য সংগ্রহ করে।
- Adversarial verification – তিনটি স্বতন্ত্র এজেন্ট প্রতিটি দাবি গ্রহণ করে, যেখানে প্রতিটি এজেন্টকে নির্দেশ দেওয়া হয় যে অনিশ্চিত অবস্থায় যেন তারা দাবিটিকে refuted (প্রত্যাখ্যাত) হিসেবে গণ্য করে। দাবিটি কেবল তখনই টিকে থাকে যদি এটি যথেষ্ট সমর্থনমূলক ভোট পায়।
- Synthesis – টিকে থাকা দাবিগুলোকে একটি চূড়ান্ত JSON রিপোর্টে একত্রিত করা হয় যা ব্যবহারকারী গদ্য (prose) হিসেবে দেখতে পারেন।
হারনেসের ভেতরে
হারনেস হলো কোডের একটি পাতলা স্তর যা ল্যাঙ্গুয়েজ মডেল কী করতে পারে তা নির্ধারণ করে। এর নিয়মগুলো কতগুলো স্ট্রাকচার্ড টাস্ক হিসেবে দেখা যায়:
- SCOPE – মডেলটি গবেষণার প্রশ্নের একটি সংক্ষিপ্ত বিবরণ পায়।
- SEARCH – এটিকে অবশ্যই সোর্স আইডেন্টিফায়ারের একটি তালিকা প্রদান করতে হবে, কখনোই মুক্ত টেক্সট (free-form text) নয়।
- EXTRACT – প্রতিটি সোর্সের জন্য, মডেলটি হুবহু একটি উদ্ধৃতি (verbatim quote) প্রদান করে যা পরবর্তী যেকোনো দাবিকে সমর্থন করে।
- VERDICT – এটি একটি JSON অবজেক্ট তৈরি করে যাতে দাবি, সমর্থনকারী উদ্ধৃতি এবং একটি কনফিডেন্স স্কোর থাকে।
- REPORT – চূড়ান্ত ধাপটি সমস্ত যাচাইকৃত দাবিকে একটি একক ডকুমেন্টে গুছিয়ে দেয়।
হারনেস evidence binding (প্রমাণ ভিত্তিক সংযোগ) নিশ্চিত করে: সঠিক উদ্ধৃতি ছাড়া কোনো দাবি স্বয়ংক্রিয়ভাবে বাতিল হয়ে যায়। এটি এমন কিছু policy constants প্রকাশ করে যা কোড পরিবর্তন না করেই পরিবর্তন করা সম্ভব—যেমন একটি দাবির জন্য কতটি সমর্থনমূলক ভোট প্রয়োজন, সিস্টেমটি কতগুলো সোর্স পড়তে পারে, অথবা যাচাইকরণের জন্য সর্বোচ্চ কতটি দাবি পাঠানো যেতে পারে।
এক্সট্রাকশন এবং ভেরিফিকেশনের মাঝে একটি ট্রায়াজ (triage) ধাপ রয়েছে। প্রতিটি দাবি ব্যয়বহুল অ্যাডভারসারিয়াল এজেন্টদের কাছে না পাঠিয়ে, সিস্টেমটি সেগুলোকে গুরুত্ব এবং সোর্সের গুণমান অনুযায়ী র্যাঙ্ক করে এবং কেবল শীর্ষ ২৫টি দাবি পাঠায়। এই বাছাই প্রক্রিয়া টোকেন ব্যবহার এবং কম্পিউট খরচকে নিয়ন্ত্রণের বাইরে যেতে বাধা দেয়।
ব্যবহারিক ক্ষেত্রে অ্যাডভারসারিয়াল ভেরিফিকেশন
ভেরিফিকেশন ধাপটি ইচ্ছাকৃতভাবে কঠোর। তিনটি এজেন্টের প্রত্যেকটি একই দাবি এবং এর সোর্স উদ্ধৃতি পায়, এবং তারপর এমন একটি নির্দেশিকা অনুযায়ী কাজ করে যা দাবিটিকে মিথ্যা ধরে নিতে বলে, যদি না তারা কোনো চূড়ান্ত প্রমাণ পায়। যদি কোনো এজেন্ট নিশ্চিত না হয়, তবে সে refuted ভোট দেয়। টিকে থাকার জন্য দাবিটিকে একটি নির্দিষ্ট সংখ্যক affirmed (অনুমোদিত) ভোট সংগ্রহ করতে হয়।
অনানুষ্ঠানিক পরীক্ষার সময়, অ্যাডভারসারিয়াল লেয়ার এমন একটি দাবি ধরে ফেলেছিল যা একটি অ্যাগ্রিগেট মেট্রিককে (aggregate metric) ভুলবশত একটি নির্দিষ্ট প্রিসিশন স্কোর (precision score) হিসেবে পড়েছিল। মডেলটি প্রিসিশন সম্পর্কে একটি আত্মবিশ্বাসী বিবৃতি তৈরি করেছিল, কিন্তু সোর্সটি কেবল একটি অ্যাগ্রিগেট মেট্রিক রিপোর্ট করেছিল।
AI সিস্টেম তৈরির বিষয়ে এই ডিজাইন কী প্রকাশ করে
- নিয়ন্ত্রণ এবং যুক্তিকে আলাদা রাখা – মডেলটি ইনফারেন্সের (inference) জন্য দায়ী থাকে; হারনেস প্রক্রিয়ার শৃঙ্খলা নিশ্চিত করে।
- টাইপড ইন্টারফেস হ্যালুসিনেশন কমায় – JSON আউটপুট এবং সঠিক উদ্ধৃতি দাবি করার মাধ্যমে, সিস্টেমটি মুক্ত টেক্সটের বিচ্যুতি (free-form drift) দূর করে।
- ব্যয়বহুল ভেরিফিকেশন ধাপের আগে দাবিগুলো ফিল্টার করা টোকেন ব্যবহার এবং কম্পিউট খরচ কমায়।
- বাহ্যিক ইনপুটকে অনির্ভরযোগ্য হিসেবে গণ্য করা – প্রতিটি সোর্স উদ্ধৃতি স্বতন্ত্র এজেন্ট দ্বারা পুনরায় যাচাই করা হয়, যা একটি ত্রুটিপূর্ণ ডকুমেন্টকে পুরো উত্তরটি নষ্ট করা থেকে বিরত রাখে।
এই নীতিগুলো "model-outside-the-model" আর্কিটেকচারের দিকে একটি বৃহত্তর পরিবর্তনের প্রতিফলন ঘটায়, যেখানে প্রোবাবিলিস্টিক (probabilistic) ল্যাঙ্গুয়েজ মডেলের পরিবর্তে ডিটারমিনিস্টিক (deterministic) কোড অর্কেস্ট্রেশন, ভ্যালিডেশন এবং রিসোর্স অ্যালোকেশন পরিচালনা করে।
সম্ভাব্য অসুবিধা এবং অমীমাংসিত প্রশ্নাবলী
পাইপলাইনের শক্তি—এর কঠোরতা—একই সাথে কিছু চ্যালেঞ্জও নিয়ে আসে।
বিতর্কের আরেকটি বিষয় হলো হুবহু উদ্ধৃতির ওপর নির্ভরতা। সব জ্ঞান হুবহু শব্দবিন্যাসে থাকে না; কিছু অন্তর্দৃষ্টি কেবল একাধিক নথির সংশ্লেষণের মাধ্যমেই বেরিয়ে আসে।
পরবর্তীতে কী লক্ষ্য রাখা উচিত
Claude’s Deep Research এখনও গবেষণার পর্যায়ে রয়েছে, তবে এর আর্কিটেকচার এমন এক ভবিষ্যতের ইঙ্গিত দেয় যেখানে লার্জ ল্যাঙ্গুয়েজ মডেলগুলোকে স্বয়ংক্রিয়ভাবে পরিচালিত হওয়ার পরিবর্তে কঠোরভাবে নিয়ন্ত্রিত পাইপলাইনের মধ্যে অন্তর্ভুক্ত করা হবে। পর্যবেক্ষণের জন্য মূল সূচকগুলোর মধ্যে রয়েছে:
- Token-efficiency metrics – হারনেস (harness) যখন আরও বেশি বাছাইকৃত ট্রায়াজ লজিক (selective triage logic) অর্জন করবে, তখন কি ৬.৫৭ মিলিয়ন টোকেন বেসলাইন কমে আসবে?
- Latency trends – যখন তিনটি ভেরিফিকেশন এজেন্ট লুপে থাকে, তখন সিস্টেমটি কত দ্রুত একটি সম্পূর্ণ রিপোর্ট প্রদান করতে পারে?
সারসংক্ষেপ
Claude’s Deep Research দেখায় যে, একটি ল্যাঙ্গুয়েজ মডেলকে যখন একটি সুশৃঙ্খল, বহু-স্তরীয় পাইপলাইনের মধ্যে সীমাবদ্ধ রাখা হয়, তখন এটি নির্ভরযোগ্য এবং উৎস-ভিত্তিক উত্তর দিতে পারে। আসল সাফল্য মডেলের আকারের মধ্যে নয়; বরং এটি হলো চারপাশের সফটওয়্যার যা মডেলটিকে প্রতিটি দাবি প্রমাণ করতে বাধ্য করে, কম্পিউট খরচ করার আগে প্রমাণগুলোকে র্যাঙ্ক করে এবং তিনটি এজেন্ট ভিন্নমত পোষণ না করা পর্যন্ত প্রতিটি বাহ্যিক অংশকে সন্দেহজনক হিসেবে বিবেচনা করে। যারা এআই-চালিত টুল তৈরি করছেন তাদের জন্য শিক্ষাটি স্পষ্ট: মডেলটিকে চিন্তা করতে দিন, কিন্তু সে কী বলতে পারবে তা কোড দিয়ে নির্ধারণ করুন।
