ابزار جدید Deep Research کلاود (Claude) میتواند در یک فراخوانی، ۶.۵۷ میلیون توکن را پردازش کند—چیزی که تنها با یک بودجه محاسباتی عظیم امکانپذیر است. این سیستم یک مدل زبانی یکپارچه نیست؛ بلکه به عنوان یک خط لوله (pipeline) دقیق map-reduce در جاوااسکریپت عمل میکند که جستجوها را گسترش میدهد، دادهها را فراخوانی میکند، ادعاها را در برابر سه تأییدکننده مستقل قرار میدهد و سپس یک گزارش را تلفیق میکند.
چرا این معماری اهمیت دارد
بسیاری از دستیاران پژوهشی مبتنی بر هوش مصنوعی، یک رابط کاربری سادهی «پرسش و پاسخ» ارائه میدهند که به مدل اجازه میدهد متن و ارجاعات را در یک مرحله تولید کند. Deep Research کلاود این مدل را کاملاً دگرگون میکند. این ابزار وظیفه را به مراحل مجزا و نوعبندیشده (typed) تقسیم کرده و مدل را مجبور میکند از یک چارچوب نرمافزاری (harness) پیروی کند. طراحان آن را بهگونهای ساختهاند که ضمن ارائه پاسخهای غنی و مستند، توهمات (hallucinations) را نیز کنترل کند. این رویکرد از یک چارچوب خودکارِ یافتن باگ (bug-hunting) نشأت گرفته است، جایی که ابتدا یک فرضیه ایجاد شده و سپس بهطور عمدی برای رد کردن آن تلاش میشود. در اصطلاح پژوهشی، ابتدا یک ادعا متولد میشود و سپس سه عامل متخاصم (adversarial agents) سعی میکنند پیش از رسیدن به مرحله تلفیق نهایی، آن را از بین ببرند.
جریان map-reduce
- جستجوی گسترده (Fan-out search) – هماهنگکننده، کارگران موازی را برای پرسوجو از طیف وسیعی از منابع داده ایجاد میکند.
- دریافت دادهها (Fetch data) – هر کارگر، قطعات خام، متادیتا و هرگونه اطلاعات ساختاریافتهی موجود را استخراج میکند.
- تأیید متخاصم (Adversarial verification) – سه عامل مستقل هر ادعا را دریافت میکنند و به هر یک دستور داده شده که در صورت عدم اطمینان، حالت پیشفرض را رد شده (refuted) در نظر بگیرند. یک ادعا تنها در صورتی باقی میماند که آرای مثبت کافی جمعآوری کند.
- تلفیق (Synthesis) – ادعاهای باقیمانده در قالب یک گزارش JSON نهایی به هم متصل میشوند که کاربر میتواند آن را به صورت متن (prose) نمایش دهد.
درون چارچوب (harness)
این چارچوب، لایه نازکی از کد است که تعیین میکند مدل زبانی چه کارهایی میتواند انجام دهد. قوانین آن به صورت مجموعهای از وظایف ساختاریافته ظاهر میشوند:
- SCOPE – مدل توصیف کوتاهی از سؤال پژوهش را دریافت میکند.
- SEARCH – مدل باید فهرستی از شناسههای منبع را صادر کند، نه متن آزاد.
- EXTRACT – برای هر منبع، مدل یک نقلقول مستقیم (verbatim) برمیگرداند که از هر ادعای بعدی پشتیبانی میکند.
- VERDICT – یک شیء JSON تولید میکند که شامل ادعا، نقلقول پشتیبان و امتیاز اطمینان است.
- REPORT – مرحله نهایی، تمام ادعاهای تأیید شده را در یک سند واحد بستهبندی میکند.
این چارچوب، اتصال به شواهد (evidence binding) را اعمال میکند: هر ادعایی که نقلقول دقیق نداشته باشد، بهطور خودکار حذف میشود. همچنین ثابتهای سیاستگذاری (policy constants) را ارائه میدهد که میتوان بدون تغییر در کد، آنها را تنظیم کرد—مانند اینکه یک ادعا به چند رأی مثبت نیاز دارد، سیستم مجاز به خواندن چند منبع است، یا حداکثر تعداد ادعایی که به مرحله تأیید میرسند.
یک مرحله اولویتبندی (triage) بین استخراج و تأیید قرار دارد. سیستم به جای ارسال هر ادعا به عوامل متخاصمِ پرهزینه، آنها را بر اساس اهمیت و کیفیت منبع رتبهبندی کرده و تنها ۲۵ مورد برتر را ارسال میکند. این غربالگری مانع از خارج شدن مصرف توکن و هزینههای محاسباتی از کنترل میشود.
تأیید متخاصم در عمل
مرحله تأیید بهطور عامدانه سختگیرانه است. هر یک از سه عامل، همان ادعا و نقلقول منبع را دریافت میکنند و سپس تحت مجموعهای از دستورالعملها عمل میکنند که به آنها میگوید تا زمانی که مدرک قاطعی پیدا نکردهاند، فرض را بر نادرست بودن ادعا بگذارند. اگر هر عاملی مردد باشد، رأی به رد شده (refuted) میدهد. ادعا باید تعداد مشخصی از آرای تأیید شده (affirmed) را برای بقا جمعآوری کند.
در طول آزمایشهای غیررسمی، لایه متخاصم ادعایی را شناسایی کرد که یک معیار تجمیعی (aggregate metric) را به اشتباه به عنوان یک امتیاز دقت (precision score) خاص تفسیر کرده بود. مدل یک بیانیه مطمئن درباره دقت تولید کرده بود، اما منبع تنها یک معیار تجمیعی را گزارش کرده بود.
آنچه این طراحی درباره ساخت سیستمهای هوش مصنوعی آشکار میکند
- جداسازی کنترل از استدلال – مدل مسئول استنتاج باقی میماند؛ چارچوب، انضباط فرآیند را اعمال میکند.
- رابطهای نوعبندیشده توهم را کاهش میدهند – با الزام به خروجی JSON و نقلقولهای دقیق، سیستم از انحراف متنهای آزاد جلوگیری میکند.
- فیلتر کردن ادعاها پیش از مرحله پرهزینه تأیید، مصرف توکن و هزینههای محاسباتی را کاهش میدهد.
- برخورد با ورودیهای خارجی به عنوان ورودی غیرقابل اعتماد – هر نقلقول از منبع توسط عوامل مستقل مجدداً بررسی میشود تا از آلوده شدن پاسخ توسط یک سند معیوب جلوگیری شود.
این اصول بازتابدهنده یک تغییر گستردهتر به سمت معماریهای «مدل خارج از مدل» (model-outside-the-model) است، جایی که به جای مدل زبانی احتمالی، کدهای قطعی (deterministic) مدیریت هماهنگی، اعتبارسنجی و تخصیص منابع را بر عهده دارند.
نقاط ضعف احتمالی و پرسشهای بیپاسخ
قدرت این خط لوله — یعنی دقت و سختگیری آن — چالشهایی را نیز به همراه دارد.
نکته بحثبرانگیز دیگر، اتکا به نقلقولهای کلمه به کلمه است. همه دانشها در قالب عبارات دقیق نهفته نیستند؛ برخی از بینشها تنها پس از ترکیب اطلاعات از چندین سند مختلف پدیدار میشوند.
آنچه باید در ادامه زیر نظر داشت
Claude’s Deep Research هنوز در مرحله تحقیقاتی است، اما معماری آن نویدبخش آیندهای است که در آن مدلهای زبانی بزرگ، به جای اینکه رها شوند تا خودشان هدایت شوند، در پایپلاینهای تحت کنترل دقیق قرار میگیرند. شاخصهای کلیدی برای نظارت عبارتند از:
- معیارهای کارایی توکن – آیا با دستیابی چارچوب به منطق اولویتبندی انتخابی بیشتر، خط پایه 6.57 میلیون توکن کاهش خواهد یافت؟
- روندهای تأخیر – وقتی سه ایجنت تأییدکننده در فرآیند حضور دارند، سیستم با چه سرعتی میتواند یک گزارش کامل ارائه دهد؟
نتیجهگیری
Claude’s Deep Research نشان میدهد که یک مدل زبانی زمانی که در یک پایپلاین منضبط و چند مرحلهای محدود شود، میتواند پاسخهای قابل اعتماد و مبتنی بر منبع ارائه دهد. تحول واقعی در اندازه مدل نیست؛ بلکه در نرمافزار پیرامونی است که مدل را مجبور میکند هر ادعا را اثبات کند، شواهد را پیش از صرف منابع محاسباتی رتبهبندی کند و با هر قطعه متن خارجی به عنوان مورد مشکوک برخورد کند تا زمانی که سه ایجنت بر خلاف آن توافق کنند. برای هر کسی که در حال ساخت ابزارهای مبتنی بر هوش مصنوعی است، درس روشن است: اجازه دهید مدل فکر کند، اما اجازه دهید کد تصمیم بگیرد که مدل چه چیزی میتواند بگوید.
