روش جدید ABSeeker تحت عنوان «تخصیص اعتبار با بازگشت به پاسخ» (Answer-Backtracked Credit Assignment یا به اختصار ABC)، به عامل‌های جستجوی با افق طولانی اجازه می‌دهد تا به جای دریافت اعتبار تنها برای پاسخ نهایی، برای هر مرحله‌ی انفرادی نیز اعتبار کسب کنند؛ و یک مدل ۴ میلیارد پارامتری که با این روش آموزش دیده است، هم‌اکنون می‌تواند با رقبای بسیار بزرگ‌تر برابری کرده یا حتی از آن‌ها پیشی بگیرد.

این پیشرفت از این جهت اهمیت دارد که اکثر عامل‌های موجود تنها در پایان یک وظیفه مورد قضاوت قرار می‌گیرند. اگر پاسخ نهایی درست باشد، کل فرآیند خوب تلقی می‌شود؛ و اگر غلط باشد، کل توالی بد علامت‌گذاری می‌شود. این بازخوردِ «همه یا هیچ»، سیگنال یادگیری واقعی را پنهان می‌کند؛ یعنی حرکت‌های خوبی که از قضا با یک اشتباه دنبال شده‌اند، یا کلیک‌های بی‌فایده‌ای که از خوش‌شانسی به نتیجه درست منجر شده‌اند. رویکرد ABSeeker این قانون را بازنویسی می‌کند.

چرا رویکرد قدیمی ناکافی است

وقتی یک عامل جستجو می‌کند، کد می‌نویسد یا شواهدی را جمع‌آوری می‌کند، معمولاً اقدامات متعددی انجام می‌دهد: ارسال پرس‌وجوها، باز کردن صفحات، اجرای دستورات، بررسی وضعیت سیستم و غیره. در یک اجرای پانزده مرحله‌ای، یک قدم اشتباه می‌تواند پاسخ نهایی را نابود کند، حتی اگر مراحل قبلی درست بوده باشند. برعکس، فرآیندی که با پاسخ درست پایان می‌یابد، ممکن است بر شانس و اقبال تکیه کرده باشد، در حالی که اکثر مراحل هیچ ارزش افزوده‌ای نداشته‌اند. آموزش تنها بر اساس نتیجه نهایی، مدل را مجبور می‌کند تا کل مسیر را به عنوان یک «جعبه سیاه» واحد در نظر بگیرد و این امر یادگیری اینکه کدام زیر-رفتارها واقعاً مفید هستند را دشوار می‌کند.

این وضعیت مشابه عیب‌یابی (debugging) در مهندسی نرم‌افزار است. توسعه‌دهندگان هر خط را ردیابی می‌کنند، فراخوانیِ خطا را ایزوله کرده و آن را اصلاح می‌کنند. با این حال، به عامل‌ها هیچ «رسید» مشابهی از کارکرد داخلی‌شان داده نشده است. بدون این ردپای بازرسی (audit trail)، توسعه‌دهندگان نمی‌توانند تشخیص دهند که آیا یک بهبود ناشی از استدلال بهتر است یا صرفاً از روی شانس، و نمی‌توانند به‌طور سیستماتیک عادت‌های بد را اصلاح کنند.

چگونه ABC تخصیص اعتبار را بازطراحی می‌کند

روش «تخصیص اعتبار با بازگشت به پاسخ» از پاسخ نهایی صحیح به عقب حرکت می‌کند. این روش ابتدا سرنخ‌های ضروری را که پاسخ به آن‌ها وابسته است استخراج می‌کند؛ یعنی قطعات خاصی از شواهد، نتایج میانی یا بررسی‌های وضعیت. سپس از طریق ردپای ثبت‌شده به عقب بازمی‌گردد و هر اقدام را در برابر آن سرنخ‌ها امتیازدهی می‌کند. اقدامی که مستقیماً به یک سرنخ مورد نیاز کمک کرده باشد، اعتبار مثبت دریافت می‌کند؛ و یک اقدام بی‌ربط یا مضر، امتیاز منفی یا صفر می‌گیرد.

دو رژیم آموزشی بر پایه این امتیازدهی بنا شده‌اند:

  • ABC-SFT (تنظیم دقیق نظارت‌شده): تابع زیان (loss function) را به‌گونه‌ای بازوزن‌دهی می‌کند که مراحلی با اعتبار بالاتر، تأثیر قوی‌تری بر مدل داشته باشند. مدل یاد می‌گیرد اولویت را به اقداماتی بدهد که از نظر تاریخی منجر به سرنخ‌های مفید شده‌اند.
  • ABC-GRPO (بهینه‌سازی سیاست پاداش مبتنی بر گرادیان): امتیازات هر مرحله را به عنوان یک سیگنال پاداش برای یادگیری تقویتی در نظر می‌گیرد و بخش‌های خاصی از جستجو را که به ظهور پاسخ کمک کرده‌اند، تقویت می‌کند.

با تبدیل یک برچسب باینریِ «قبولی/رد» به یک نقشه دقیق از میزان مشارکت، ABC سیگنال یادگیری بسیار غنی‌تری به مدل ارائه می‌دهد.

نتایج اولیه گویای همه چیز هستند

محققان ABC را روی یک مدل متوسط ۴ میلیارد پارامتری که مجهز به یک لایه مدیریت کانتکست (context-management) برای ردیابی وضعیت در حال تغییر جستجو بود، اعمال کردند. در وظایف معیار (benchmark) که به‌طور سنتی عامل‌های بسیار بزرگ‌تر را در اولویت قرار می‌دهند، مدل آموزش‌دیده با ABC یا با آن سیستم‌های بزرگ‌تر برابری کرد و یا از آن‌ها بهتر عمل نمود. این بهبود عملکرد بدون افزایش اندازه مدل حاصل شد، که نشان می‌دهد تخصیص اعتبار بهتر می‌تواند جایگزین تعداد پارامترهای خام شود.

نتیجه کلیدی ساده است: به مدل یک رسید شفاف از آنچه کارآمد بوده بدهید، تا بتواند ارزش بیشتری از همان مقدار داده‌های آموزشی استخراج کند.

این موضوع برای عامل‌های دنیای واقعی چه معنایی دارد

هر عاملی که کارهای چندمرحله‌ای انجام می‌دهد — از دستیارهای کدنویسی و ربات‌های مرور ادبیات گرفته تا ابزارهای پشتیبانی مشتری — به ردپایی از اقدامات خود متکی است. ABC نشان می‌دهد که حفظ و ارزیابی آن ردپا، یک ویژگی جانبی و اختیاری نیست؛ بلکه برای یادگیری مؤثر، ضروری است.

  • عامل‌های کدنویسی باید برنامه، هر دستور صادر شده و نتایج تست‌هایی که کد را تأیید می‌کنند، ثبت کنند.
  • عامل‌های پژوهشی باید پرس‌وجوهایی که ارسال کرده‌اند، منابعی که باز کرده‌اند و شواهدی که استخراج کرده‌اند را حفظ کنند.
  • عامل‌های پشتیبانی باید هر بررسی وضعیت و نقطه تصمیمی را که منجر به حل مسئله شده است، ضبط کنند.

وقتی این ردپاها در دسترس باشند، ABC می‌تواند اعتبار را با دقت تخصیص دهد و به مدل اجازه دهد تا عادت‌های خوب را تقویت کرده و میان‌برهای شانسی را که در غیر این صورت با مهارت اشتباه گرفته می‌شوند، کنار بگذارد.

نکات متقابل و موانع عملی

مزایای ABC با پیچیدگی‌های اضافه‌ای همراه است.

خلاصه کلام

Answer-Backtracked Credit Assignment قواعد بازی را در نحوه آموزش عامل‌ها برای جستجو، کدنویسی و استدلال تغییر می‌دهد. این روش با پاداش دادن به گام‌های درست در طول مسیر، به‌جای تمرکز صرف بر مقصد نهایی، به مدل‌هایی با ابعاد متوسط اجازه می‌دهد تا به همان اندازه مؤثر مدل‌های بسیار بزرگ‌تر یاد بگیرند. برای هر کسی که در حال ساخت عامل‌هایی برای انجام وظایف چندمرحله‌ای است، اتخاذ یک رژیم آموزشی مبتنی بر ردپا (trace-centric) یک انتخاب نیست، بلکه راهی است به سوی هوش مصنوعی قابل اعتماد، قابل بازرسی و در نهایت هوشمندتر.