چرا فشرده‌سازی بافت (Context) هوش مصنوعی بی‌صدا دستورات شما را نادیده می‌گیرد

با طولانی‌تر شدن گفتگوها با مدل‌های زبانی بزرگ (LLMs)، توسعه‌دهندگان به‌طور فزاینده‌ای برای مدیریت محدودیت‌های توکن و جلوگیری از گلوگاه‌های عملکردی، به «فشرده‌سازی بافت» (context compression) یا فشرده‌سازی (compaction) متکی می‌شوند. با این حال، تحقیقات جدید نشان‌دهنده یک نقص حیاتی در این بهینه‌سازی است: وقتی سیستم‌های هوش مصنوعی تاریخچه گفتگو را برای صرفه‌جویی در فضا خلاصه می‌کنند، اغلب همان قوانینی را که قرار بود رفتار آن‌ها را هدایت کنند، دور می‌ریزند.

شکنندگی محدودیت‌های نشست (Session Constraints)

وقتی یک سیستم هوش مصنوعی تحت فشرده‌سازی قرار می‌گیرد، هدف اصلی آن حفظ تداوم وظیفه است—یعنی حفظ هدف، وضعیت فعلی و گام‌های بعدیِ لازم. در حالی که این کار «چیستیِ» یک گفتگو را حفظ می‌کند، اغلب «چگونگیِ» آن را فدا می‌کند.

محققان دانشگاه ایالتی پن (Penn State) دریافته‌اند که «محدودیت‌های نشست» اولین قربانیان این فرآیند هستند. این‌ها قوانین غیردائمی و اعمال‌شده توسط کاربر هستند، مانند: "هرگز از نام من در پاسخ‌های خود استفاده نکن" یا "قبل از اعمال هرگونه تغییر، با من تأیید کن". از آنجایی که این دستورالعمل‌ها بخشی از وظیفه اصلی یا پرامپت (prompt) دائمی سیستم نیستند، الگوریتم‌های فشرده‌سازی آن‌ها را جزئیات ثانویه تلقی کرده و برای باز کردن فضا برای داده‌های مرتبط‌تر، آن‌ها را هرس (prune) می‌کنند.

یافته‌های COMPINT: نرخ بقای ۱۷ درصدی

برای تعیین میزان این افت کیفیت، محققان مجموعه ارزیابی COMPINT را توسعه دادند. نتایج تکان‌دهنده است: به‌طور متوسط، تنها ۱۷ درصد از محدودیت‌های نشستِ تزریق‌شده، در فرآیند فشرده‌سازی باقی می‌مانند.

این مطالعه افت قابل‌توجهی را در رعایت قوانین نشان داد. زمانی که یک عامل (agent) به بافت کامل و فشرده‌نشده دسترسی دارد، نرخ رعایت قوانین معمولاً بین ۵۹٪ تا ۷۱٪ است. به محض وقوع فشرده‌سازی، این نرخ به شدت سقوط می‌کند و اغلب به سطحی می‌رسد که به‌سختی با سناریویی که هیچ محدودیتی در آن ارائه نشده، قابل تشخیص است.

این فقط مسئله‌ای مربوط به ظرافت‌های گفتگویی نیست؛ بلکه یک ریسک امنیتی و قابلیت اطمینان بزرگ است. در جریان‌های کاری مبتنی بر عامل (agentic workflows)، از دست رفتن محدودیتی مانند "بدون تأیید، کد را اجرا نکن" می‌تواند منجر به فراخوانی‌های غیرمجاز ابزار، نشت داده‌ها یا تغییرات تأیید نشده در سیستم‌های خارجی مانند تقویم یا ایمیل شود.

یک راهکار سبک از طریق Qwen3.5-9B

محققان به‌جای بازنگری کلی در منطق پیچیده فشرده‌سازی که توسط آزمایشگاه‌های بزرگ هوش مصنوعی استفاده می‌شود، یک اصلاح ساختاری «آماده‌به‌کار» (plug-and-play) پیشنهاد می‌دهند. آن‌ها یک ماژول افزونه کوچک بر پایه مدل Qwen3.5-9B توسعه دادند که به عنوان یک استخراج‌کننده (extractor) تخصصی عمل می‌کند.

این ماژول از طریق روش‌های زیر عمل می‌کند:

  1. اسکن کردن هر ورودی کاربر به‌صورت بلادرنگ برای شناسایی و جداسازی محدودیت‌های نشست.
  2. نگهداری یک لیست اختصاصی و مستقل از این قوانین.
  3. پیوست کردن این لیست خلاصه‌شده به خلاصه (summary) هر زمان که سیستم اصلی عملیات فشرده‌سازی را انجام می‌دهد.

نتایج این رویکرد بسیار مؤثر است. این استخراج‌کننده به بیش از ۹۰ درصد حفظ اطلاعات در سناریوهای مختلف آزمایش، از جمله نرخ موفقیت ۹۵.۶٪ برای مسیرهای عامل (agent trajectories) و ۹۰.۳٪ برای چت‌های چندمرحله‌ای دست یافت. از آنجایی که این روش نیازی به بازآموزی مدل اصلی و هیچ تغییری در زیرساخت فشرده‌سازی موجود ندارد، مسیری مقیاس‌پذیر به سوی تعاملات هوش مصنوعی با بافت طولانی (long-context) و قابل‌اطمینان‌تر ارائه می‌دهد.

نکات کلیدی

  • حذف محدودیت‌ها: فشرده‌سازی بافت، اهداف وظیفه را بر قوانین رفتاری اولویت می‌دهد و باعث می‌شود اکثر «محدودیت‌های نشست» اعمال‌شده توسط کاربر در طول خلاصه‌سازی از بین بروند.
  • ریسک‌های امنیتی: از دست رفتن دستورالعمل‌ها — مانند الزامات برای تأیید توسط انسان (human-in-the-loop) — می‌تواند منجر به اقدامات غیرمجاز عامل و به خطر افتادن امنیت شود.
  • اصلاحات ماژولار: استفاده از یک مدل کوچک و تخصصی مانند Qwen3.5-9B برای ردیابی جداگانه محدودیت‌ها می‌تواند نرخ حفظ دستورالعمل‌ها را به بیش از ۹۰٪ بازگرداند.