কেন AI Context Compression নিঃশব্দে আপনার নির্দেশাবলী উপেক্ষা করছে

Large Language Models (LLMs)-এর সাথে কথোপকথন যত দীর্ঘ হচ্ছে, টোকেন লিমিট পরিচালনা করতে এবং পারফরম্যান্সের বাধা (bottlenecks) রোধ করতে ডেভেলপাররা ক্রমবর্ধমানভাবে "context compression" বা compaction-এর ওপর নির্ভর করছেন। তবে, নতুন গবেষণা এই অপ্টিমাইজেশনের একটি মারাত্মক ত্রুটি প্রকাশ করেছে: যখন AI সিস্টেমগুলো জায়গা বাঁচাতে কথোপকথনের ইতিহাস সংক্ষেপ (summarize) করে, তখন তারা প্রায়শই সেই নিয়মগুলোই বাদ দিয়ে দেয় যা তাদের আচরণ নিয়ন্ত্রণ করার কথা ছিল।

Session Constraints-এর ভঙ্গুরতা

যখন একটি AI সিস্টেম compaction-এর মধ্য দিয়ে যায়, তখন এর প্রাথমিক লক্ষ্য থাকে কাজের ধারাবাহিকতা (task continuity) বজায় রাখা—অর্থাৎ উদ্দেশ্য, বর্তমান অবস্থা এবং প্রয়োজনীয় পরবর্তী পদক্ষেপগুলো ধরে রাখা। যদিও এটি কথোপকথনের "কী" (what) অংশটি বজায় রাখে, তবে এটি প্রায়শই "কীভাবে" (how) অংশটিকে বিসর্জন দেয়।

Penn State-এর গবেষকরা চিহ্নিত করেছেন যে, "session constraints" হলো এই প্রক্রিয়ার প্রথম শিকার। এগুলো হলো ব্যবহারকারী কর্তৃক আরোপিত অস্থায়ী নিয়ম, যেমন "আপনার উত্তরে কখনোই আমার নাম ব্যবহার করবেন না" অথবা "যেকোনো পরিবর্তন করার আগে আমার সাথে নিশ্চিত করুন।" যেহেতু এই নির্দেশাবলী মূল কাজ বা স্থায়ী সিস্টেম প্রম্পটের অংশ নয়, তাই compression অ্যালগরিদমগুলো এগুলোকে গৌণ বিষয় হিসেবে বিবেচনা করে এবং আরও প্রাসঙ্গিক ডেটার জন্য জায়গা তৈরি করতে এগুলোকে বাদ দিয়ে দেয়।

COMPINT-এর ফলাফল: মাত্র ১৭% টিকে থাকার হার

এই অবনতি পরিমাপ করার জন্য, গবেষকরা COMPINT মূল্যায়ন স্যুট (evaluation suite) তৈরি করেছেন। ফলাফল অত্যন্ত হতাশাজনক: গড়ে, ইনজেক্ট করা session constraints-এর মাত্র ১৭ শতাংশ compression প্রক্রিয়ার পর টিকে থাকে

গবেষণাটি নিয়ম পালনের (rule compliance) ক্ষেত্রে একটি উল্লেখযোগ্য হ্রাস লক্ষ্য করেছে। যখন একটি এজেন্টের কাছে সম্পূর্ণ, আন-কম্প্রেসড কনটেক্সট থাকে, তখন নিয়ম পালনের হার সাধারণত ৫৯% থেকে ৭১%-এর মধ্যে থাকে। একবার compaction হয়ে গেলে, এই হার নাটকীয়ভাবে কমে যায়, যা প্রায় এমন একটি পরিস্থিতির মতো হয়ে দাঁড়ায় যেখানে কোনো নিয়মই দেওয়া হয়নি।

এটি কেবল কথোপকথনের সূক্ষ্মতার বিষয় নয়; এটি একটি বড় ধরনের নিরাপত্তা এবং নির্ভরযোগ্যতার ঝুঁকি। Agentic workflows-এর ক্ষেত্রে, "অনুমতি ছাড়া কোড এক্সিকিউট করবেন না" এর মতো কোনো নিয়ম হারিয়ে গেলে তা অননুমোদিত টুল কল, ডেটা লিক, অথবা ক্যালেন্ডার বা ইমেলের মতো বাহ্যিক সিস্টেমে যাচাই না করা পরিবর্তনের দিকে পরিচালিত করতে পারে।

Qwen3.5-9B-এর মাধ্যমে একটি হালকা সমাধান

বড় AI ল্যাবগুলোর ব্যবহৃত জটিল compression লজিককে আমূল পরিবর্তন করার পরিবর্তে, গবেষকরা একটি "plug-and-play" আর্কিটেকচারাল সমাধানের প্রস্তাব করেছেন। তারা Qwen3.5-9B মডেলের ওপর ভিত্তি করে একটি ছোট অ্যাড-অন মডিউল তৈরি করেছেন যা একটি বিশেষায়িত extractor হিসেবে কাজ করার জন্য ডিজাইন করা হয়েছে।

এই মডিউলটি যেভাবে কাজ করে:

  1. session constraints শনাক্ত এবং আলাদা করার জন্য রিয়েল-টাইমে প্রতিটি ইউজার ইনপুট স্ক্যান করা।
  2. এই নিয়মগুলোর একটি ডেডিকেটেড এবং স্বতন্ত্র তালিকা বজায় রাখা।
  3. মূল সিস্টেম যখনই compaction করে, তখনই এই সারসংক্ষেপ করা তালিকাটি সামারির সাথে যুক্ত করে দেওয়া।

এই পদ্ধতির ফলাফল অত্যন্ত কার্যকর। বিভিন্ন পরীক্ষার ক্ষেত্রে extractor-টি ৯০ শতাংশের বেশি রিটেনশন (retention) অর্জন করেছে, যার মধ্যে agent trajectories-এর জন্য ৯৫.৬% এবং multi-turn chats-এর জন্য ৯০.৩% সাফল্যের হার রয়েছে। যেহেতু এই পদ্ধতিতে প্রাথমিক মডেলকে পুনরায় প্রশিক্ষণ দেওয়ার প্রয়োজন হয় না এবং বিদ্যমান compression অবকাঠামোতেও কোনো পরিবর্তন করতে হয় না, তাই এটি আরও নির্ভরযোগ্য long-context AI ইন্টারঅ্যাকশনের জন্য একটি স্কেলেবল পথ তৈরি করে।

মূল বিষয়সমূহ

  • Constraint Erasure (সীমাবদ্ধতা মুছে ফেলা): Context compression আচরণগত নিয়মের চেয়ে কাজের লক্ষ্যকে বেশি প্রাধান্য দেয়, যার ফলে সামারাইজেশনের সময় ব্যবহারকারীর আরোপিত বেশিরভাগ "session constraints" হারিয়ে যায়।
  • Security Risks (নিরাপত্তা ঝুঁকি): নির্দেশাবলী হারিয়ে যাওয়া—যেমন human-in-the-loop ভেরিফিকেশনের প্রয়োজনীয়তা—অননুমোদিত এজেন্ট অ্যাকশন এবং নিরাপত্তার বিঘ্ন ঘটাতে পারে।
  • Modular Fixes (মডুলার সমাধান): আলাদাভাবে constraints ট্র্যাক করার জন্য Qwen3.5-9B-এর মতো একটি ছোট, বিশেষায়িত মডেল ব্যবহার করলে নির্দেশাবলী বজায় রাখার হার ৯০%-এর উপরে ফিরিয়ে আনা সম্ভব।