ਕਿਉਂ AI ਕੰਟੈਕਸ ਕੰਪਰੈਸ਼ਨ (Context Compression) ਚੁੱਪਚਾਪ ਤੁਹਾਡੀਆਂ ਹਦਾਇਤਾਂ ਨੂੰ ਨਜ਼ਰਅੰਦਾਜ਼ ਕਰ ਰਿਹਾ ਹੈ

ਜਿਵੇਂ-ਜਿਵੇਂ Large Language Models (LLMs) ਨਾਲ ਗੱਲਬਾਤ ਲੰਬੀ ਹੁੰਦੀ ਜਾਂਦੀ ਹੈ, ਡਿਵੈਲਪਰ ਟੋਕਨ ਸੀਮਾਵਾਂ (token limits) ਨੂੰ ਸੰਭਾਲਣ ਅਤੇ ਪ੍ਰਦਰਸ਼ਨ ਵਿੱਚ ਰੁਕਾਵਟਾਂ ਨੂੰ ਰੋਕਣ ਲਈ "context compression" ਜਾਂ compaction 'ਤੇ ਵੱਧ ਤੋਂ ਵੱਧ ਨਿਰਭਰ ਕਰਦੇ ਹਨ। ਹਾਲਾਂਕਿ, ਨਵਾਂ ਖੋਜ ਅਧਿਐਨ ਇਸ ਆਪਟੀਮਾਈਜ਼ੇਸ਼ਨ ਵਿੱਚ ਇੱਕ ਗੰਭੀਰ 결 (flaw) ਨੂੰ ਪ੍ਰਗਟ ਕਰਦਾ ਹੈ: ਜਦੋਂ AI ਸਿਸਟਮ ਜਗ੍ਹਾ ਬਚਾਉਣ ਲਈ ਗੱਲਬਾਤ ਦੇ ਇਤਿਹਾਸ ਦਾ ਸਾਰ (summarize) ਕੱਢਦੇ ਹਨ, ਤਾਂ ਉਹ ਅਕਸਰ ਉਹਨਾਂ ਨਿਯਮਾਂ ਨੂੰ ਹੀ ਰੱਦ ਕਰ ਦਿੰਦੇ ਹਨ ਜੋ ਉਹਨਾਂ ਦੇ ਵਿਵਹਾਰ ਨੂੰ ਨਿਰਧਾਰਤ ਕਰਨ ਲਈ ਬਣਾਏ ਗਏ ਸਨ।

ਸੈਸ਼ਨ ਦੀਆਂ ਸੀਮਾਵਾਂ (Session Constraints) ਦੀ ਕਮਜ਼ੋਰੀ

ਜਦੋਂ ਕੋਈ AI ਸਿਸਟਮ compaction ਤੋਂ ਗੁਜ਼ਰਦਾ ਹੈ, ਤਾਂ ਉਸਦਾ ਮੁੱਖ ਉਦੇਸ਼ ਕੰਮ ਦੀ ਨਿਰੰਤਰਤਾ ਨੂੰ ਬਣਾਈ ਰੱਖਣਾ ਹੁੰਦਾ ਹੈ—ਜਿਵੇਂ ਕਿ ਉਦੇਸ਼, ਮੌਜੂਦਾ ਸਥਿਤੀ, ਅਤੇ ਲੋੜੀਂਦੇ ਅਗਲੇ ਕਦਮਾਂ ਨੂੰ ਬਰਕਰਾਰ ਰੱਖਣਾ। ਹਾਲਾਂਕਿ ਇਹ ਗੱਲਬਾਤ ਦੇ "ਕੀ" (what) ਨੂੰ ਬਰਕਰਾਰ ਰੱਖਦਾ ਹੈ, ਪਰ ਇਹ ਅਕਸਰ "ਕਿਵੇਂ" (how) ਦੀ ਕੁਰਬਾਨੀ ਦੇ ਦਿੰਦਾ ਹੈ।

Penn State ਦੇ ਖੋਜਕਰਤਾਵਾਂ ਨੇ ਪਛਾਣਿਆ ਹੈ ਕਿ "session constraints" ਇਸ ਪ੍ਰਕਿਰਿਆ ਦੇ ਪਹਿਲੇ ਸ਼ਿਕਾਰ ਹੁੰਦੇ ਹਨ। ਇਹ ਗੈਰ-ਪੱਕੇ, ਉਪਭੋਗਤਾ ਦੁਆਰਾ ਲਗਾਏ ਗਏ ਨਿਯਮ ਹਨ ਜਿਵੇਂ ਕਿ "Never use my name in your responses" (ਮੇਰੇ ਜਵਾਬਾਂ ਵਿੱਚ ਕਦੇ ਵੀ ਮੇਰਾ ਨਾਮ ਨਾ ਵਰਤੋ) ਜਾਂ "Confirm with me before making any changes" (ਕੋਈ ਵੀ ਤਬਦੀਲੀ ਕਰਨ ਤੋਂ ਪਹਿਲਾਂ ਮੇਰੇ ਨਾਲ ਪੁਸ਼ਟੀ ਕਰੋ)। ਕਿਉਂਕਿ ਇਹ ਹਦਾਇਤਾਂ ਮੁੱਖ ਕੰਮ ਜਾਂ ਪੱਕੇ ਸਿਸਟਮ ਪ੍ਰੋਂਪਟ ਦਾ ਹਿੱਸਾ ਨਹੀਂ ਹਨ, ਇਸ ਲਈ ਕੰਪਰੈਸ਼ਨ ਐਲਗੋਰਿਦਮ ਇਹਨਾਂ ਨੂੰ ਸੈਕੰਡਰੀ ਵੇਰਵੇ ਵਜੋਂ ਦੇਖਦੇ ਹਨ ਅਤੇ ਵਧੇਰੇ ਪ੍ਰਸੰਗਿਕ ਡੇਟਾ ਲਈ ਜਗ੍ਹਾ ਬਣਾਉਣ ਲਈ ਇਹਨਾਂ ਨੂੰ ਹਟਾ ਦਿੰਦੇ ਹਨ।

COMPINT ਦੇ ਨਤੀਜੇ: 17% ਬਚਣ ਦੀ ਦਰ

ਇਸ ਗਿਰਾਵਟ ਨੂੰ ਮਾਪਣ ਲਈ, ਖੋਜਕਰਤਾਵਾਂ ਨੇ COMPINT ਇਵੈਲੂਏਸ਼ਨ ਸੂਟ ਵਿਕਸਿਤ ਕੀਤਾ। ਨਤੀਜੇ ਬਹੁਤ ਸਖ਼ਤ ਹਨ: ਔਸਤ ਰੂਪ ਵਿੱਚ, ਜਾੜੇ ਗਏ (injected) ਸੈਸ਼ਨ ਕੰਸਟ੍ਰੇਂਟਸ ਵਿੱਚੋਂ ਸਿਰਫ਼ 17 ਪ੍ਰਤੀਸ਼ਤ ਹੀ ਕੰਪਰੈਸ਼ਨ ਪ੍ਰਕਿਰਿਆ ਤੋਂ ਬਚ ਪਾਉਂਦੇ ਹਨ

ਅਧਿਐਨ ਨੇ ਨਿਯਮਾਂ ਦੀ ਪਾਲਣਾ ਵਿੱਚ ਇੱਕ ਮਹੱਤਵਪੂਰਨ ਗਿਰਾਵਟ ਨੂੰ ਉਜਾਗਰ ਕੀਤਾ। ਜਦੋਂ ਕਿਸੇ ਏਜੰਟ ਕੋਲ ਪੂਰੇ, ਅਣ-ਕੰਪ੍ਰੈਸਡ ਕੰਟੈਕਸ ਤੱਕ ਪਹੁੰਚ ਹੁੰਦੀ ਹੈ, ਤਾਂ ਪਾਲਣਾ ਦੀ ਦਰ ਆਮ ਤੌਰ 'ਤੇ 59% ਅਤੇ 71% ਦੇ ਵਿਚਕਾਰ ਹੁੰਦੀ ਹੈ। ਇੱਕ ਵਾਰ compaction ਹੋਣ ਤੋਂ ਬਾਅਦ, ਪਾਲਣਾ ਦੀ ਦਰ ਬਹੁਤ ਤੇਜ਼ੀ ਨਾਲ ਡਿੱਗ ਜਾਂਦੀ ਹੈ, ਜੋ ਅਕਸਰ ਅਜਿਹੇ ਪੱਧਰ ਤੱਕ ਪਹੁੰਚ ਜਾਂਦੀ ਹੈ ਜਿਸ ਨੂੰ ਉਸ ਸਥਿਤੀ ਤੋਂ ਵੱਖ ਕਰਨਾ ਮੁਸ਼ਕਲ ਹੁੰਦਾ ਹੈ ਜਿੱਥੇ ਕੋਈ ਕੰਸਟ੍ਰੇਂਟ ਕਦੇ ਦਿੱਤਾ ਹੀ ਨਹੀਂ ਗਿਆ ਸੀ।

ਇਹ ਸਿਰਫ਼ ਗੱਲਬਾਤ ਦੇ ਸੂਖਮ ਵੇਰਵਿਆਂ ਦਾ ਮਾਮਲਾ ਨਹੀਂ ਹੈ; ਇਹ ਸੁਰੱਖਿਆ ਅਤੇ ਭਰੋਸੇਯੋਗਤਾ ਦਾ ਇੱਕ ਵੱਡਾ ਜੋਖਮ ਹੈ। Agentic workflows ਵਿੱਚ, "Do not execute code without approval" (ਬਿਨਾਂ ਮਨਜ਼ੂਰੀ ਦੇ ਕੋਡ ਨਾ ਚਲਾਓ) ਵਰਗੇ ਕੰਸਟ੍ਰੇਂਟ ਦੇ ਖਤਮ ਹੋਣ ਨਾਲ ਅਣਅਧਿਕਾਰਤ ਟੂਲ ਕਾਲ, ਡੇਟਾ ਲੀਕ, ਜਾਂ ਕੈਲੰਡਰ ਜਾਂ ਈਮੇਲ ਵਰਗੇ ਬਾਹਰੀ ਸਿਸਟਮਾਂ ਵਿੱਚ ਅਣ-ਪੜਚੋਲ ਕੀਤੀਆਂ ਤਬਦੀਲੀਆਂ ਹੋ ਸਕਦੀਆਂ ਹਨ।

Qwen3.5-9B ਰਾਹੀਂ ਇੱਕ ਹਲਕਾ (Lightweight) ਹੱਲ

ਪ੍ਰਮੁੱਖ AI ਲੈਬਾਂ ਦੁਆਰਾ ਵਰਤੇ ਜਾਣ ਵਾਲੇ ਗੁੰਝਲਦਾਰ ਕੰਪਰੈਸ਼ਨ ਲੌਜਿਕ ਨੂੰ ਪੂਰੀ ਤਰ੍ਹਾਂ ਬਦਲਣ ਦੀ ਬਜਾਏ, ਖੋਜਕਰਤਾ ਇੱਕ "plug-and-play" ਆਰਕੀਟੈਕਚਰਲ ਫਿਕਸ ਦਾ ਪ੍ਰਸਤਾਵ ਦਿੰਦੇ ਹਨ। ਉਹਨਾਂ ਨੇ Qwen3.5-9B ਮਾਡਲ 'ਤੇ ਅਧਾਰਤ ਇੱਕ ਛੋਟਾ ਐਡ-ਆਨ ਮੋਡਿਊਲ ਵਿਕਸਿਤ ਕੀਤਾ ਹੈ ਜੋ ਇੱਕ ਵਿਸ਼ੇਸ਼ ਐਕਸਟਰੈਕਟਰ (extractor) ਵਜੋਂ ਕੰਮ ਕਰਨ ਲਈ ਤਿਆਰ ਕੀਤਾ ਗਿਆ ਹੈ।

ਇਹ ਮੋਡਿਊਲ ਇਸ ਤਰ੍ਹਾਂ ਕੰਮ ਕਰਦਾ ਹੈ:

  1. ਸੈਸ਼ਨ ਕੰਸਟ੍ਰੇਂਟਸ ਦਾ ਪਤਾ ਲਗਾਉਣ ਅਤੇ ਉਹਨਾਂ ਨੂੰ ਵੱਖ ਕਰਨ ਲਈ ਰੀਅਲ-ਟਾਈਮ ਵਿੱਚ ਹਰ ਯੂਜ਼ਰ ਇਨਪੁਟ ਦੀ ਸਕੈਨਿੰਗ ਕਰਨਾ।
  2. ਇਹਨਾਂ ਨਿਯਮਾਂ ਦੀ ਇੱਕ ਸਮਰਪਿਤ, ਸੁਤੰਤਰ ਸੂਚੀ ਬਣਾਈ ਰੱਖਣਾ।
  3. ਜਦੋਂ ਵੀ ਮੁੱਖ ਸਿਸਟਮ compaction ਕਰਦਾ ਹੈ, ਤਾਂ ਇਸ ਸਾਰ (distilled) ਸੂਚੀ ਨੂੰ ਸਾਰ (summary) ਵਿੱਚ ਜੋੜਨਾ।

ਇਸ ਪਹੁੰਚ ਦੇ ਨਤੀਜੇ ਬਹੁਤ ਪ੍ਰਭਾਵਸ਼ਾਲੀ ਹਨ। ਐਕਸਟਰੈਕਟਰ ਨੇ ਵੱਖ-ਵੱਖ ਟੈਸਟਿੰਗ ਸਥਿਤੀਆਂ ਵਿੱਚ 90 ਪ੍ਰਤੀਸ਼ਤ ਤੋਂ ਵੱਧ ਰਿਟੈਂਸ਼ਨ (retention) ਪ੍ਰਾਪਤ ਕੀਤੀ, ਜਿਸ ਵਿੱਚ ਏਜੰਟ ਟ੍ਰੈਜੈਕਟਰੀਜ਼ (agent trajectories) ਲਈ 95.6% ਦੀ ਸਫਲਤਾ ਦਰ ਅਤੇ ਮਲਟੀ-ਟਰਨ ਚੈਟਸ ਲਈ 90.3% ਸ਼ਾਮਲ ਹੈ। ਕਿਉਂਕਿ ਇਸ ਵਿਧੀ ਲਈ ਪ੍ਰਾਇਮਰੀ ਮਾਡਲ ਦੇ ਮੁੜ-ਸਿਖਲਾਈ (retraining) ਦੀ ਲੋੜ ਨਹੀਂ ਹੈ ਅਤੇ ਮੌਜੂਦਾ ਕੰਪਰੈਸ਼ਨ ਬੁਨਿਆਦੀ ਢਾਂਚੇ ਵਿੱਚ ਕੋਈ ਤਬਦੀਲੀ ਨਹੀਂ ਕਰਨੀ ਪੈਂਦੀ, ਇਹ ਵਧੇਰੇ ਭਰੋਸੇਯੋਗ ਲੌਂਗ-ਕੰਟੈਕਸ AI ਇੰਟਰੈਕਸ਼ਨਾਂ ਵੱਲ ਇੱਕ ਵਿਸਤਾਰਯੋਗ (scalable) ਮਾਰਗ ਪ੍ਰਦਾਨ ਕਰਦਾ ਹੈ।

ਮੁੱਖ ਗੱਲਾਂ (Key Takeaways)

  • ਕੰਸਟ੍ਰੇਂਟ ਮਿਟਾਉਣਾ (Constraint Erasure): ਕੰਟੈਕਸ ਕੰਪਰੈਸ਼ਨ ਵਿਵਹਾਰਕ ਨਿਯਮਾਂ ਦੀ ਬਜਾਏ ਕੰਮ ਦੇ ਟੀਚਿਆਂ ਨੂੰ ਪਹਿਲ ਦਿੰਦੀ ਹੈ, ਜਿਸ ਕਾਰਨ ਸਾਰ ਕੱਢਣ ਦੌਰਾਨ ਯੂਜ਼ਰ ਦੁਆਰਾ ਲਗਾਏ ਗਏ ਜ਼ਿਆਦਾਤਰ "ਸੈਸ਼ਨ ਕੰਸਟ੍ਰੇਂਟਸ" ਗੁਆਚ ਜਾਂਦੇ ਹਨ।
  • ਸੁਰੱਖਿਆ ਜੋਖਮ: ਹਦਾਇਤਾਂ ਦਾ ਖਤਮ ਹੋਣਾ—ਜਿਵੇਂ ਕਿ 'human-in-the-loop' ਵੈਰੀਫਿਕੇਸ਼ਨ ਦੀਆਂ ਲੋੜਾਂ—ਅਣਅਧਿਕਾਰਤ ਏਜੰਟ ਕਾਰਵਾਈਆਂ ਅਤੇ ਸੁਰੱਖਿਆ ਨਾਲ ਸਮਝੌਤਾ ਕਰ ਸਕਦਾ ਹੈ।
  • ਮੋਡਿਊਲਰ ਫਿਕਸ: ਕੰਸਟ੍ਰੇਂਟਸ ਨੂੰ ਵੱਖਰੇ ਤੌਰ 'ਤੇ ਟ੍ਰੈਕ ਕਰਨ ਲਈ Qwen3.5-9B ਵਰਗੇ ਛੋਟੇ, ਵਿਸ਼ੇਸ਼ ਮਾਡਲ ਦੀ ਵਰਤੋਂ ਕਰਨ ਨਾਲ ਹਦਾਇਤਾਂ ਦੀ ਰਿਟੈਂਸ਼ਨ ਨੂੰ 90% ਤੋਂ ਵੱਧ ਤੱਕ ਬਹਾਲ ਕੀਤਾ ਜਾ ਸਕਦਾ ਹੈ।