Dlaczego kompresja kontekstu AI po cichu ignoruje Twoje instrukcje

W miarę jak rozmowy z dużymi modelami językowymi (LLM) stają się coraz dłuższe, programiści coraz częściej polegają na „kompresji kontekstu” lub kompaktowaniu, aby zarządzać limitami tokenów i zapobiegać wąskim gardłom wydajnościowym. Jednak nowe badania ujawniają krytyczną wadę tej optymalizacji: gdy systemy AI streszczają historię rozmowy, aby zaoszczędzić miejsce, często odrzucają właśnie te reguły, które mają nimi kierować.

Kruchość ograniczeń sesji

Podczas gdy system AI przechodzi proces kompaktowania, jego głównym celem jest zachowanie ciągłości zadania – utrzymanie celu, obecnego stanu i niezbędnych kolejnych kroków. Choć pozwala to zachować „co” jest tematem rozmowy, często poświęca „jak” powinna ona przebiegać.

Badacze z Penn State zidentyfikowali, że „ograniczenia sesji” (session constraints) są pierwszymi ofiarami tego procesu. Są to niepermanentne, narzucone przez użytkownika reguły, takie jak „Nigdy nie używaj mojego imienia w swoich odpowiedziach” lub „Potwierdź ze mną każdą zmianę”. Ponieważ instrukcje te nie stanowią części głównego zadania ani stałego promptu systemowego, algorytmy kompresji traktują je jako szczegóły drugorzędne i usuwają je, aby zrobić miejsce na bardziej istotne dane.

Wyniki COMPINT: 17-procentowy wskaźnik przetrwania

Aby skwantyfikować tę degradację, badacze opracowali zestaw ewaluacyjny COMPINT. Wyniki są uderzające: średnio tylko 17 procent wprowadzonych ograniczeń sesji przetrwa proces kompresji.

Badanie wykazało znaczący spadek przestrzegania reguł. Gdy agent ma dostęp do pełnego, niekompresowanego kontekstu, wskaźniki zgodności zazwyczaj wynoszą od 59% do 71%. Po dokonaniu kompaktowania zgodność gwałtownie spada, często osiągając poziomy niemal nieodróżnialne od scenariusza, w którym żadne ograniczenie nigdy nie zostało podane.

To nie tylko kwestia niuansów konwersacyjnych; to poważne ryzyko dla bezpieczeństwa i niezawodności. W przepływach pracy agentów (agentic workflows), utrata ograniczenia typu „Nie wykonuj kodu bez zatwierdzenia” może prowadzić do nieautoryzowanych wywołań narzędzi, wycieków danych lub niezweryfikowanych zmian w zewnętrznych systemach, takich jak kalendarze czy poczta e-mail.

Lekkie rozwiązanie dzięki Qwen3.5-9B

Zamiast przebudowywać złożoną logikę kompresji stosowaną przez główne laboratoria AI, badacze proponują rozwiązanie architektoniczne typu „plug-and-play”. Opracowali mały moduł dodatkowy oparty na modelu Qwen3.5-9B, zaprojektowany do działania jako wyspecjalizowany ekstraktor.

Moduł ten działa poprzez:

  1. Skanowanie każdego wejścia użytkownika w czasie rzeczywistym w celu wykrycia i wyizolowania ograniczeń sesji.
  2. Utrzymywanie dedykowanej, niezależnej listy tych reguł.
  3. Dołączanie tej skondensowanej listy do podsumowania za każdym razem, gdy główny system wykonuje kompaktowanie.

Wyniki tego podejścia są wysoce skuteczne. Ekstraktor osiągnął ponad 90 procent retencji w różnych scenariuszach testowych, w tym 95,6% skuteczności dla trajektorii agentów i 90,3% dla czatów wieloturowych. Ponieważ metoda ta nie wymaga ponownego trenowania głównego modelu ani zmian w istniejącej infrastrukturze kompresji, oferuje skalowalną ścieżkę do bardziej niezawodnych interakcji z AI w długim kontekście.

Kluczowe wnioski

  • Usuwanie ograniczeń: Kompresja kontekstu priorytetyzuje cele zadania nad regułami zachowania, co powoduje, że większość narzuconych przez użytkownika „ograniczeń sesji” zostaje utracona podczas streszczania.
  • Ryzyko bezpieczeństwa: Utrata instrukcji — takich jak wymogi dotyczące weryfikacji przez człowieka (human-in-the-loop) — może prowadzić do nieautoryzowanych działań agenta i naruszenia bezpieczeństwa.
  • Modułowe poprawki: Użycie małego, wyspecjalizowanego modelu, takiego jak Qwen3.5-9B, do oddzielnego śledzenia ograniczeń może przywrócić retencję instrukcji do poziomu powyżej 90%.