Waarom AI-contextcompressie stilletjes je instructies negeert
Naarmate gesprekken met Large Language Models (LLM's) langer worden, vertrouwen ontwikkelaars steeds vaker op "contextcompressie" of compactie om tokenlimieten te beheren en prestatieproblemen te voorkomen. Nieuw onderzoek onthult echter een kritiek gebrek in deze optimalisatie: wanneer AI-systemen de gesprekshistorie samenvatten om ruimte te besparen, negeren ze vaak de regels die juist bedoeld zijn om hun gedrag te sturen.
De kwetsbaarheid van sessiebeperkingen
Wanneer een AI-systeem wordt gecomprimeerd, is het hoofddoel het behouden van de taakcontinuïteit — het handhaven van het doel, de huidige staat en de noodzakelijke volgende stappen. Hoewel dit het "wat" van een gesprek behoudt, wordt het "hoe" vaak opgeofferd.
Onderzoekers van Penn State hebben vastgesteld dat "sessiebeperkingen" (session constraints) de eerste slachtoffers zijn van dit proces. Dit zijn niet-permanente, door de gebruiker opgelegde regels zoals "Gebruik nooit mijn naam in je antwoorden" of "Bevestig het eerst bij mij voordat je wijzigingen aanbrengt." Omdat deze instructies geen deel uitmaken van de kernopdracht of de permanente systeem-prompt, beschouwen compressie-algoritmen ze als secundaire details en verwijderen ze deze om ruimte te maken voor relevantere gegevens.
De COMPINT-bevindingen: een overlevingspercentage van 17%
Om deze degradatie te kwantificeren, hebben onderzoekers de COMPINT-evaluatiesuite ontwikkeld. De resultaten zijn schokkend: gemiddeld overleeft slechts 17 procent van de geïnjecteerde sessiebeperkingen het compressieproces.
De studie wees op een aanzienlijke daling in de naleving van regels. Wanneer een agent toegang heeft tot de volledige, ongecomprimeerde context, liggen de nalevingspercentages doorgaans tussen de 59% en 71%. Zodra compactie plaatsvindt, stort de naleving in, vaak tot niveaus die nauwelijks te onderscheiden zijn van een scenario waarin er nooit een beperking is opgelegd.
Dit is niet alleen een kwestie van gesprekstechnische nuance; het is een groot beveiligings- en betrouwbaarheidsrisico. In agentic workflows kan het verlies van een beperking zoals "Voer geen code uit zonder goedkeuring" leiden tot ongeautoriseerde tool-aanroepen, datalekken of ongeverifieerde wijzigingen in externe systemen zoals agenda's of e-mail.
Een lichtgewicht oplossing via Qwen3.5-9B
In plaats van de complexe compressielogica die door grote AI-labs wordt gebruikt volledig te herzien, stellen de onderzoekers een "plug-and-play" architecturale oplossing voor. Ze hebben een kleine add-on module ontwikkeld op basis van het Qwen3.5-9B-model, ontworpen om te fungeren als een gespecialiseerde extractor.
Deze module werkt als volgt:
- Het in realtime scannen van elke gebruikersinvoer om sessiebeperkingen te detecteren en te isoleren.
- Het bijhouden van een speciale, onafhankelijke lijst met deze regels.
- Het toevoegen van deze gefilterde lijst aan de samenvatting telkens wanneer het hoofdmodel een compactie uitvoert.
De resultaten van deze aanpak zijn zeer effectief. De extractor behaalde een retentie van meer dan 90 procent in verschillende testscenario's, waaronder een succespercentage van 95,6% voor agent-trajecten en 90,3% voor chats met meerdere beurten. Omdat deze methode geen hertraining van het primaire model vereist en geen wijzigingen in de bestaande compressie-infrastructuur noodzakelijk maakt, biedt het een schaalbaar pad naar betrouwbaardere AI-interacties met een lange context.
Belangrijkste conclusies
- Verlies van beperkingen: Contextcompressie geeft prioriteit aan taaldoelen boven gedragsregels, waardoor de meeste door de gebruiker opgelegde "sessiebeperkingen" verloren gaan tijdens het samenvatten.
- Beveiligingsrisico's: Het verlies van instructies — zoals vereisten voor human-in-the-loop verificatie — kan leiden tot ongeautoriseerde acties van de agent en een aangetaste beveiliging.
- Modulaire oplossingen: Het gebruik van een klein, gespecialiseerd model zoals Qwen3.5-9B om beperkingen apart bij te houden, kan de retentie van instructies herstellen tot boven de 90%.
