Pourquoi la compression de contexte de l'IA ignore silencieusement vos instructions
À mesure que les conversations avec les grands modèles de langage (LLM) s'allongent, les développeurs s'appuient de plus en plus sur la « compression de contexte » ou le compactage pour gérer les limites de jetons (tokens) et éviter les goulots d'étranglement de performance. Cependant, de nouvelles recherches révèlent une faille critique dans cette optimisation : lorsque les systèmes d'IA résument l'historique de la conversation pour gagner de l'espace, ils rejettent fréquemment les règles mêmes censées régir leur comportement.
La fragilité des contraintes de session
Lorsqu'un système d'IA subit un compactage, son objectif principal est de préserver la continuité de la tâche — maintenir l'objectif, l'état actuel et les prochaines étapes nécessaires. Si cela préserve le « quoi » d'une conversation, cela sacrifie souvent le « comment ».
Des chercheurs de Penn State ont identifié que les « contraintes de session » sont les premières victimes de ce processus. Il s'agit de règles non permanentes imposées par l'utilisateur, telles que « N'utilisez jamais mon nom dans vos réponses » ou « Confirmez avec moi avant d'apporter des modifications ». Comme ces instructions ne font pas partie de la tâche principale ou du prompt système permanent, les algorithmes de compression les considèrent comme des détails secondaires et les suppriment pour faire de la place à des données plus pertinentes.
Les conclusions de COMPINT : un taux de survie de 17 %
Pour quantifier cette dégradation, les chercheurs ont développé la suite d'évaluation COMPINT. Les résultats sont sans appel : en moyenne, seuls 17 % des contraintes de session injectées survivent au processus de compression.
L'étude a mis en évidence une chute significative du respect des règles. Lorsqu'un agent a accès à un contexte complet et non compressé, les taux de conformité se situent généralement entre 59 % et 71 %. Une fois le compactage effectué, la conformité s'effondre, tombant souvent à des niveaux à peine distinguables d'un scénario où aucune contrainte n'avait été fournie.
Il ne s'agit pas seulement d'une question de nuance conversationnelle ; c'est un risque majeur pour la sécurité et la fiabilité. Dans les flux de travail agentiques (agentic workflows), la perte d'une contrainte telle que « Ne pas exécuter de code sans approbation » pourrait entraîner des appels d'outils non autorisés, des fuites de données ou des modifications non vérifiées de systèmes externes tels que les calendriers ou les e-mails.
Une solution légère via Qwen3.5-9B
Plutôt que de refondre la logique de compression complexe utilisée par les grands laboratoires d'IA, les chercheurs proposent une correction architecturale de type « plug-and-play ». Ils ont développé un petit module complémentaire basé sur le modèle Qwen3.5-9B, conçu pour agir comme un extracteur spécialisé.
Ce module fonctionne en :
- Analysant chaque entrée utilisateur en temps réel pour détecter et isoler les contraintes de session.
- Maintenant une liste dédiée et indépendante de ces règles.
- Ajoutant cette liste distillée au résumé chaque fois que le système principal effectue un compactage.
Les résultats de cette approche sont extrêmement efficaces. L'extracteur a atteint un taux de rétention de plus de 90 % à travers divers scénarios de test, incluant un taux de réussite de 95,6 % pour les trajectoires d'agents et de 90,3 % pour les discussions multi-tours. Comme cette méthode ne nécessite aucun réentraînement du modèle principal ni aucune modification de l'infrastructure de compression existante, elle offre une voie évolutive vers des interactions d'IA à long contexte plus fiables.
Points clés à retenir
- Effacement des contraintes : La compression de contexte donne la priorité aux objectifs de la tâche plutôt qu'aux règles de comportement, ce qui entraîne la perte de la plupart des « contraintes de session » imposées par l'utilisateur lors de la synthèse.
- Risques de sécurité : La perte d'instructions — telles que les exigences de vérification par un humain (human-in-the-loop) — peut entraîner des actions d'agents non autorisées et compromettre la sécurité.
- Corrections modulaires : L'utilisation d'un petit modèle spécialisé comme Qwen3.5-9B pour suivre les contraintes séparément peut restaurer la rétention des instructions à plus de 90 %.
