Warum KI-Kontextkompression Ihre Anweisungen stillschweigend ignoriert

Da Gespräche mit Large Language Models (LLMs) immer länger werden, verlassen sich Entwickler zunehmend auf „Kontextkompression“ oder Kompaktierung, um Token-Limits zu verwalten und Performance-Engpässe zu vermeiden. Neue Forschungsergebnisse zeigen jedoch einen kritischen Fehler in dieser Optimierung auf: Wenn KI-Systeme den Gesprächsverlauf zusammenfassen, um Platz zu sparen, verwerfen sie häufig genau die Regeln, die ihr Verhalten steuern sollen.

Die Fragilität von Session Constraints

Wenn ein KI-System einer Kompaktierung unterzogen wird, besteht das primäre Ziel darin, die Aufgabenkontinuität zu bewahren – also das Ziel, den aktuellen Zustand und die notwendigen nächsten Schritte aufrechtzuerhalten. Während dies das „Was“ eines Gesprächs bewahrt, wird das „Wie“ oft geopfert.

Forscher der Penn State University haben festgestellt, dass „Session Constraints“ die ersten Opfer dieses Prozesses sind. Dabei handelt es sich um nicht-permanente, vom Nutzer auferlegte Regeln wie „Verwende meinen Namen niemals in deinen Antworten“ oder „Bestätige mit mir, bevor du Änderungen vornimmst.“ Da diese Anweisungen nicht Teil der Kernaufgabe oder des permanenten System-Prompts sind, betrachten Kompressionsalgorithmen sie als sekundäre Details und entfernen sie, um Platz für relevantere Daten zu schaffen.

Die COMPINT-Ergebnisse: Eine Überlebensrate von 17 %

Um diesen Qualitätsverlust zu quantifizieren, entwickelten Forscher die COMPINT-Evaluationssuite. Die Ergebnisse sind ernüchternd: Im Durchschnitt überleben nur 17 Prozent der injizierten Session Constraints den Kompressionsprozess.

Die Studie verdeutlichte einen signifikanten Rückgang der Regelkonformität. Wenn ein Agent Zugriff auf den vollständigen, unkomprimierten Kontext hat, liegen die Compliance-Raten typischerweise zwischen 59 % und 71 %. Sobald eine Kompaktierung erfolgt, bricht die Compliance ein und fällt oft auf ein Niveau, das kaum noch von einem Szenario zu unterscheiden ist, in dem überhaupt keine Beschränkungen vorgegeben wurden.

Dies ist nicht nur eine Frage der konversationellen Nuancen; es ist ein erhebliches Sicherheits- und Zuverlässigkeitsrisiko. In agentischen Workflows könnte der Verlust einer Beschränkung wie „Führe keinen Code ohne Genehmigung aus“ zu unbefugten Tool-Aufrufen, Datenlecks oder nicht verifizierten Änderungen an externen Systemen wie Kalendern oder E-Mails führen.

Eine leichtgewichtige Lösung via Qwen3.5-9B

Anstatt die komplexe Kompressionslogik der großen KI-Labore grundlegend zu überarbeiten, schlagen die Forscher eine „Plug-and-Play“-Architekturlösung vor. Sie entwickelten ein kleines Zusatzmodul auf Basis des Qwen3.5-9B-Modells, das als spezialisierter Extraktor fungiert.

Dieses Modul arbeitet wie folgt:

  1. Es scannt jede Benutzereingabe in Echtzeit, um Session Constraints zu erkennen und zu isolieren.
  2. Es führt eine dedizierte, unabhängige Liste dieser Regeln.
  3. Es fügt diese destillierte Liste der Zusammenfassung hinzu, wann immer das Hauptsystem eine Kompaktierung durchführt.

Die Ergebnisse dieses Ansatzes sind äußerst effektiv. Der Extraktor erreichte eine Retention von über 90 Prozent in verschiedenen Test-Szenarien, einschließlich einer Erfolgsquote von 95,6 % für Agenten-Trajektorien und 90,3 % für Multi-Turn-Chats. Da diese Methode kein Retraining des Primärmodells und keine Änderungen an der bestehenden Kompressionsinfrastruktur erfordert, bietet sie einen skalierbaren Weg zu zuverlässigeren KI-Interaktionen mit langem Kontext.

Wichtigste Erkenntnisse

  • Löschung von Constraints: Kontextkompression priorisiert Aufgabenziele gegenüber Verhaltensregeln, was dazu führt, dass die meisten vom Nutzer auferlegten „Session Constraints“ während der Zusammenfassung verloren gehen.
  • Sicherheitsrisiken: Der Verlust von Anweisungen – wie etwa Anforderungen für eine Human-in-the-loop-Verifizierung – kann zu unbefugten Aktionen des Agenten und beeinträchtigter Sicherheit führen.
  • Modulare Lösungen: Die Verwendung eines kleinen, spezialisierten Modells wie Qwen3.5-9B zur separaten Verfolgung von Constraints kann die Beibehaltung von Anweisungen auf über 90 % wiederherstellen.