Yapay Zeka Bağlam Sıkıştırması Talimatlarınızı Neden Sessizce Görmezden Geliyor

Büyük Dil Modelleri (LLM'ler) ile yapılan konuşmalar uzadıkça, geliştiriciler token sınırlarını yönetmek ve performans darboğazlarını önlemek için giderek daha fazla "bağlam sıkıştırma" (context compression) veya sıkıştırma (compaction) yöntemine güveniyorlar. Ancak yeni araştırmalar, bu optimizasyonda kritik bir kusuru ortaya koyuyor: Yapay zeka sistemleri alan tasarrufu sağlamak için konuşma geçmişini özetlediğinde, davranışlarını yönetmesi gereken kuralları sıklıkla göz ardı ediyorlar.

Oturum Kısıtlamalarının Kırılganlığı

Bir yapay zeka sistemi sıkıştırma işlemine tabi tutulduğunda, birincil amacı görev sürekliliğini korumaktır; yani hedefi, mevcut durumu ve gerekli sonraki adımları muhafaza etmektir. Bu durum bir konuşmanın "ne" olduğunu korurken, genellikle "nasıl" olacağını feda eder.

Penn State'deki araştırmacılar, "oturum kısıtlamalarının" (session constraints) bu sürecin ilk kurbanları olduğunu belirlediler. Bunlar, "Yanıtlarında asla ismimi kullanma" veya "Herhangi bir değişiklik yapmadan önce benimle onayla" gibi kullanıcı tarafından konulan kalıcı olmayan kurallardır. Bu talimatlar çekirdek görevin veya kalıcı sistem isteminin (system prompt) bir parçası olmadığından, sıkıştırma algoritmaları bunları ikincil ayrıntılar olarak görür ve daha ilgili verilere yer açmak için budarlar.

COMPINT Bulguları: %17'lik Hayatta Kalma Oranı

Bu bozulmayı nicelleştirmek için araştırmacılar COMPINT değerlendirme paketini geliştirdiler. Sonuçlar çarpıcı: Ortalama olarak, enjekte edilen oturum kısıtlamalarının yalnızca yüzde 17'si sıkıştırma sürecinden sağ çıkabiliyor.

Çalışma, kural uyumunda önemli bir düşüşe dikkat çekti. Bir ajan tam, sıkıştırılmamış bağlama erişebildiğinde, uyum oranları tipik olarak %59 ile %71 arasında seyrediyor. Sıkıştırma gerçekleştiğinde ise uyum oranları hızla düşerek, genellikle hiçbir kısıtlama hiç verilmemiş bir senaryodan pek de ayırt edilemeyecek seviyelere geriliyor.

Bu sadece konuşma akışındaki bir nüans meselesi değil; aynı zamanda büyük bir güvenlik ve güvenilirlik riskidir. Ajan tabanlı iş akışlarında (agentic workflows), "Onay almadan kod yürütme" gibi bir kısıtlamanın kaybı; yetkisiz araç çağrılarına, veri sızıntılarına veya takvimler ya da e-postalar gibi harici sistemlerde doğrulanmamış değişikliklere yol açabilir.

Qwen3.5-9B ile Hafif Bir Çözüm

Araştırmacılar, büyük yapay zeka laboratuvarları tarafından kullanılan karmaşık sıkıştırma mantığını tamamen değiştirmek yerine, "tak-çalıştır" tarzında bir mimari çözüm öneriyorlar. Özel bir çıkarıcı (extractor) olarak görev yapması için tasarlanan, Qwen3.5-9B modeline dayalı küçük bir eklenti modülü geliştirdiler.

Bu modül şu şekilde çalışır:

  1. Oturum kısıtlamalarını tespit etmek ve izole etmek için her kullanıcı girdisini gerçek zamanlı olarak tarar.
  2. Bu kuralların özel ve bağımsız bir listesini tutar.
  3. Ana sistem bir sıkıştırma işlemi gerçekleştirdiğinde, bu damıtılmış listeyi özete ekler.

Bu yaklaşımın sonuçları oldukça etkili. Çıkarıcı, ajan yörüngeleri (agent trajectories) için %95,6 ve çok turlu sohbetler (multi-turn chats) için %90,3 başarı oranı dahil olmak üzere çeşitli test senaryolarında %90'ın üzerinde koruma sağladı. Bu yöntem, ana modelin yeniden eğitilmesini veya mevcut sıkıştırma altyapısında değişiklik yapılmasını gerektirmediği için, daha güvenilir uzun bağlamlı yapay zeka etkileşimlerine doğru ölçeklenebilir bir yol sunuyor.

Önemli Çıkarımlar

  • Kısıtlama Silinmesi: Bağlam sıkıştırması, davranışsal kurallar yerine görev hedeflerine öncelik verir; bu da kullanıcı tarafından konulan çoğu "oturum kısıtlamasının" özetleme sırasında kaybolmasına neden olur.
  • Güvenlik Riskleri: İnsan denetimi (human-in-the-loop) gereksinimleri gibi talimatların kaybı, yetkisiz ajan eylemlerine ve güvenliğin tehlikeye girmesine yol açabilir.
  • Modüler Çözümler: Kısıtlamaları ayrı olarak takip etmek için Qwen3.5-9B gibi küçük ve özel bir model kullanmak, talimat koruma oranını %90'ın üzerine çıkarabilir.