为什么 AI 上下文压缩正在悄无声息地忽略你的指令

随着与大语言模型 (LLM) 对话的增长,开发者越来越依赖“上下文压缩”或紧凑化处理来管理 token 限制并防止性能瓶颈。然而,新的研究揭示了这种优化中的一个关键缺陷:当 AI 系统通过总结对话历史来节省空间时,它们经常会丢弃那些旨在规范其行为的规则。

会话约束的脆弱性

当 AI 系统进行压缩时,其主要目标是保持任务的连续性——即维持目标、当前状态和必要的后续步骤。虽然这保留了对话的“内容”(what),但往往牺牲了对话的“方式”(how)。

宾夕法尼亚州立大学的研究人员发现,“会话约束”是这一过程的首要牺牲品。这些是用户施加的非永久性规则,例如“不要在回复中使用我的名字”或“在进行任何更改之前先向我确认”。由于这些指令不属于核心任务或永久性的系统提示词,压缩算法会将它们视为次要细节,并为了给更相关的数据腾出空间而将其剔除。

COMPINT 研究结果:仅 17% 的生存率

为了量化这种退化,研究人员开发了 COMPINT 评估套件。结果令人震惊:平均而言,只有 17% 的注入会话约束能在压缩过程中幸存下来

研究强调了规则遵循率的显著下降。当智能体可以访问完整的、未经压缩的上下文时,遵循率通常在 59% 到 71% 之间。一旦发生压缩,遵循率会骤降,往往降至与从未提供过约束的情况几乎无异的水平。

这不仅仅是对话细微差别的问题,更是一个重大的安全和可靠性风险。在智能体工作流中,像“未经批准不得执行代码”这样的约束丢失,可能会导致未经授权的工具调用、数据泄露,或对日历、电子邮件等外部系统进行未经核实的更改。

通过 Qwen3.5-9B 实现轻量化解决方案

研究人员并没有试图彻底改革主要 AI 实验室使用的复杂压缩逻辑,而是提出了一种“即插即用”的架构修复方案。他们开发了一个基于 Qwen3.5-9B 模型的小型附加模块,旨在充当专门的提取器。

该模块通过以下方式运行:

  1. 实时扫描用户的每一条输入,以检测并隔离会话约束。
  2. 维护一个专门的、独立的规则列表。
  3. 每当主系统执行压缩时,将此精简后的列表附加到摘要中。

这种方法的实施效果非常显著。该提取器在各种测试场景中实现了超过 90% 的保留率,包括在智能体轨迹中达到 95.6% 的成功率,在多轮对话中达到 90.3% 的成功率。由于这种方法不需要重新训练主模型,也不需要更改现有的压缩基础设施,因此它为实现更可靠的长上下文 AI 交互提供了一条可扩展的路径。

核心要点

  • 约束擦除: 上下文压缩优先考虑任务目标而非行为规则,导致大多数用户施加的“会话约束”在总结过程中丢失。
  • 安全风险: 指令的丢失(例如对“人机回环”验证的要求)可能导致未经授权的智能体行为并危及安全性。
  • 模块化修复: 使用像 Qwen3.5-9B 这样的小型专门模型来单独跟踪约束,可以将指令保留率恢复到 90% 以上。