Почему сжатие контекста ИИ незаметно игнорирует ваши инструкции

По мере того как диалоги с большими языковыми моделями (LLM) становятся длиннее, разработчики все чаще полагаются на «сжатие контекста» (context compression) или компакцию, чтобы управлять лимитами токенов и предотвращать узкие места в производительности. Однако новые исследования выявляют критический недостаток этой оптимизации: когда системы ИИ резюмируют историю разговора для экономии места, они часто отбрасывают те самые правила, которые должны определять их поведение.

Хрупкость сессионных ограничений

Когда система ИИ проходит процесс компакции, ее основной целью является сохранение непрерывности задачи — поддержание цели, текущего состояния и необходимых следующих шагов. Хотя это сохраняет «что» в разговоре, это часто приносит в жертву «как».

Исследователи из Пенсильванского университета (Penn State) установили, что «сессионные ограничения» (session constraints) становятся первыми жертвами этого процесса. Это временные, наложенные пользователем правила, такие как «Никогда не используй мое имя в своих ответах» или «Подтверждай со мной любые изменения». Поскольку эти инструкции не являются частью основной задачи или постоянного системного промпта, алгоритмы сжатия воспринимают их как второстепенные детали и удаляют, чтобы освободить место для более релевантных данных.

Результаты COMPINT: выживаемость всего 17%

Чтобы количественно оценить эту деградацию, исследователи разработали набор инструментов оценки COMPINT. Результаты поражают: в среднем лишь 17 процентов внедренных сессионных ограничений выживают в процессе сжатия.

Исследование выявило значительное снижение соблюдения правил. Когда агент имеет доступ к полному, несжатому контексту, уровень соблюдения правил обычно составляет от 59% до 71%. Как только происходит компакция, этот показатель резко падает, часто достигая уровней, едва отличимых от сценария, в котором ограничения вообще не предоставлялись.

Это не просто вопрос нюансов общения; это серьезный риск для безопасности и надежности. В агентских рабочих процессах (agentic workflows) потеря такого ограничения, как «Не выполняй код без одобрения», может привести к несанкционированным вызовам инструментов, утечкам данных или непроверенным изменениям во внешних системах, таких как календари или электронная почта.

Легковесное решение с помощью Qwen3.5-9B

Вместо того чтобы перестраивать сложную логику сжатия, используемую крупными ИИ-лабораториями, исследователи предлагают архитектурное исправление по принципу «подключи и работай» (plug-and-play). Они разработали небольшой дополнительный модуль на базе модели Qwen3.5-9B, предназначенный для работы в качестве специализированного экстрактора.

Этот модуль работает следующим образом:

  1. Сканирование каждого ввода пользователя в режиме реального времени для обнаружения и изоляции сессионных ограничений.
  2. Ведение выделенного независимого списка этих правил.
  3. Добавление этого очищенного списка к резюме всякий раз, когда основная система выполняет компакцию.

Результаты этого подхода крайне эффективны. Экстрактор обеспечил более 90 процентов удержания в различных сценариях тестирования, включая 95,6% успеха для траекторий агентов и 90,3% для многоходовых чатов. Поскольку этот метод не требует переобучения основной модели и не требует изменений в существующей инфраструктуре сжатия, он предлагает масштабируемый путь к более надежному взаимодействию с ИИ в условиях длинного контекста.

Основные выводы

  • Стирание ограничений: Сжатие контекста отдает приоритет целям задачи перед правилами поведения, из-за чего большинство наложенных пользователем «сессионных ограничений» теряется при резюмировании.
  • Риски безопасности: Потеря инструкций — например, требований верификации человеком (human-in-the-loop) — может привести к несанкционированным действиям агента и нарушению безопасности.
  • Модульные исправления: Использование небольшой специализированной модели, такой как Qwen3.5-9B, для отдельного отслеживания ограничений может восстановить удержание инструкций до уровня более 90%.