Por qué la compresión de contexto de la IA está ignorando silenciosamente tus instrucciones
A medida que las conversaciones con los modelos de lenguaje extensos (LLM) se vuelven más largas, los desarrolladores dependen cada vez más de la "compresión de contexto" o compactación para gestionar los límites de tokens y evitar cuellos de botella en el rendimiento. Sin embargo, nuevas investigaciones revelan un fallo crítico en esta optimización: cuando los sistemas de IA resumen el historial de la conversación para ahorrar espacio, con frecuencia descartan las mismas reglas destinadas a regir su comportamiento.
La fragilidad de las restricciones de sesión
Cuando un sistema de IA se somete a una compactación, su objetivo principal es preservar la continuidad de la tarea: mantener el objetivo, el estado actual y los siguientes pasos necesarios. Si bien esto preserva el "qué" de una conversación, a menudo sacrifica el "cómo".
Investigadores de la Universidad Estatal de Pensilvania (Penn State) han identificado que las "restricciones de sesión" son las primeras víctimas de este proceso. Estas son reglas no permanentes impuestas por el usuario, tales como "Nunca uses mi nombre en tus respuestas" o "Confirma conmigo antes de realizar cualquier cambio". Debido a que estas instrucciones no forman parte de la tarea principal ni del prompt del sistema permanente, los algoritmos de compresión las consideran detalles secundarios y las eliminan para dejar espacio a datos más relevantes.
Los hallazgos de COMPINT: una tasa de supervivencia del 17 %
Para cuantificar esta degradación, los investigadores desarrollaron la suite de evaluación COMPINT. Los resultados son contundentes: en promedio, solo el 17 por ciento de las restricciones de sesión inyectadas sobreviven al proceso de compresión.
El estudio destacó una caída significativa en el cumplimiento de las reglas. Cuando un agente tiene acceso a un contexto completo y sin comprimir, las tasas de cumplimiento suelen situarse entre el 59 % y el 71 %. Una vez que ocurre la compactación, el cumplimiento se desploma, cayendo a menudo a niveles apenas distinguibles de un escenario en el que nunca se proporcionó ninguna restricción.
Esto no es solo una cuestión de matices conversacionales; es un riesgo importante de seguridad y fiabilidad. En los flujos de trabajo de agentes (agentic workflows), la pérdida de una restricción como "No ejecutes código sin aprobación" podría dar lugar a llamadas a herramientas no autorizadas, filtraciones de datos o cambios no verificados en sistemas externos como calendarios o correo electrónico.
Una solución ligera mediante Qwen3.5-9B
En lugar de reformar la compleja lógica de compresión utilizada por los principales laboratorios de IA, los investigadores proponen una solución arquitectónica de tipo "plug-and-play". Desarrollaron un pequeño módulo complementario basado en el modelo Qwen3.5-9B, diseñado para actuar como un extractor especializado.
Este módulo funciona de la siguiente manera:
- Escanear cada entrada del usuario en tiempo real para detectar e aislar las restricciones de sesión.
- Mantener una lista dedicada e independiente de estas reglas.
- Añadir esta lista destilada al resumen cada vez que el sistema principal realice una compactación.
Los resultados de este enfoque son altamente efectivos. El extractor logró una retención superior al 90 por ciento en varios escenarios de prueba, incluyendo una tasa de éxito del 95,6 % para trayectorias de agentes y del 90,3 % para chats de múltiples turnos. Debido a que este método no requiere el reentrenamiento del modelo principal ni cambios en la infraestructura de compresión existente, ofrece un camino escalable hacia interacciones de IA de contexto largo más fiables.
Conclusiones clave
- Eliminación de restricciones: La compresión de contexto prioriza los objetivos de la tarea sobre las reglas de comportamiento, lo que provoca que la mayoría de las "restricciones de sesión" impuestas por el usuario se pierdan durante el resumen.
- Riesgos de seguridad: La pérdida de instrucciones —como los requisitos de verificación mediante intervención humana (human-in-the-loop)— puede dar lugar a acciones no autorizadas de los agentes y comprometer la seguridad.
- Soluciones modulares: El uso de un modelo pequeño y especializado como Qwen3.5-9B para rastrear las restricciones por separado puede restaurar la retención de instrucciones a más del 90 %.
