Un nouveau module de « mémoire proactive » permet aux agents de grands modèles de langage de suivre les exigences des tâches, les faits de l'environnement et les échecs passés — sans nécessiter de réglage fin du modèle de base. Lors de tests de référence, cet ajout a augmenté le score de Sonnet 4.5 de 8,3 points de pourcentage sur Terminal-Bench 2.0 et de 6,8 points sur la suite τ2-Bench ; un agent de mémoire entraîné par SETA a fait passer le pass@1 d'un modèle gelé de 37,6 % à 41,1 % sur des problèmes inédits.

Pourquoi les agents perdent le fil

Lorsqu'un agent piloté par un LLM suit une procédure en plusieurs étapes, son « état » interne se dégrade. Les chercheurs appellent cela la « dégradation de l'état comportemental » (behavioral state decay) : le modèle oublie les instructions précédentes, des faits clés ou des erreurs qu'il a déjà commises. Il en résulte une cascade de mauvaises décisions qui interrompent une tâche bien avant son achèvement.

La solution habituelle consiste à agrandir la fenêtre de contexte — le bloc de texte auquel le modèle peut prêter attention simultanément. Cela n'aide que jusqu'à ce que la tâche dépasse la taille de la fenêtre ; les informations les plus anciennes sont alors supprimées et la dégradation reprend.

Un rappel qui n'intervient que lorsque c'est nécessaire

La nouvelle approche ajoute un agent de mémoire auxiliaire léger qui surveille la trace de raisonnement du modèle principal et injecte des rappels ciblés. Au lieu d'extraire une liste statique de fragments passés, le module de mémoire décide quand et quoi faire remonter, n'agissant que lorsque le modèle principal semble dériver.

Comme l'apprenant de la mémoire s'entraîne séparément, le modèle d'action principal reste gelé. L'étude montre que cette séparation produit tout de même des gains considérables sur les benchmarks à long horizon, prouvant que des rappels proactifs peuvent compenser une fenêtre de contexte limitée.

Ce que disent les chiffres

  • Terminal-Bench 2.0 : Sonnet 4.5 bondit de 8,3 points par rapport à sa référence.
  • Suite τ2-Bench : Le même modèle s'améliore de 6,8 points.
  • Pass@1 sur les tests d'évaluation : Un agent de mémoire entraîné par SETA fait passer un modèle gelé de 37,6 % à 41,1 %.

Ces augmentations se produisent sans aucun réglage fin supplémentaire du modèle principal, de sorte que le composant de mémoire peut être intégré ou retiré des déploiements existants.

Limites des travaux actuels

Les expériences s'arrêtent avant de tester :

  • L'échelle : Aucune preuve pour l'instant que le module de mémoire se comporte de la même manière avec des modèles de plusieurs milliards de paramètres ou des tâches s'étendant sur des millions d'étapes.
  • Le coût de production : Le stockage et la récupération des rappels ajoutent une charge supplémentaire, mais l'étude ne quantifie pas la mémoire ou la puissance de calcul additionnelles requises dans un système réel.

Ce qu'il faut surveiller ensuite

Les futures suites de benchmarks devront mesurer plus que la simple taille du contexte. Des tests qui suivent explicitement la dégradation de l'état et récompensent les systèmes de rappel actifs donneront une image plus claire de la fiabilité à long terme d'un agent. Les chercheurs doivent également démontrer que la mémoire proactive passe à l'échelle de manière efficace, tant en termes de taille de modèle que de coût opérationnel.

À retenir : Un petit module de mémoire entraîné séparément peut agir comme une sentinelle pour les agents de grands modèles de langage, détectant et corrigeant la dérive avant qu'elle ne fasse dérailler une tâche.