Новый модуль «проактивной памяти» позволяет агентам на базе больших языковых моделей отслеживать требования задач, факты об окружении и прошлые ошибки — без необходимости тонкой настройки основной модели. В ходе бенчмарк-тестов это дополнение подняло результат Sonnet 4.5 на 8,3 процентных пункта в Terminal-Bench 2.0 и на 6,8 пункта в наборе тестов τ2-Bench; агент памяти, обученный с помощью SETA, повысил показатель pass@1 замороженной модели с 37,6 % до 41,1 % на новых задачах.

Почему агенты теряют нить

Когда агент на базе LLM следует многошаговой процедуре, его внутреннее «состояние» деградирует. Исследователи называют это «деградацией поведенческого состояния»: модель забывает ранние инструкции, ключевые факты или ошибки, которые она уже совершила. Результатом становится каскад неверных решений, который приводит к прерыванию задачи задолго до её завершения.

Обычный способ решения — увеличение контекстного окна (объема текста, который модель может обрабатывать одновременно). Это помогает лишь до тех пор, пока задача не перерастает пределы окна; старая информация отбрасывается, и деградация возобновляется.

Напоминание, которое срабатывает только при необходимости

Новый подход заключается в добавлении легковесного вспомогательного агента памяти, который отслеживает цепочку рассуждений основной модели и вставляет целевые напоминания. Вместо того чтобы извлекать статический список прошлых фрагментов, модуль памяти сам решает, когда и что нужно предъявить, действуя только тогда, когда основная модель начинает отклоняться от курса.

Поскольку модуль обучения памяти обучается отдельно, основная модель действий остается замороженной. Исследование показывает, что такое разделение всё равно обеспечивает значительный прирост в бенчмарках с долгосрочными задачами, доказывая, что проактивные напоминания могут компенсировать ограниченное контекстное окно.

Что говорят цифры

  • Terminal-Bench 2.0: показатель Sonnet 4.5 вырос на 8,3 пункта по сравнению с базовым уровнем.
  • τ2-Bench suite: та же модель улучшила результат на 6,8 пункта.
  • Pass@1 на отложенных тестах: агент памяти, обученный с помощью SETA, поднял показатель замороженной модели с 37,6 % до 41,1 %.

Эти улучшения происходят без какой-либо дополнительной тонкой настройки основной модели, поэтому компонент памяти можно подключать или отключать в существующих системах.

Ограничения текущей работы

Эксперименты не охватывают следующие аспекты:

  • Масштабируемость: пока нет доказательств того, что модуль памяти ведет себя так же эффективно с многомиллиардными моделями или задачами, требующими миллионов шагов.
  • Стоимость эксплуатации: хранение и извлечение напоминаний создает дополнительные накладные расходы, однако в исследовании не приводится количественная оценка дополнительной памяти или вычислительных мощностей, необходимых в реальной системе.

На что обратить внимание в будущем

Будущие наборы бенчмарков должны измерять не только чистый размер контекста. Тесты, которые явно отслеживают деградацию состояния и поощряют системы активных напоминаний, дадут более четкое представление о долгосрочной надежности агентов. Исследователям также необходимо показать, что проактивная память масштабируется эффективно — как в плане размера модели, так и в плане эксплуатационных расходов.

Вывод: Небольшой, отдельно обученный модуль памяти может выступать в роли «сторожевого пса» для агентов на базе больших языковых моделей, выявляя и исправляя отклонения до того, как они приведут к сбою в выполнении задачи.