Новий модуль «проактивної пам'яті» дозволяє агентам на базі великих мовних моделей відстежувати вимоги завдань, факти про середовище та минулі помилки — без донавчання основної моделі. У бенчмарк-тестах це нововведення підвищило показник Sonnet 4.5 на 8,3 відсоткових пункти в Terminal-Bench 2.0 та на 6,8 пункти в наборі τ2-Bench; агент пам'яті, навчений за допомогою SETA, підвищив показник pass@1 замороженої моделі з 37,6 % до 41,1 % на невідомих раніше завданнях.
Чому агенти втрачають орієнтацію
Коли агент під керуванням LLM виконує багатоетапну процедуру, його внутрішній «стан» деградує. Дослідники називають це «деградацією поведінкового стану»: модель забуває попередні інструкції, ключові факти або помилки, які вона вже припустилася. Результатом стає каскад хибних рішень, що призводить до переривання завдання задовго до його завершення.
Звичним способом вирішення є збільшення контекстного вікна — обсягу тексту, на який модель може звертати увагу одночасно. Це допомагає лише доти, доки завдання не перевищить межі вікна; старіша інформація видаляється, і деградація відновлюється.
Нагадування, що спрацьовує лише за потреби
Новий підхід передбачає додавання легкого допоміжного агента пам'яті, який стежить за ланцюжком міркувань основної моделі та вводить цілеспрямовані нагадування. Замість того, щоб витягувати статичний список минулих фрагментів, модуль пам'яті вирішує, коли і що саме надати, діючи лише тоді, коли здається, що основна модель починає відхилятися від курсу.
Оскільки модуль навчання пам'яті тренується окремо, основна модель дій залишається замороженою. Дослідження показує, що таке розділення все одно забезпечує значне зростання показників у бенчмарках з довгостроковим горизонтом планування, доводячи, що проактивні нагадування можуть компенсувати обмежене контекстне вікно.
Що говорять цифри
- Terminal-Bench 2.0: Sonnet 4.5 зростає на 8,3 пункти порівняно з базовим рівнем.
- τ2-Bench suite: та сама модель покращує результат на 6,8 пункти.
- Pass@1 на тестових даних: агент пам'яті, навчений за допомогою SETA, підвищує показник замороженої моделі з 37,6 % до 41,1 %.
Ці покращення відбуваються без будь-якого додаткового донавчання основної моделі, тому компонент пам'яті можна додавати або видаляти з існуючих систем.
Обмеження поточної роботи
Експерименти не охоплюють такі аспекти:
- Масштаб: Поки немає доказів того, що модуль пам'яті поводиться так само з моделями на кілька мільярдів параметрів або із завданнями, що тривають мільйони кроків.
- Витрати у виробництві: Зберігання та пошук нагадувань створюють додаткове навантаження, проте дослідження не дає кількісної оцінки обсягу додаткової пам'яті чи обчислювальних ресурсів, необхідних у реальній системі.
На що звернути увагу далі
Майбутні набори бенчмарків повинні вимірювати більше, ніж просто чистий розмір контексту. Тести, які явно відстежують деградацію стану та винагороджують системи активних нагадувань, дадуть чіткіше уявлення про довгострокову надійність агента. Дослідники також мають продемонструвати, що проактивна пам'ять ефективно масштабується як за розміром моделі, так і за експлуатаційними витратами.
Висновок: Невеликий, окремо навчений модуль пам'яті може діяти як «сторожовий пес» для агентів на базі великих мовних моделей, виявляючи та виправляючи відхилення до того, як вони виведуть виконання завдання з колії.
