Một mô-đun "bộ nhớ chủ động" (proactive memory) mới cho phép các tác nhân mô hình ngôn ngữ lớn (LLM agents) theo dõi các yêu cầu nhiệm vụ, các sự kiện môi trường và những thất bại trong quá khứ—mà không cần tinh chỉnh (fine-tuning) mô hình cốt lõi. Trong các bài kiểm tra đánh giá, sự bổ sung này đã giúp điểm số của Sonnet 4.5 tăng thêm 8,3 điểm phần trăm trên Terminal-Bench 2.0 và 6,8 điểm trên bộ τ2-Bench; một tác nhân bộ nhớ được huấn luyện bằng SETA đã nâng tỷ lệ pass@1 của một mô hình đóng băng (frozen model) từ 37,6% lên 41,1% đối với các vấn đề chưa từng gặp.

Tại sao các tác nhân mất phương hướng

Khi một tác nhân vận hành bởi LLM thực hiện một quy trình gồm nhiều bước, "trạng thái" nội tại của nó sẽ bị suy giảm. Các nhà nghiên cứu gọi đây là "sự suy giảm trạng thái hành vi" (behavioral state decay): mô hình quên các chỉ dẫn trước đó, các sự kiện quan trọng hoặc những sai lầm mà nó đã mắc phải. Kết quả là một chuỗi các quyết định sai lầm dẫn đến việc hủy bỏ nhiệm vụ từ rất lâu trước khi hoàn thành.

Cách khắc phục thông thường là mở rộng cửa sổ ngữ cảnh (context window)—phần văn bản mà mô hình có thể chú ý cùng một lúc. Điều này chỉ có tác dụng cho đến khi nhiệm vụ vượt quá kích thước cửa sổ; các thông tin cũ sẽ bị loại bỏ và sự suy giảm lại tiếp diễn.

Một lời nhắc chỉ hoạt động khi cần thiết

Phương pháp mới bổ sung một tác nhân bộ nhớ phụ trợ nhẹ nhàng, có nhiệm vụ theo dõi vết suy luận (reasoning trace) của mô hình chính và đưa vào các lời nhắc có mục tiêu. Thay vì truy xuất một danh sách tĩnh các đoạn thông tin cũ, mô-đun bộ nhớ sẽ quyết định khi nàocái gì cần hiển thị, chỉ hành động khi mô hình chính có dấu hiệu đi chệch hướng.

Vì bộ học bộ nhớ được huấn luyện riêng biệt, mô hình hành động chính vẫn được giữ ở trạng thái đóng băng. Nghiên cứu cho thấy sự tách biệt này vẫn mang lại những cải thiện đáng kể trên các bài kiểm tra đánh giá tầm nhìn dài (long-horizon benchmarks), chứng minh rằng các lời nhắc chủ động có thể bù đắp cho cửa sổ ngữ cảnh hạn chế.

Các con số nói lên điều gì

  • Terminal-Bench 2.0: Sonnet 4.5 tăng 8,3 điểm so với mức cơ sở (baseline).
  • τ2-Bench suite: Cùng mô hình đó cải thiện thêm 6,8 điểm.
  • Pass@1 trên các bài kiểm tra độc lập (held-out tests): Một tác nhân bộ nhớ được huấn luyện bằng SETA đã nâng một mô hình đóng băng từ 37,6% lên 41,1%.

Những sự gia tăng này diễn ra mà không cần bất kỳ quá trình tinh chỉnh bổ sung nào cho mô hình chính, vì vậy thành phần bộ nhớ có thể được thay thế vào hoặc rút ra khỏi các hệ thống đang triển khai hiện có.

Hạn chế của nghiên cứu hiện tại

Các thí nghiệm vẫn chưa dừng lại ở việc kiểm tra:

  • Quy mô: Chưa có bằng chứng cho thấy mô-đun bộ nhớ hoạt động tương tự với các mô hình có hàng tỷ tham số hoặc các nhiệm vụ chạy trong hàng triệu bước.
  • Chi phí vận hành: Việc lưu trữ và truy xuất các lời nhắc làm tăng chi phí quản lý (overhead), nhưng nghiên cứu chưa định lượng được lượng bộ nhớ hoặc tài nguyên tính toán bổ sung cần thiết trong một hệ thống thực tế.

Những điều cần theo dõi tiếp theo

Các bộ đánh giá trong tương lai sẽ cần đo lường nhiều hơn là chỉ kích thước ngữ cảnh thô. Các bài kiểm tra theo dõi rõ ràng sự suy giảm trạng thái và khen thưởng các hệ thống nhắc nhở chủ động sẽ đưa ra một bức tranh rõ ràng hơn về độ tin cậy dài hạn của một tác nhân. Các nhà nghiên cứu cũng phải chứng minh rằng bộ nhớ chủ động có khả năng mở rộng hiệu quả, cả về kích thước mô hình lẫn chi phí vận hành.

Điểm mấu chốt: Một mô-đun bộ nhớ nhỏ, được huấn luyện riêng biệt, có thể đóng vai trò như một "chó canh gác" cho các tác nhân mô hình ngôn ngữ lớn, giúp phát hiện và sửa lỗi chệch hướng trước khi nó làm hỏng một nhiệm vụ.