Phương pháp mới “Answer-Backtracked Credit Assignment” (ABC) của ABSeeker cho phép các tác nhân tìm kiếm dài hạn nhận được sự ghi nhận cho từng bước riêng lẻ thay vì chỉ dựa vào câu trả lời cuối cùng, và một mô hình 4 tỷ tham số được huấn luyện với phương pháp này đã có thể sánh ngang hoặc vượt qua các đối thủ lớn hơn nhiều.

Bước đột phá này có ý nghĩa quan trọng vì hầu hết các tác nhân hiện nay chỉ được đánh giá vào cuối nhiệm vụ. Nếu câu trả lời cuối cùng chính xác, toàn bộ quá trình được coi là tốt; nếu sai, toàn bộ chuỗi hành động bị coi là tệ. Kiểu phản hồi "được ăn cả, ngã về không" này che lấp tín hiệu học tập thực sự—những bước đi đúng nhưng vô tình theo sau bởi một sai lầm, hoặc những cú nhấp chuột vô ích nhưng may mắn dẫn đến kết quả đúng. Cách tiếp cận của ABSeeker đã viết lại quy tắc đó.

Tại sao cách tiếp cận cũ lại bộc lộ hạn chế

Khi một tác nhân tìm kiếm, viết mã hoặc thu thập bằng chứng, nó thường thực hiện nhiều hành động: đưa ra truy vấn, mở các trang, chạy lệnh, kiểm tra trạng thái hệ thống, v.v. Trong một chuỗi 15 bước, chỉ một bước đi sai lầm cũng có thể làm hỏng câu trả lời cuối cùng, ngay cả khi các bước trước đó đều chuẩn xác. Ngược lại, một chuỗi hành động kết thúc với câu trả lời đúng có thể chỉ dựa vào sự may mắn ngẫu nhiên, trong khi hầu hết các bước không mang lại giá trị gì. Việc chỉ huấn luyện dựa trên kết quả cuối cùng buộc mô hình phải coi toàn bộ quỹ đạo như một "hộp đen" duy nhất, khiến nó khó học được những hành vi phụ nào thực sự hữu ích.

Tình huống này tương tự như việc gỡ lỗi (debugging) trong kỹ thuật phần mềm. Các nhà phát triển theo dõi từng dòng mã, cô lập lời gọi hàm bị lỗi và sửa nó. Tuy nhiên, các tác nhân lại không được cung cấp một "hóa đơn" (receipt) tương đương cho các công việc nội bộ của chúng. Nếu không có dấu vết kiểm tra (audit trail) đó, các nhà phát triển không thể biết liệu một sự cải thiện là do khả năng lập luận tốt hơn hay chỉ là do ngẫu nhiên, và họ không thể sửa chữa các thói quen xấu một cách có hệ thống.

Cách ABC tái cấu trúc việc phân bổ công trạng

Answer-Backtracked Credit Assignment hoạt động ngược từ câu trả lời cuối cùng chính xác. Đầu tiên, nó trích xuất các manh mối thiết yếu mà câu trả lời phụ thuộc vào—như các bằng chứng cụ thể, kết quả trung gian hoặc các bước kiểm tra trạng thái. Sau đó, nó đi ngược lại qua dấu vết (trace) đã được ghi lại, chấm điểm từng hành động dựa trên các manh mối đó. Một hành động đóng góp trực tiếp vào một manh mối cần thiết sẽ nhận được điểm cộng; một hành động không liên quan hoặc gây hại sẽ nhận điểm âm hoặc bằng không.

Hai chế độ huấn luyện được xây dựng dựa trên cách chấm điểm này:

  • ABC-SFT (Supervised Fine-Tuning) điều chỉnh lại trọng số của hàm mất mát (loss function) sao cho các bước có điểm cộng cao hơn sẽ ảnh hưởng đến mô hình mạnh mẽ hơn. Mô hình học cách ưu tiên các hành động mà trong lịch sử đã dẫn đến các manh mối hữu ích.
  • ABC-GRPO (Gradient-based Reward Policy Optimization) coi điểm số của từng bước là tín hiệu phần thưởng cho học tăng cường (reinforcement learning), giúp củng cố các phần cụ thể của quá trình tìm kiếm đã giúp câu trả lời xuất hiện.

Bằng cách chuyển đổi nhãn đạt/không đạt (pass/fail) nhị phân thành một bản đồ đóng góp chi tiết, ABC cung cấp cho mô hình một tín hiệu học tập phong phú hơn nhiều.

Những kết quả ban đầu đầy ấn tượng

Các nhà nghiên cứu đã áp dụng ABC vào một mô hình khiêm tốn với 4 tỷ tham số, được trang bị một lớp quản lý ngữ cảnh để theo dõi trạng thái tìm kiếm đang diễn tiến. Trong các nhiệm vụ chuẩn (benchmark) vốn thường ưu thế cho các tác nhân lớn hơn nhiều, mô hình được huấn luyện bằng ABC đã ngang hàng hoặc vượt trội hơn các hệ thống lớn hơn đó. Sự gia tăng hiệu suất này đạt được mà không cần tăng kích thước mô hình, cho thấy rằng việc phân bổ công trạng tốt hơn có thể thay thế cho số lượng tham số thô.

Bài học chính rất đơn giản: hãy cung cấp cho mô hình một "hóa đơn" rõ ràng về những gì đã hiệu quả, và nó có thể khai thác nhiều giá trị hơn từ cùng một lượng dữ liệu huấn luyện.

Điều này có ý nghĩa gì đối với các tác nhân trong thế giới thực

Bất kỳ tác nhân nào thực hiện công việc đa bước—như trợ lý lập trình, bot đánh giá tài liệu, công cụ hỗ trợ khách hàng—đều dựa vào dấu vết các hành động của chúng. ABC cho thấy việc lưu giữ và đánh giá dấu vết đó không phải là một tính năng bổ sung "có thì tốt"; mà nó là yếu tố thiết yếu để học tập hiệu quả.

  • Các tác nhân lập trình cần ghi lại kế hoạch, từng lệnh được đưa ra và kết quả kiểm tra để xác thực mã nguồn.
  • Các tác nhân nghiên cứu phải lưu giữ các truy vấn đã gửi, các nguồn tài liệu đã mở và các bằng chứng đã trích xuất.
  • Các tác nhân hỗ trợ nên ghi lại mọi bước kiểm tra trạng thái và điểm quyết định dẫn đến việc giải quyết vấn đề.

Khi có sẵn các dấu vết này, ABC có thể phân bổ công trạng một cách chính xác, cho phép mô hình củng cố các thói quen tốt và loại bỏ những lối tắt may mắn mà nếu không sẽ bị nhầm lẫn là kỹ năng.

Các quan điểm phản biện và rào cản thực tế

Những lợi ích của ABC đi kèm với sự phức tạp gia tăng.

Kết luận

Answer-Backtracked Credit Assignment thay đổi hoàn toàn cách thức chúng ta dạy các tác nhân tìm kiếm, lập trình và suy luận. Bằng cách khen thưởng những bước đi đúng đắn trong suốt quá trình thay vì chỉ tập trung vào đích đến cuối cùng, nó cho phép một mô hình có kích thước vừa phải học hiệu quả tương đương với các mô hình lớn hơn nhiều. Đối với bất kỳ ai đang xây dựng các tác nhân phải thực hiện các công việc đa bước, việc áp dụng chế độ huấn luyện lấy dấu vết làm trung tâm không còn là một lựa chọn—đó là con đường dẫn đến một AI đáng tin cậy, có thể kiểm chứng và cuối cùng là thông minh hơn.