Năm tác nhân Gemini 3.5 Flash làm việc cùng nhau trong thời gian thực đã giải được 87% bộ câu hỏi Project Euler gồm 30 câu, vượt qua năm tác nhân chạy độc lập (72%) và cả hai phương pháp cơ sở dựa trên biểu quyết đa số (80% độc lập, 90% cộng tác). Quá trình cộng tác cũng giúp giảm bốn phút thời gian thực thi trung bình, từ 14 phút mỗi bài xuống còn 10 phút, với hầu hết các giải pháp được đưa ra trong chưa đầy năm phút.

Tại sao thí nghiệm này lại quan trọng

Các trợ lý lập trình AI đã có thể soạn thảo các đoạn mã, gỡ lỗi và tạo ra toàn bộ chương trình. Các nhà nghiên cứu thường kiểm tra một mô hình duy nhất trên một câu lệnh (prompt) và chấm điểm câu trả lời của nó. Thí nghiệm này đặt ra một câu hỏi khác: liệu một nhóm các tác nhân chia sẻ kết quả tìm được trong quá trình làm việc có thể vượt qua phương pháp “trí tuệ đám đông” (wisdom of the crowd) vốn chỉ đơn thuần là tổng hợp các câu trả lời độc lập hay không?

Các bài toán Project Euler đóng vai trò là một tiêu chuẩn đánh giá (benchmark) cho tư duy thuật toán. Chúng kết hợp giữa sự hiểu biết về toán học và kỹ năng lập trình hiệu quả, khiến chúng trở thành một đại diện tốt cho các tác vụ lập trình thực tế, nơi tính chính xác và tốc độ là yếu tố quan trọng.

Cách thiết lập thử nghiệm

  • Tác nhân: Năm phiên bản Gemini 3.5 Flash được truy cập thông qua nền tảng Antigravity.
  • Các kịch bản:
    1. Mỗi tác nhân tự giải quyết từng bài toán một cách độc lập và báo cáo câu trả lời của riêng mình.
    2. Năm tác nhân đó cùng cộng tác trong thời gian thực, truyền phát các kết quả trung gian và xác nhận các bước thực hiện của nhau.
    3. Đối với cả hai thiết lập, một bộ tổng hợp biểu quyết đa số đơn giản sẽ kết hợp năm câu trả lời độc lập.
  • Chỉ số: Độ chính xác (tỷ lệ phần trăm câu trả lời đúng) và thời gian chạy (thời gian trung bình cho mỗi bài toán, cùng với sự phân bổ thời gian hoàn thành).

Những con số tiết lộ điều gì

  • Độ chính xác khi chạy độc lập: 72%
  • Độ chính xác khi cộng tác: 87%
  • Độ chính xác biểu quyết đa số khi chạy độc lập: 80%
  • Độ chính xác biểu quyết đa số khi cộng tác: 90%

Thời gian chạy giảm từ trung bình 14 phút đối với các tác nhân độc lập xuống còn 10 phút đối với nhóm cộng tác. Hầu hết các lượt chạy cộng tác đều hoàn thành trong dưới năm phút, trong khi các nỗ lực độc lập thường xuyên chạm ngưỡng giới hạn thời gian chờ (timeout) 30 phút.

Những quan sát chính giải thích sự chênh lệch

  • Không thể với một người, nhưng có thể với nhiều người – Đối với một bài toán duy nhất mà tất cả các tác nhân độc lập đều thất bại, nhưng nhóm cộng tác đã trao đổi các kết quả từng phần và cùng nhau đi đến câu trả lời đúng.
  • Phát hiện lỗi thông qua kiểm tra chéo – Các tác nhân riêng lẻ đôi khi rơi vào các bẫy logic; nhóm đã phát hiện ra những sai sót này bằng cách so sánh các ghi chú trong thời gian thực.
  • Hội tụ nhanh chóng – Khi bất kỳ tác nhân nào phát hiện ra một giá trị trung gian quan trọng, nó sẽ truyền phát phát hiện đó, cho phép những tác nhân khác bỏ qua các công việc dư thừa và hội tụ về giải pháp cuối cùng nhanh hơn.

Những chi phí và giới hạn tiềm ẩn

Thí nghiệm chỉ sử dụng năm tác nhân; vẫn chưa rõ liệu hiệu quả tương tự có thể mở rộng lên hàng chục hoặc hàng trăm tác nhân hay không. Hơn nữa, bộ tổng hợp biểu quyết đa số vẫn hoạt động tốt (90% khi có sự cộng tác).

Những điều cần theo dõi tiếp theo

  • Các thí nghiệm mở rộng quy mô – Liệu một trăm tác nhân có còn cải thiện độ chính xác, hay chi phí điều phối sẽ chiếm ưu thế?
  • Chuyên môn hóa vai trò – Việc phân công các nhiệm vụ cụ thể (ví dụ: một tác nhân tập trung vào lý thuyết số, một tác nhân khác tập trung vào tối ưu hóa) có thể khuếch đại lợi ích so với việc cộng tác tự do.
  • Các tiêu chuẩn đánh giá rộng hơn – Việc áp dụng cùng một khung làm việc vào các thử thách tạo mã, bộ công cụ gỡ lỗi hoặc xây dựng phần mềm thực tế sẽ kiểm tra xem liệu những lợi ích này có duy trì được ngoài các câu đố toán học hay không.

Bài học rút ra

Sự cộng tác trong thời gian thực giữa các tác nhân lập trình AI có thể nâng cao cả tỷ lệ thành công và tốc độ trong các tác vụ thuật toán, vượt qua các nỗ lực độc lập và thậm chí cả hình thức biểu quyết đám đông đơn giản. Phương pháp này đầy hứa hẹn, nhưng khả năng mở rộng và tính hiệu quả về chi phí vẫn là những câu hỏi mở mà các nghiên cứu trong tương lai cần trả lời.

Nguồn: https://dev.to/ykdap/for-coding-agents-real-time-collaboration-beats-the-wisdom-of-the-crowd-1kj0