Các nhà nghiên cứu đã giới thiệu ReBA routing, một cơ chế định tuyến token dựa trên hình học giúp giữ cân bằng giữa các token thị giác và văn bản trong các mô hình hỗn hợp chuyên gia (MoE) đa phương thức. Các thử nghiệm ban đầu cho thấy phương pháp này giúp ổn định quá trình huấn luyện khi độ phân giải hình ảnh được tăng lên, một kịch bản mà các bộ định tuyến truyền thống thường gặp khó khăn.

Tại sao các mô hình thị giác-ngôn ngữ cần một bộ định tuyến mới

Các mô hình thị giác-ngôn ngữ tiếp nhận hai luồng dữ liệu rất khác nhau: hàng trăm mảng hình ảnh (image patches) và một số ít token từ ngữ. Các bộ định tuyến MoE tiêu chuẩn xử lý mọi token như thể chúng là cùng một loại dữ liệu, dẫn đến việc các mảng hình ảnh tràn ngập một vài chuyên gia trong khi các token văn bản lại ở trạng thái nhàn rỗi. Các nghiên cứu hiện tại cố gắng khắc phục tình trạng quá tải này bằng một hàm mất mát phụ (auxiliary loss) vốn chỉ cân bằng tổng số lượng token được phân bổ cho mỗi chuyên gia. Vì khối lượng hình ảnh khổng lồ có thể triệt tiêu khối lượng văn bản nhỏ bé, hàm mất mát này che lấp sự mất cân bằng thực sự cho đến khi hiệu suất bị suy giảm.

ReBA thay đổi cuộc chơi định tuyến như thế nào

ReBA thêm một ranh giới phương thức (modality boundary) vào quá trình định tuyến. Thay vì một nhóm duy nhất trộn lẫn các mảng và từ ngữ, nó xây dựng các lộ trình riêng biệt tôn trọng bố cục hình học của các token hình ảnh. Mỗi thực thể hình ảnh nhận được trọng số tổng thể như nhau, ngăn chặn bất kỳ chuyên gia đơn lẻ nào trở thành nút thắt cổ chai. Được dẫn dắt bởi sự sắp xếp không gian của các mảng, hệ thống vẫn duy trì sự ổn định ngay cả khi độ phân giải đầu vào thay đổi.

Các ưu điểm chính được các tác giả báo cáo:

  • Thiết lập sự phân tách rõ ràng giữa các token thị giác và ngôn ngữ.
  • Đảm bảo sự đóng góp bình đẳng từ mỗi hình ảnh trong một lô (batch).
  • Ngăn chặn các chuyên gia bị quá tải bởi một phương thức duy nhất.
  • Duy trì sự cân bằng khi số lượng mảng hình ảnh tăng lên.

Qua nhiều thiết lập benchmark, ReBA giữ cho nhóm chuyên gia được sử dụng đồng đều bất kể có bao nhiêu mảng được thêm vào một lô, vượt trội hơn so với phương pháp sử dụng hàm mất mát phụ truyền thống.

Hạn chế và các câu hỏi mở

Nghiên cứu không cung cấp các con số về tốc độ hoặc mức tiêu thụ bộ nhớ, vì vậy chúng ta không biết liệu logic định tuyến bổ sung có làm phát sinh chi phí ẩn hay không. Các tác giả cũng giả định rằng tất cả các mảng từ một hình ảnh duy nhất hoạt động như một đơn vị duy nhất; giả định đó có thể không còn đúng trong các lô kết hợp các hình ảnh có độ phân giải khác nhau hoặc chứa các vùng bị che khuất một phần.

Những điều cần theo dõi tiếp theo

  • Sự đánh đổi giữa hiệu suất và hiệu quả: các nghiên cứu trong tương lai sẽ cần định lượng bất kỳ chi phí vận hành (overhead) nào mà ReBA tạo ra.
  • Hành vi của lô hỗn hợp (mixed-batch): việc thử nghiệm trên các lô kết hợp hình ảnh độ phân giải cao và thấp sẽ cho thấy liệu ranh giới phương thức có duy trì được hay không.
  • Việc áp dụng trong các quy trình quy mô lớn: nếu sự ổn định định tuyến giúp cải thiện các tác vụ hạ nguồn (downstream tasks) — chẳng hạn như chú thích hình ảnh (image captioning) hoặc trả lời câu hỏi dựa trên hình ảnh (visual question answering) — các nhà phát triển có thể thay thế hàm mất mát phụ tiêu chuẩn bằng ReBA.

Nếu bạn đang xây dựng một quy trình MoE thị giác-ngôn ngữ, việc thay thế bộ định tuyến mặc định bằng ReBA có thể mang lại mô hình sử dụng chuyên gia đồng đều hơn khi bạn đẩy độ phân giải hình ảnh lên cao hơn. Hãy chú ý đến các chỉ số phân phối token sau khi thay đổi; một sự phân phối phẳng hơn là dấu hiệu cho thấy ranh giới phương thức đang hoạt động hiệu quả.