Hộp Điều hướng Mô hình AI Pandora

Bài báo mới của DeepMind đề xuất một khung làm việc (framework) mang tên “Pandora’s Box”, giúp cắt giảm chi phí điều hướng (routing overhead) lên đến 70% trong khi vẫn giữ nguyên hiệu suất thực hiện tác vụ.

Tại sao chi phí điều hướng lại quan trọng

Khi một dịch vụ nhận được một yêu cầu, nó thường có một danh sách các mô hình—một số nhanh nhưng độ chính xác thấp, số khác chậm nhưng tinh vi. Việc chọn ra mô hình tốt nhất sẽ tiêu tốn tài nguyên tính toán và tiền bạc. Bạn phải chạy một thử nghiệm nhanh, truy xuất dữ liệu bên ngoài hoặc gọi một công cụ hỗ trợ trước khi biết mô hình nào là phù hợp nhất.

Phép ẩn dụ về Hộp Pandora

DeepMind ánh xạ bài toán điều hướng vào câu đố kinh điển về Hộp Pandora: mỗi mô hình là một chiếc hộp kín đang che giấu hiệu suất của nó đối với truy vấn hiện tại. Việc mở một chiếc hộp sẽ tiêu tốn tài nguyên, vì vậy bạn phải quyết định xem lợi ích tiềm năng có xứng đáng với chi phí bỏ ra hay không. Khung làm việc này chính thức hóa sự đánh đổi này và cung cấp hai cơ chế cụ thể.

Pandora’s Router – bộ ra quyết định tập trung

Bộ điều hướng (router) trước tiên sẽ chạy một bộ ước tính rẻ tiền và có độ nhiễu cao để đánh giá tiềm năng của một mô hình. Chỉ khi mức cải thiện kỳ vọng so với mô hình tốt nhất hiện tại vượt quá một "giá đặt trước" (reservation price) đã thiết lập sẵn, nó mới chi trả cho một đánh giá chính xác hơn. Bằng cách từ chối kiểm tra mọi mô hình, bộ điều hướng giúp cắt giảm đáng kể ngân sách kiểm tra trong khi vẫn tìm ra được phương án có hiệu suất cao nhất.

Pandora’s Bidder – thị trường phi tập trung

Trong biến thể bidder (người đấu thầu), mỗi nhà cung cấp mô hình sẽ quyết định xem có nên chi tiền cho việc tự đánh giá để có cơ hội giành được hợp đồng hay không. Các nhà cung cấp chỉ gửi thầu khi họ kỳ vọng rằng chi phí đánh giá sẽ thấp hơn cơ hội giành chiến thắng. Điều này tạo ra một thị trường nơi các hoạt động đánh giá tốn kém chỉ diễn ra khi lợi nhuận mang lại đủ cao.

Kết quả trên ba lĩnh vực

Các tác giả đã thử nghiệm cả hai cơ chế trên:

  • Suy luận toán học – lựa chọn mô hình giải quyết vấn đề chính xác nhất.
  • Tạo phản hồi tăng cường truy xuất (RAG) – lựa chọn hệ thống truy xuất cung cấp ngữ cảnh phù hợp nhất trước khi mô hình ngôn ngữ tạo ra câu trả lời.
  • Lựa chọn embedding quy mô lớn – chọn bộ mã hóa (encoder) tạo ra biểu diễn vector tốt nhất cho việc tìm kiếm tương đồng.

Trong mọi trường hợp, Pandora’s Router đều ghi nhận chỉ số kết hợp chi phí và sai số (cost-plus-error) thấp nhất, vượt qua các phương pháp cơ sở (baselines) vốn luôn kiểm tra mọi mô hình hoặc không bao giờ kiểm tra. Hệ thống tự động thích ứng: khi chi phí kiểm tra tăng lên, nó sẽ kiểm tra ít mô hình hơn; khi chi phí giảm, nó sẽ tăng cường xem xét. Mức tiết kiệm được báo cáo dao động từ 30% đến 70% chi phí điều hướng mà không làm giảm chất lượng của các tác vụ hạ nguồn (downstream tasks) một cách đáng kể.

Bài học rút ra: Khi ngân sách suy luận (inference budgets) ngày càng tăng vọt, việc quyết định khi nào nên ngừng tìm kiếm một mô hình tốt hơn cũng trở nên quan trọng như chính việc lựa chọn mô hình đó. Pandora’s Box biến một khoản chi phí ẩn thành một đòn bẩy có thể kiểm soát được.

Nguồn: https://dev.to/andrea_schiona/pandoras-ai-model-routing-box-efficient-allocation-with-costly-value-estimation-3c4c