Tencent đã ra mắt mô hình WeMM-Embedding trong tuần này, một hệ thống đa phương thức với 2 tỷ tham số đã được tích hợp vào các luồng tìm kiếm, đề xuất và thương mại điện tử của WeChat. Việc phát hành này có ý nghĩa quan trọng vì nó cho thấy một mô hình mang lại chất lượng truy xuất thực tế, độ trễ thấp và kích thước chỉ mục nhỏ.
Tại sao lại có sự quan tâm lớn dành cho một "câu chuyện triển khai thực tế"
Hầu hết các mô hình AI mới ra mắt đều đi kèm với các bảng điểm benchmark bóng bẩy so sánh điểm số trên các bộ dữ liệu được tuyển chọn. Những con số đó giúp các nhà nghiên cứu chứng minh quan điểm của họ, nhưng chúng hiếm khi chuyển đổi thành các chỉ số vận hành sản phẩm: tốc độ phản hồi truy vấn nhanh như thế nào, chỉ mục tiêu thụ bao nhiêu bộ nhớ, và mô hình xử lý tốt ra sao đối với các nội dung nhiễu do người dùng tạo ra. WeMM thay đổi cuộc chơi bằng cách trở thành một thành phần cấp độ sản xuất ngay từ ngày đầu tiên. Nó không phải là một thí nghiệm trong phòng lab đang chờ đợi một đội ngũ hạ nguồn áp dụng; nó đã và đang vận hành Channels, Moments và thương mại điện tử.
Các điểm kỹ thuật mà nhà phát triển nên lưu ý
Xử lý đa phương thức thực thụ – Mô hình tiếp nhận văn bản, hình ảnh, khung hình video và hình thu nhỏ của tài liệu vào một không gian embedding duy nhất. Người dùng có thể nhập "hoàng hôn" và truy xuất được một đoạn video tương ứng, một bức ảnh hoặc một bài báo mà không cần phải kết hợp các luồng xử lý văn bản riêng biệt và luồng xử lý thị giác riêng biệt.
Kích thước rất quan trọng, nhưng không theo cách bạn nghĩ – Với 2 tỷ tham số, mô hình này được coi là "nhỏ" so với các mô hình hơn 9 tỷ tham số đang thống trị các bảng xếp hạng. Tuy nhiên, nó đáp ứng được ngân sách độ trễ cần thiết cho các dịch vụ tương tác. Một mô hình phù hợp với phần cứng của bạn có thể hoạt động hiệu quả hơn một mô hình lớn hơn nhưng chậm hơn trong một hệ thống thực tế.
Embedding Matryoshka mang lại sự linh hoạt về số chiều – WeMM hỗ trợ embedding "Matryoshka", nghĩa là cùng một mạng lưới có thể xuất ra các vector với độ dài khác nhau, chẳng hạn như 256 hoặc 512 chiều. Các thử nghiệm cho thấy việc giảm từ 512 xuống 256 chiều vẫn giữ được gần như toàn bộ hiệu suất truy xuất trong khi cắt giảm một nửa mức sử dụng bộ nhớ, trực tiếp làm giảm chi phí lưu trữ và tăng tốc tìm kiếm láng giềng gần nhất (nearest-neighbor searches).
Ba quy tắc thực tế để xây dựng hệ thống truy xuất
Xác thực trên dữ liệu của chính bạn – Benchmark thì sạch; dữ liệu thực tế thì hỗn loạn. Nếu người dùng của bạn tải lên ảnh chụp màn hình, ghi chú viết tay hoặc video độ phân giải thấp, hãy chạy mô hình trên chính sự kết hợp đó trước khi quyết định nó có phù hợp hay không.
Coi độ dài vector là một đòn bẩy chi phí – Các vector lớn hơn sẽ làm tăng cả năng lượng tính toán cần thiết cho tìm kiếm sự tương đồng và không gian đĩa cho chỉ mục. Hãy bắt đầu với số chiều nhỏ nhất mà vẫn đáp ứng được mục tiêu chất lượng của bạn. Chỉ tăng quy mô khi bạn thấy sự sụt giảm rõ rệt về độ triệu hồi (recall) hoặc độ chính xác (precision).
Tránh các luồng xử lý bị cô lập – Việc xây dựng các bộ mã hóa (encoder) riêng biệt cho từng phương thức sẽ buộc bạn phải tự thiết kế các sơ đồ trọng số cho giai đoạn xếp hạng cuối cùng. Một lớp embedding vạn năng sẽ loại bỏ mã kết nối (glue code) đó, giảm chi phí kỹ thuật và giúp việc thử nghiệm A/B trở nên đơn giản hơn.
Những tác động rộng lớn hơn
Đối với các công ty dựa vào tìm kiếm hoặc đề xuất, việc lựa chọn mô hình embedding có thể quyết định chi phí hạ tầng. Ngân sách độ trễ ngày càng thắt chặt khi kỳ vọng của người dùng tăng lên; một mô hình làm tăng thêm dù chỉ vài mili giây cho mỗi truy vấn cũng có thể đẩy dịch vụ vượt quá ngưỡng hiệu suất chấp nhận được, dẫn đến việc người dùng rời bỏ.
Quyết định mã nguồn mở các trọng số (weights) của Tencent theo giấy phép Apache 2.0 cũng làm thay đổi đường cong chi phí cho các nhà phát triển. Thay vì phải thương lượng các hợp đồng độc quyền hoặc xây dựng một mô hình từ đầu, các đội ngũ có thể tải xuống checkpoint, tinh chỉnh (fine-tune) nó trên dữ liệu đặc thù của lĩnh vực và đánh giá nó dựa trên một vài trường hợp thất bại.
Những hạn chế của mô hình
Mô hình xử lý bốn phương thức—văn bản, hình ảnh, video và tài liệu—nhưng không bao quát mọi loại đầu vào có thể có.
Điều cần theo dõi tiếp theo
Bài học rút ra
WeMM chứng minh rằng một mô hình embedding đa phương thức có kích thước khiêm tốn có thể xử lý các truy vấn hàng ngày khi nó được xây dựng với các ràng buộc về sản xuất trong tâm trí. Đối với các nhà phát triển, thông điệp rất rõ ràng: hãy ưu tiên chất lượng truy xuất thực tế, giữ số chiều vector nhỏ nhất có thể và hợp nhất các phương thức vào một lớp embedding duy nhất. Những lựa chọn đó có thể giúp giảm độ trễ, thu hẹp chi phí lưu trữ và cuối cùng là mang lại trải nghiệm tốt hơn cho người dùng cuối.
