DeepMind biến 7.500 clip tổng hợp thành mô hình thị giác đa nhiệm 14 tỷ tham số
Được xây dựng trên kiến trúc Wan2.1 của Alibaba, mô hình này học về độ sâu, pháp tuyến, phân đoạn và tư thế 3D từ một tập dữ liệu nhỏ được kết xuất bằng Blender, đạt hiệu suất tương đương hoặc vượt trội hơn các hệ thống chuyên dụng dù chỉ cần một phần nhỏ dữ liệu huấn luyện.