Các ràng buộc hình học tại thời điểm kiểm thử giúp cải thiện các mô hình thị giác

Self-Geometry, một tiện ích bổ sung tại thời điểm kiểm thử, giúp nâng cao điểm số về độ sâu và tư thế (pose) của các mô hình nền tảng thị giác lên tới 37,3% đối với độ sâu và 9,2% đối với tư thế trên bộ tiêu chuẩn ETH3D.

Các mô hình nền tảng thị giác như VGGT dự đoán độ sâu của cảnh và tư thế camera chỉ trong một lượt truyền xuôi (forward pass) duy nhất. Sự tiện lợi này đi kèm với một cái giá phải trả: chúng xử lý từng góc nhìn một cách độc lập và bỏ qua các ràng buộc epipolar vốn liên kết nhiều hình ảnh của cùng một cảnh. Các thủ thuật "tự nhất quán" (self-consistency) hiện nay cố gắng phát hiện các mâu thuẫn trong chính đầu ra của mô hình, nhưng khi dự đoán ban đầu quá sai lệch, việc hiệu chỉnh sẽ thất bại.

Self-Geometry tránh được nhược điểm đó. Đầu tiên, nó trích xuất các điểm tương ứng 2D giữa các hình ảnh chồng lấp và coi các điểm khớp đó là ground truth giả (pseudo ground truth). Trong quá trình suy luận, nó chạy một bộ tối ưu hóa nhẹ nhằm điều chỉnh đầu ra độ sâu và tư thế của mô hình để thỏa mãn hai thành phần mất mát (loss terms):

  1. Tính nhất quán đa góc nhìn – cùng một điểm 3D phải được chiếu chính xác vào mọi góc nhìn.
  2. Tính nhất quán epipolar – quy tắc đường nhìn kinh điển của hình học stereo. Không có gradient nào truyền ngược về backbone, vì vậy các trọng số ban đầu vẫn được giữ nguyên.

Trên bộ tiêu chuẩn ETH3D, phương pháp này nâng cao độ chính xác về tư thế của VGGT thêm 9,2% và độ chính xác về độ sâu thêm 37,3%. Các mô hình khác cũng đạt được mức tăng lần lượt là 5,0% và 25,1%. Sự cải thiện này duy trì trên sáu kiến trúc và bốn bộ dữ liệu công khai, cho thấy phương pháp này không bị ràng buộc vào một thiết kế mạng duy nhất.

Sự đánh đổi

Kỹ thuật này dựa vào các điểm khớp 2D đáng tin cậy. Các bề mặt không có kết cấu (texture-less), các hoa văn lặp lại hoặc các vật thể chuyển động có thể làm sai lệch tập hợp các điểm tương ứng và làm yếu đi khả năng hiệu chỉnh. Thời gian chạy là một trở ngại khác: một triển khai dựa trên LoRA (low-rank adaptation) hoàn thành trong chưa đầy hai phút cho mỗi cảnh trên GPU RTX PRO 6000—còn rất xa mới đáp ứng được yêu cầu về tốc độ khung hình của SLAM hoặc AR trực tiếp.

Hướng tới tương lai

Nếu cộng đồng áp dụng việc thích nghi hình học như một bước hậu xử lý tiêu chuẩn, nhiều mô hình hiện có có thể đạt được hiệu suất tức thì mà không cần tái huấn luyện tốn kém. Các bộ tiêu chuẩn đánh giá cũng sẽ cần bao gồm một mức cơ sở (baseline) Self-Geometry để phản ánh việc triển khai thực tế, nơi mà việc tinh chỉnh tại thời điểm kiểm thử là khả thi.

Điểm mấu chốt: Một bước kiểm tra tính hợp lý về hình học khi kiểm thử tuy khiêm tốn nhưng có thể trích xuất độ chính xác cao hơn đáng kể từ các mô hình thị giác có sẵn, tuy nhiên sự phụ thuộc vào các điểm khớp chính xác và tốc độ không phải thời gian thực sẽ hạn chế việc áp dụng ngay lập tức vào các hệ thống yêu cầu độ trễ thấp.