테스트 시간 기하학적 제약 조건이 비전 모델을 개선합니다
테스트 시간(test-time) 애드온인 Self-Geometry는 ETH3D 벤치마크에서 비전 파운데이션 모델의 깊이(depth) 점수를 최대 37.3%, 포즈(pose) 점수를 최대 9.2%까지 향상시킵니다.
VGGT와 같은 비전 파운데이션 모델은 단 한 번의 순전파(forward pass)로 장면의 깊이와 카메라 포즈를 예측합니다. 이러한 편리함에는 대가가 따릅니다. 각 뷰(view)를 독립적으로 처리하며, 동일한 장면의 여러 이미지를 연결하는 에피폴라 제약 조건(epipolar constraints)을 무시하기 때문입니다. 기존의 "자기 일관성(self-consistency)" 기법들은 모델 자체 출력물에서 모순을 찾아내려 시도하지만, 초기 예측이 크게 벗어난 경우에는 보정 과정이 무너집니다.
Self-Geometry는 이러한 결함을 방지합니다. 먼저 중첩되는 이미지 사이의 2D 점 대응 관계(point correspondences)를 추출하고, 이러한 매칭을 의사 정답(pseudo ground truth)으로 취급합니다. 추론 과정에서는 가벼운 최적화 도구(optimizer)를 실행하여 다음 두 가지 손실 항(loss terms)을 만족하도록 모델의 깊이 및 포즈 출력을 조정합니다:
- 다중 뷰 일관성(Multi-view consistency) – 동일한 3D 점은 모든 뷰에 올바르게 투영되어야 합니다.
- 에피폴라 일관성(Epipolar consistency) – 스테레오 기하학의 고전적인 시선 규칙(line-of-sight rule)입니다. 백본(backbone)으로 그래디언트(gradient)가 흐르지 않으므로 기존 가중치는 그대로 유지됩니다.
ETH3D 벤치마크에서 이 방법은 VGGT의 포즈 정확도를 9.2%, 깊이 정확도를 37.3% 높였습니다. 다른 모델들도 각각 5.0%와 25.1%의 성능 향상을 보였습니다. 이러한 개선 효과는 6개의 아키텍처와 4개의 공개 데이터셋 전체에서 유지되었으며, 이는 이 접근 방식이 특정 네트워크 설계에 국한되지 않음을 보여줍니다.
트레이드오프
이 기술은 신뢰할 수 있는 2D 매칭에 의존합니다. 질감이 없는 표면, 반복적인 패턴 또는 움직이는 물체는 대응 관계 세트를 손상시키고 보정 효과를 약화시킬 수 있습니다. 실행 시간 또한 또 다른 장애물입니다. LoRA(low-rank adaptation) 기반 구현은 RTX PRO 6000 GPU에서 장면당 2분 미만이 소요되는데, 이는 실시간 SLAM이나 AR의 프레임 속도 요구 사항과는 거리가 멉니다.
향후 전망
커뮤니티가 기하학적 적응(geometric adaptation)을 표준 후처리 단계로 채택한다면, 많은 기존 모델이 비용이 많이 드는 재학습 없이도 즉각적인 성능 향상을 얻을 수 있습니다. 또한, 테스트 시간 정밀화(test-time refinement)가 가능한 실제 배포 환경을 반영하기 위해 벤치마크 세트에도 Self-Geometry 베이스라인이 포함되어야 할 것입니다.
핵심 요약: 적절한 수준의 테스트 시간 기하학적 무결성 검사(sanity check)를 통해 기성 비전 모델에서 훨씬 더 높은 정확도를 끌어낼 수 있지만, 깨끗한 매칭에 대한 의존도와 비실시간 속도로 인해 지연 시간에 민감한 시스템에서의 즉각적인 도입에는 한계가 있습니다.
