Ograniczenia geometryczne w czasie testowym poprawiają modele wizyjne

Self-Geometry, dodatek działający w czasie testowym, podnosi wyniki głębi i pozy podstawowych modeli wizyjnych o nawet 37,3% dla głębi i 9,2% dla pozy w benchmarku ETH3D.

Podstawowe modele wizyjne, takie jak VGGT, przewidują głębię sceny i pozycję kamery w ramach pojedynczego przejścia w przód (forward pass). Wygoda ta ma jednak swoją cenę: modele te traktują każdy widok niezależnie i ignorują ograniczenia epipolarne, które wiążą wiele obrazów tej samej sceny. Istniejące triki typu „self-consistency” próbują wykrywać sprzeczności we własnych wynikach modelu, ale gdy początkowa predykcja jest bardzo błędna, proces korekty zawodzi.

Self-Geometry unika tej wady. Najpierw wyodrębnia 2D-owe odpowiedniości punktów między nakładającymi się obrazami i traktuje te dopasowania jako pseudo-ground truth. Podczas wnioskowania uruchamia lekki optymalizator, który dostosowuje wyniki głębi i pozy modelu tak, aby spełniały dwa składniki funkcji straty:

  1. Spójność wielowidokowa – ten sam punkt 3D musi być poprawnie rzutowany na każdy widok.
  2. Spójność epipolarna – klasyczna zasada linii wzroku w geometrii stereo. Żadne gradienty nie przepływają z powrotem do sieci bazowej (backbone), więc oryginalne wagi pozostają nienaruszone.

W benchmarku ETH3D metoda ta podnosi dokładność pozy modelu VGGT o 9,2% oraz dokładność głębi o 37,3%. Inne modele odnotowują wzrosty o 5,0% i 25,1%. Poprawa utrzymuje się w przypadku sześciu architektur i czterech publicznych zbiorów danych, co pokazuje, że podejście to nie jest ograniczone do jednej architektury sieci.

Kompromisy

Technika ta opiera się na niezawodnych dopasowaniach 2D. Powierzchnie bezteksturowe, powtarzalne wzory lub poruszające się obiekty mogą zaburzyć zestaw odpowiedniości i osłabić proces korekty. Czas wykonania stanowi kolejną przeszkodę: implementacja oparta na LoRA (low-rank adaptation) kończy się w czasie krótszym niż dwie minuty na scenę