Geometrische Constraints zur Testzeit verbessern Vision-Modelle

Self-Geometry, ein Add-on zur Testzeit, steigert die Tiefen- und Pose-Scores von Vision-Foundation-Modellen auf dem ETH3D-Benchmark um bis zu 37,3 % für die Tiefe und 9,2 % für die Pose.

Vision-Foundation-Modelle wie VGGT sagen die Szenentiefe und die Kamerapose in einem einzigen Forward Pass voraus. Dieser Komfort hat jedoch seinen Preis: Sie behandeln jede Ansicht unabhängig voneinander und ignorieren die epipolaren Constraints, die mehrere Bilder derselben Szene miteinander verbinden. Bestehende „Self-Consistency“-Tricks versuchen, Widersprüche in den eigenen Ausgaben eines Modells zu finden, aber wenn die ursprüngliche Vorhersage zu weit daneben liegt, bricht die Korrektur zusammen.

Self-Geometry umgeht diesen Fehler. Zuerst extrahiert es 2D-Punktkorrespondenzen zwischen überlappenden Bildern und behandelt diese Übereinstimmungen als Pseudo-Ground-Truth. Während der Inferenz wird ein leichtgewichtiger Optimizer ausgeführt, der die Tiefen- und Pose-Ausgaben des Modells anpasst, um zwei Loss-Terme zu erfüllen:

  1. Multi-View-Konsistenz – derselbe 3D-Punkt muss korrekt in jede Ansicht projiziert werden.
  2. Epipolare Konsistenz – die klassische Sichtlinienregel der Stereo-Geometrie. Es fließen keine Gradienten zurück in das Backbone, sodass die ursprünglichen Gewichte unberührt bleiben.

Auf dem ETH3D-Benchmark erhöht die Methode die Pose-Genauigkeit von VGGT um 9,2 % und die Tiefengenauigkeit um 37,3 %. Andere Modelle verzeichnen Gewinne von 5,0 % und 25,1 %. Die Verbesserung zeigt sich über sechs Architekturen und vier öffentliche Datensätze hinweg, was belegt, dass der Ansatz nicht an ein einzelnes Netzwerkdesign gebunden ist.

Trade-offs

Die Technik beruht auf zuverlässigen 2D-Matches. Texturlose Oberflächen, repetitive Muster oder bewegte Objekte können den Korrespondenzsatz korrumpieren und die Korrektur schwächen. Die Laufzeit ist eine weitere Hürde: Eine LoRA-basierte (low-rank adaptation) Implementierung benötigt auf einer RTX PRO 6000 GPU weniger als zwei Minuten pro Szene – weit entfernt von den Anforderungen an die Bildrate für Live-SLAM oder AR.

Ausblick

Wenn die Community die geometrische Anpassung als Standard-Postprocessing-Schritt übernimmt, könnten viele bestehende Modelle sofortige Leistungssteigerungen erfahren, ohne dass ein kostspieliges Retraining erforderlich ist. Benchmark-Suites müssten zudem eine Self-Geometry-Baseline enthalten, um realistische Einsatzszenarien widerzuspiegeln, in denen eine Verfeinerung zur Testzeit machbar ist.

Fazit: Ein bescheidener geometrischer Sanity-Check zur Testzeit kann deutlich mehr Genauigkeit aus Standard-Vision-Modellen herausholen, aber die Abhängigkeit von sauberen Matches und die fehlende Echtzeitfähigkeit schränken die sofortige Anwendung in latenzkritischen Systemen ein.