Las restricciones geométricas en tiempo de inferencia mejoran los modelos de visión
Self-Geometry, un complemento para el tiempo de inferencia, mejora las puntuaciones de profundidad y pose de los modelos fundacionales de visión hasta un 37,3 % en profundidad y un 9,2 % en pose en el benchmark ETH3D.
Los modelos fundacionales de visión, como VGGT, predicen la profundidad de la escena y la pose de la cámara en una sola pasada hacia adelante (forward pass). Esta conveniencia tiene un costo: tratan cada vista de forma independiente e ignoran las restricciones epipolares que vinculan múltiples imágenes de la misma escena. Los trucos de «autoconsistencia» existentes intentan detectar contradicciones en los propios resultados de un modelo, pero cuando la predicción inicial es muy errónea, la corrección colapsa.
Self-Geometry evita ese fallo. Primero extrae correspondencias de puntos en 2D entre imágenes superpuestas y trata esas coincidencias como una pseudo verdad de referencia (pseudo ground truth). Durante la inferencia, ejecuta un optimizador ligero que ajusta los resultados de profundidad y pose del modelo para satisfacer dos términos de pérdida:
- Consistencia multivista: el mismo punto en 3D debe proyectarse correctamente en cada vista.
- Consistencia epipolar: la clásica regla de línea de visión de la geometría estéreo. No fluyen gradientes hacia el backbone, por lo que los pesos originales permanecen intactos.
En el benchmark ETH3D, el método aumenta la precisión de la pose de VGGT en un 9,2 % y su precisión de profundidad en un 37,3 %. Otros modelos experimentan mejoras del 5,0 % y el 25,1 %. La mejora se mantiene en seis arquitecturas y cuatro conjuntos de datos públicos, lo que demuestra que el enfoque no está ligado a un único diseño de red.
Compensaciones
La técnica depende de coincidencias en 2D fiables. Las superficies sin textura, los patrones repetitivos o los objetos en movimiento pueden corromper el conjunto de correspondencias y debilitar la corrección. El tiempo de ejecución es otro obstáculo: una implementación basada en LoRA (low-rank adaptation) termina en menos de dos minutos por escena en una GPU RTX PRO 6000, lo cual está lejos de las necesidades de tasa de fotogramas de SLAM o AR en tiempo real.
Perspectivas futuras
Si la comunidad adopta la adaptación geométrica como un paso estándar de postprocesamiento, muchos modelos existentes podrían ganar rendimiento inmediato sin un costoso reentrenamiento. Las suites de benchmarks también tendrían que incluir una línea base de Self-Geometry para reflejar un despliegue realista donde el refinamiento en tiempo de inferencia sea factible.
Idea clave: Una modesta comprobación de coherencia geométrica en tiempo de inferencia puede extraer una precisión significativamente mayor de los modelos de visión estándar, pero su dependencia de coincidencias limpias y velocidades que no son en tiempo real limita su adopción inmediata en sistemas críticos de latencia.
