محدودیت‌های هندسی در زمان تست، مدل‌های بینایی را بهبود می‌بخشند

Self-Geometry، که یک افزونه در زمان تست است، امتیازات عمق و ژست (pose) مدل‌های پایه بینایی را در بنچمارک ETH3D تا ۳۷.۳٪ برای عمق و ۹.۲٪ برای ژست افزایش می‌دهد.

مدل‌های پایه بینایی مانند VGGT، عمق صحنه و ژست دوربین را در یک گذر مستقیم (forward pass) واحد پیش‌بینی می‌کنند. این سهولت هزینه‌ای دارد: آن‌ها با هر نما به‌صورت مستقل برخورد کرده و محدودیت‌های اپی‌پولار (epipolar) را که تصاویر متعدد از یک صحنه را به هم پیوند می‌دهند، نادیده می‌گیرند. ترفندهای موجود برای «خودسازگاری» (self-consistency) سعی در شناسایی تناقض‌ها در خروجی‌های خودِ مدل دارند، اما زمانی که پیش‌بینی اولیه بسیار دور از واقعیت باشد، فرآیند اصلاح شکست می‌خورد.

Self-Geometry از این نقص جلوگیری می‌کند. این روش ابتدا تناظر نقاط دوبعدی را بین تصاویر هم‌پوشان استخراج کرده و با آن تطبیق‌ها به‌عنوان واقعیت زمینی کاذب (pseudo ground truth) برخورد می‌کند. در طول استنتاج، یک بهینه‌ساز سبک‌وزن اجرا می‌شود که خروجی‌های عمق و ژست مدل را برای برآورده کردن دو جمله زیان (loss terms) تنظیم می‌کند: ۱. سازگاری چند-نما (Multi-view consistency) – یک نقطه سه‌بعدی یکسان باید به‌درستی در هر نما تصویر شود. ۲. سازگاری اپی‌پولار (Epipolar consistency) – قاعده کلاسیک خط دید در هندسه استریو. هیچ گرادیانی به شبکه اصلی (backbone) باز نمی‌گردد، بنابراین وزن‌های اصلی دست‌نخورده باقی می‌مانند.

در بنچمارک ETH3D، این روش دقت ژست VGGT را ۹.۲٪ و دقت عمق آن را ۳۷.۳٪ افزایش می‌دهد. مدل‌های دیگر نیز بهبودهایی معادل ۵.۰٪ و ۲۵.۱٪ را تجربه می‌کنند. این بهبود در شش معماری و چهار مجموعه داده عمومی نیز برقرار است، که نشان می‌دهد این رویکرد به طراحی شبکه واحدی وابسته نیست.

موازنه (Trade-offs)

این تکنیک بر تطبیق‌های دوبعدی قابل اعتماد متکی است. سطوح بدون بافت، الگوهای تکراری یا اشیاء متحرک می‌توانند مجموعه تناظر را خراب کرده و فرآیند اصلاح را تضعیف کنند. زمان اجرا مانع دیگری است: یک پیاده‌سازی مبتنی بر LoRA (تطبیق کم‌رتبه) در هر صحنه در کمتر از دو دقیقه روی یک پردازنده گرافیکی RTX PRO 6000 به پایان می‌رسد که با نیازهای نرخ فریم برای SLAM یا AR زنده فاصله زیادی دارد.

نگاه به آینده

اگر جامعه علمی انطباق هندسی را به‌عنوان یک مرحله استاندارد پس‌پردازش بپذیرد، بسیاری از مدل‌های موجود می‌توانند بدون نیاز به بازآموزی پرهزینه، بلافاصله بهبود عملکرد کسب کنند. همچنین مجموعه‌های بنچمارک باید شامل یک خط پایه (baseline) برای Self-Geometry باشند تا استقرار واقع‌بینانه را، جایی که پالایش در زمان تست امکان‌پذیر است، منعکس کنند.

نکته کلیدی: یک بررسی صحت‌سنجی هندسیِ ساده در زمان تست می‌تواند دقت بسیار بیشتری از مدل‌های بینایی آماده (off-the-shelf) استخراج کند، اما وابستگی آن به تطبیق‌های دقیق و سرعت‌های غیر بلادرنگ، پذیرش فوری آن را در سیستم‌های حساس به تأخیر محدود می‌کند.