محدودیتهای هندسی در زمان تست، مدلهای بینایی را بهبود میبخشند
Self-Geometry، که یک افزونه در زمان تست است، امتیازات عمق و ژست (pose) مدلهای پایه بینایی را در بنچمارک ETH3D تا ۳۷.۳٪ برای عمق و ۹.۲٪ برای ژست افزایش میدهد.
مدلهای پایه بینایی مانند VGGT، عمق صحنه و ژست دوربین را در یک گذر مستقیم (forward pass) واحد پیشبینی میکنند. این سهولت هزینهای دارد: آنها با هر نما بهصورت مستقل برخورد کرده و محدودیتهای اپیپولار (epipolar) را که تصاویر متعدد از یک صحنه را به هم پیوند میدهند، نادیده میگیرند. ترفندهای موجود برای «خودسازگاری» (self-consistency) سعی در شناسایی تناقضها در خروجیهای خودِ مدل دارند، اما زمانی که پیشبینی اولیه بسیار دور از واقعیت باشد، فرآیند اصلاح شکست میخورد.
Self-Geometry از این نقص جلوگیری میکند. این روش ابتدا تناظر نقاط دوبعدی را بین تصاویر همپوشان استخراج کرده و با آن تطبیقها بهعنوان واقعیت زمینی کاذب (pseudo ground truth) برخورد میکند. در طول استنتاج، یک بهینهساز سبکوزن اجرا میشود که خروجیهای عمق و ژست مدل را برای برآورده کردن دو جمله زیان (loss terms) تنظیم میکند: ۱. سازگاری چند-نما (Multi-view consistency) – یک نقطه سهبعدی یکسان باید بهدرستی در هر نما تصویر شود. ۲. سازگاری اپیپولار (Epipolar consistency) – قاعده کلاسیک خط دید در هندسه استریو. هیچ گرادیانی به شبکه اصلی (backbone) باز نمیگردد، بنابراین وزنهای اصلی دستنخورده باقی میمانند.
در بنچمارک ETH3D، این روش دقت ژست VGGT را ۹.۲٪ و دقت عمق آن را ۳۷.۳٪ افزایش میدهد. مدلهای دیگر نیز بهبودهایی معادل ۵.۰٪ و ۲۵.۱٪ را تجربه میکنند. این بهبود در شش معماری و چهار مجموعه داده عمومی نیز برقرار است، که نشان میدهد این رویکرد به طراحی شبکه واحدی وابسته نیست.
موازنه (Trade-offs)
این تکنیک بر تطبیقهای دوبعدی قابل اعتماد متکی است. سطوح بدون بافت، الگوهای تکراری یا اشیاء متحرک میتوانند مجموعه تناظر را خراب کرده و فرآیند اصلاح را تضعیف کنند. زمان اجرا مانع دیگری است: یک پیادهسازی مبتنی بر LoRA (تطبیق کمرتبه) در هر صحنه در کمتر از دو دقیقه روی یک پردازنده گرافیکی RTX PRO 6000 به پایان میرسد که با نیازهای نرخ فریم برای SLAM یا AR زنده فاصله زیادی دارد.
نگاه به آینده
اگر جامعه علمی انطباق هندسی را بهعنوان یک مرحله استاندارد پسپردازش بپذیرد، بسیاری از مدلهای موجود میتوانند بدون نیاز به بازآموزی پرهزینه، بلافاصله بهبود عملکرد کسب کنند. همچنین مجموعههای بنچمارک باید شامل یک خط پایه (baseline) برای Self-Geometry باشند تا استقرار واقعبینانه را، جایی که پالایش در زمان تست امکانپذیر است، منعکس کنند.
نکته کلیدی: یک بررسی صحتسنجی هندسیِ ساده در زمان تست میتواند دقت بسیار بیشتری از مدلهای بینایی آماده (off-the-shelf) استخراج کند، اما وابستگی آن به تطبیقهای دقیق و سرعتهای غیر بلادرنگ، پذیرش فوری آن را در سیستمهای حساس به تأخیر محدود میکند.
