टेस्ट-टाइम भूमितीय मर्यादा (geometry constraints) व्हिजन मॉडेल्समध्ये सुधारणा करतात
Self-Geometry, हा एक टेस्ट-टाइम ॲड-ऑन आहे, जो ETH3D बेंचमार्कवर व्हिजन फाऊंडेशन मॉडेल्सच्या डेप्थ (depth) स्कोअरमध्ये ३७.३% पर्यंत आणि पोझ (pose) स्कोअरमध्ये ९.२% पर्यंत वाढ करतो.
VGGT सारखी व्हिजन फाऊंडेशन मॉडेल्स एका सिंगल फॉरवर्ड पासमध्ये सीनची डेप्थ आणि कॅमेरा पोझचा अंदाज लावतात. ही सोय एका तोट्यासह येते: ते प्रत्येक व्ह्यूला स्वतंत्रपणे हाताळतात आणि एकाच सीनच्या अनेक प्रतिमांना जोडणाऱ्या 'एपिपोलर कन्स्ट्रेंट्स' (epipolar constraints) कडे दुर्लक्ष करतात. सध्याच्या "सेल्फ-कन्सिस्टन्सी" (self-consistency) युक्त्या मॉडेलच्या स्वतःच्या आउटपुट्समधील विसंगती शोधण्याचा प्रयत्न करतात, परंतु जेव्हा सुरुवातीचा अंदाज खूप चुकीचा असतो, तेव्हा ही सुधारणा प्रक्रिया अयशस्वी ठरते.
Self-Geometry ही त्रुटी टाळते. ते प्रथम ओव्हरलॅपिंग प्रतिमांमधील २-डी पॉईंट कोरेस्पॉन्डन्स (2-D point correspondences) काढते आणि त्या मॅचेसना 'स्यूडो ग्राउंड ट्रुथ' (pseudo ground truth) म्हणून मानते. इन्फरन्स दरम्यान, ते एक हलका (lightweight) ऑप्टिमायझर चालवते जो दोन लॉस टर्म्स (loss terms) पूर्ण करण्यासाठी मॉडेलचे डेप्थ आणि पोझ आउटपुट्स ॲडजस्ट करतो:
- मल्टी-व्ह्यू कन्सिस्टन्सी (Multi-view consistency) – तोच ३-डी पॉईंट प्रत्येक व्ह्यूमध्ये अचूकपणे प्रोजेक्ट झाला पाहिजे.
- एपिपोलर कन्सिस्टन्सी (Epipolar consistency) – स्टिरिओ भूमितीचा (stereo geometry) क्लासिक लाईन-ऑफ-साइट नियम. बॅकबोनमध्ये (backbone) कोणतेही ग्रेडियंट्स परत जात नाहीत, त्यामुळे मूळ वेट्स (weights) तसेच राहतात.
ETH3D बेंचमार्कवर, ही पद्धत VGGT ची पोझ अचूकता ९.२% ने आणि डेप्थ अचूकता ३७.३% ने वाढवते. इतर मॉडेल्समध्ये ५.०% आणि २५.१% वाढ दिसून येते. ही सुधारणा सहा आर्किटेक्चर्स आणि चार सार्वजनिक डेटासेटवर दिसून येते, ज्यावरून हे सिद्ध होते की हा दृष्टिकोन केवळ एका विशिष्ट नेटवर्क डिझाइनपुरता मर्यादित नाही.
तडजोडी (Trade-offs)
ही पद्धत विश्वसनीय २-डी मॅचेसवर अवलंबून आहे. टेक्सचर नसलेले पृष्ठभाग, पुनरावृत्ती होणारे पॅटर्न किंवा हलणाऱ्या वस्तू कोरेस्पॉन्डन्स सेट खराब करू शकतात आणि सुधारणेची प्रक्रिया कमकुवत करू शकतात. रनटाइम हा आणखी एक अडथळा आहे: LoRA-आधारित (low-rank adaptation) अंमलबजावणी RTX PRO 6000 GPU वर प्रति सीन दोन मिनिटांपेक्षा कमी वेळात पूर्ण होते—जे लाइव्ह SLAM किंवा AR च्या फ्रेम-रेट गरजांपासून खूप दूर आहे.
भविष्यातील वाटचाल
जर समुदायाने भूमितीय अनुकूलन (geometric adaptation) ही एक मानक पोस्ट-प्रोसेसिंग स्टेप म्हणून स्वीकारली, तर अनेक विद्यमान मॉडेल्सना खर्चिक री-ट्रेनिंगशिवाय त्वरित कामगिरी सुधारता येईल. बेंचमार्क सूट्समध्ये देखील Self-Geometry बेसलाईन समाविष्ट करणे आवश्यक असेल, जेणेकरून वास्तववादी उपयोजन (deployment) प्रतिबिंबित होईल, जिथे टेस्ट-टाइम रिफाइनमेंट शक्य आहे.
थोडक्यात: एक साधा, टेस्ट-टाइम भूमितीय सॅनिटी चेक (sanity check) तयार उपलब्ध असलेल्या व्हिजन मॉडेल्समधून लक्षणीयरीत्या अधिक अचूकता मिळवू शकतो, परंतु स्वच्छ मॅचेसवरील अवलंबित्व आणि रिअल-टाइम नसलेली गती यामुळे लेटन्सी-क्रिटिकल (latency-critical) सिस्टम्समध्ये याचा त्वरित अवलंब करणे मर्यादित आहे.
