ٹیسٹ ٹائم جیومیٹری کی پابندیاں ویژن ماڈلز کو بہتر بناتی ہیں

Self-Geometry، جو کہ ایک ٹیسٹ ٹائم ایڈ آن (add-on) ہے، ETH3D بینچ مارک پر ویژن فاؤنڈیشن ماڈلز کے ڈیپتھ (depth) اور پوز (pose) اسکورز کو ڈیپتھ کے لیے 37.3% اور پوز کے لیے 9.2% تک بڑھا دیتا ہے۔

VGGT جیسے ویژن فاؤنڈیشن ماڈلز ایک ہی فارورڈ پاس (forward pass) میں منظر کی ڈیپتھ اور کیمرہ پوز کی پیش گوئی کرتے ہیں۔ یہ سہولت ایک قیمت پر آتی ہے: وہ ہر ویو (view) کو آزادانہ طور پر لیتے ہیں اور ان ایپپولر پابندیوں (epipolar constraints) کو نظر انداز کر دیتے ہیں جو ایک ہی منظر کی متعدد تصاویر کو آپس میں جوڑتی ہیں۔ موجودہ "سیلف کنسسٹینسی" (self-consistency) تکنیکیں ماڈل کے اپنے آؤٹ پٹس میں تضادات تلاش کرنے کی کوشش کرتی ہیں، لیکن جب ابتدائی پیش گوئی بہت غلط ہو، تو اصلاح کا عمل ناکام ہو جاتا ہے۔

Self-Geometry اس خامی سے بچتا ہے۔ یہ پہلے اوورلیپنگ تصاویر کے درمیان 2-D پوائنٹ کوریسپونڈنس (correspondences) نکالتا ہے اور ان میچز کو pseudo ground truth کے طور پر استعمال کرتا ہے۔ انفرنس (inference) کے دوران، یہ ایک ہلکا پھلکا آپٹیمائزر (optimizer) چلاتا ہے جو ماڈل کے ڈیپتھ اور پوز آؤٹ پٹس کو دو لاس ٹرمز (loss terms) کو پورا کرنے کے لیے ایڈجسٹ کرتا ہے:

  1. ملٹی ویو کنسسٹینسی (Multi-view consistency) – ایک ہی 3-D پوائنٹ کو ہر ویو میں درست طریقے سے پروجیکٹ ہونا چاہیے۔
  2. ایپپولر کنسسٹینسی (Epipolar consistency) – سٹیریو جیومیٹری کا روایتی لائن آف سائٹ (line-of-sight) اصول۔ اس میں کوئی گریڈینٹس (gradients) بیک بون (backbone) میں واپس نہیں جاتے، اس لیے اصل ویٹس (weights) برقرار رہتے ہیں۔

ETH3D بینچ