テスト時の幾何学的制約がビジョンモデルを向上させる

テスト時のアドオンであるSelf-Geometryは、ETH3Dベンチマークにおいて、ビジョン基盤モデルの深度スコアを最大37.3%、ポーズスコアを最大9.2%向上させます。

VGGTのようなビジョン基盤モデルは、単一のフォワードパスでシーンの深度とカメラのポーズを予測します。この利便性には代償が伴います。これらのモデルは各ビューを独立して扱い、同一シーンの複数の画像を紐付けるエピポーラ制約を無視してしまうのです。既存の「自己整合性(self-consistency)」を用いた手法は、モデル自身の出力内の矛盾を見つけようとしますが、初期の予測が大きく外れている場合、その修正は破綻してしまいます。

Self-Geometryはこの欠点を回避します。まず、重なり合う画像間の2D点対応関係を抽出し、それらのマッチングを擬似的なグランドトゥルース(pseudo ground truth)として扱います。推論時には軽量なオプティマイザを実行し、以下の2つの損失項を満たすようにモデルの深度およびポーズの出力を調整します。

  1. 多視点整合性(Multi-view consistency) – 同一の3D点は、すべてのビューに正しく投影されなければならない。
  2. エピポーラ整合性(Epipolar consistency) – ステレオ幾何学における古典的な視線規則。 バックボーンに勾配は流れないため、元の重みは変更されません。

ETH3Dベンチマークにおいて、この手法はVGGTのポーズ精度を9.2%、深度精度を37.3%向上させます。他のモデルでも、それぞれ5.0%と25.1%の向上が見られました。この改善は6つのアーキテクチャと4つの公開データセットにわたって維持されており、このアプローチが特定のネットワーク設計に依存していないことを示しています。

トレードオフ

この技術は信頼性の高い2Dマッチングに依存しています。テクスチャのない表面、繰り返しのパターン、または移動物体は、対応関係のセットを損ない、修正機能を弱める可能性があります。実行時間も課題の一つです。LoRA(low-rank adaptation)ベースの実装では、RTX PRO 6000 GPUを使用しても1シーンあたり2分未満かかり、ライブSLAMやARで求められるフレームレートには遠く及びません。

今後の展望

もしコミュニティが幾何学的適応を標準的な後処理ステップとして採用すれば、多くの既存モデルがコストのかかる再学習を行うことなく、即座にパフォーマンスを向上させることができます。また、テスト時のリファインメント(精緻化)が可能な現実的なデプロイメントを反映するために、ベンチマークスイートにもSelf-Geometryのベースラインを含める必要があるでしょう。

要点: 控えめなテスト時の幾何学的サニティチェックであっても、既製品のビジョンモデルから大幅に高い精度を引き出すことが可能ですが、クリーンなマッチングへの依存や非リアルタイムな速度が、低遅延が極めて重要なシステムへの即時採用を制限しています。