研究者たちは、従来のモデルと比較してFréchet Inception Distanceを39.9%、Fréchet Video Distanceを37.6%削減するビデオ生成システム「GraphVid」を発表しました。リアリズムと動きの忠実度の向上は、ロボットシミュレーター、自動運転トレーニングスイート、またはコンピュータ生成アニメーションを構築するすべての人にとって重要です。

既存の手法が不十分な理由

現在の制御可能なビデオ生成器は、2つの入力に依存しています。テキストプロンプトは漠然とした説明を与えることはできますが、オブジェクトの正確な経路を特定することはできません。軌跡(トラジェトリ)ツールは、ユーザーにすべての登場人物のピクセルレベルの経路を描かせますが、シーン内に相互作用する複数のエンティティや遮蔽(オクルージョン)が含まれる場合、その手法は破綻します。エンジニアは、意図した動きを作成することよりも、壊れたトラックを修正することに多くの時間を費やすことになります。

GraphVidのインタラクショングラフ・アプローチ

GraphVidは、手書きの経路をハイレベルなインタラクショングラフに置き換えます。各ピクセルをマッピングする代わりに、ユーザーは「オブジェクトAがオブジェクトBに近づく」「オブジェクトCがオブジェクトDに従う」「オブジェクトEがオブジェクトFと衝突する」といった関係性を定義します。モデルはこのグラフを設計図として読み取り、関係性の手がかりを一貫した動きと外観へと変換します。生の座標ではなく意味論(セマンティクス)に焦点を当てることで、オブジェクトが互いの背後に隠れて見えなくなった場合でも、その動きを追跡し続けることができます。

チームは、ビデオクリップと構造化された関係データをペアにした専用のトレーニングセット「GraphVid-Bench」を構築しました。このデータセットは、異なるインタラクションパターン下で複数のオブジェクトがどのように一緒に動くかをモデルに示し、推論時に再結合可能な「動きの語彙(motion vocabulary)」をモデルに提供します。

パフォーマンスの向上

指標 従来のモデル GraphVid
Fréchet Inception Distance (FID) ↓ 39.9 %
Fréchet Video Distance (FVD) ↓ 37.6 %
Peak Signal-to-Noise Ratio (PSNR) 9.87 15.98
Structural Similarity Index (SSIM) 0.38 0.61

FIDとFVDのスコアが低いことは、生成されたビデオがよりリアルに見え、フレーム間の動きがより滑らかであることを意味します。PSNRとSSIMの飛躍的な向上は、テクスチャがより鮮明になり、構造の保持がより優れていることを示しています。これらの数値は総合して、GraphVidが実写映像に著しく近いビデオを生成することを示しています。

効率性と実用的な影響

GraphVidは、従来のアプローチよりも少ないパラメータとトレーニングデータでこれらの成果を達成しています。このモデルは、ピクセルレベルのダイナミクスを記憶するのではなく、シーンの構造について推論します。AIエンジニアにとって、ワークフローは骨の折れる経路の描画から、関係データの設計へとシフトします。これは、オブジェクトの数が増えるにつれて自然にスケールする変化です。

潜在的な受益者には以下が含まれます:

  • ロボティクス – 手動の軌跡スクリプトなしで、シミュレーション環境に現実的なオブジェクトの相互作用を反映させることができます。
  • 自動運転 – 複数の車、歩行者、サイクリストを含む交通シナリオをハイレベルなインタラクションルールから生成でき、データ拡張パイプラインを高速化できます。
  • アニメーション – アーティストは物語上の関係性に集中でき、システムが基礎となる動きの物理学を処理します。

まとめ: オブジェクトの関係性を主要な制御信号として扱うことで、GraphVidはクリエイターにとってより直感的なビデオ生成を可能にし、現実世界の動きにより忠実なものにします。これは、制御可能な合成(controllable synthesis)における新たな方向性を示しています。