World Labsは、数枚の普通の写真から完全にナビゲート可能な3D世界を構築し、最大1分間の1440pビデオをレンダリングするオムニモデル「Atlas」を発表しました。同社はこの技術が「real-to-sim(現実からシミュレーションへ)」のパイプラインを構築すると述べています。
平面的なシーケンスからの転換が重要である理由
現在のほとんどのマルチモーダルAIシステムは、テキスト文字列、画像グリッド、ビデオフレームといった、1次元または2次元のストリームとして入力を扱います。この設計では、明示的な幾何学構造を欠いたデータから空間的な関係性を推論しなければならず、生成されるビデオや3D再構成の忠実度が制限されてしまいます。Atlasはこのアプローチを破棄しました。モデルが処理するすべてのトークンは、3次元空間内の具体的な点に関連付けられており、同社はこの手法を「spatial anchoring(空間アンカリング)」と呼んでいます。3D、さらには4D(時間)構造を認識できるアーキテクチャを用いて、テキスト、画像、ビデオ、3Dデータをゼロから学習させることで、Atlasは幾何学構造を直接理解し、操作することが可能になります。
「スロットマシン」のようなビデオから、カメラ制御による生成へ
現在の生成ビデオツールは、仮想カメラを動かすために曖昧なテキストプロンプトに頼っており、予測不可能な結果をもたらすことがよくあります。Atlasはプロンプトを幾何学的な入力に置き換えます。ユーザーがカメラのポーズや経路を指定すると、モデルはその正確な視点からシーンをレンダリングします。デモでは、カメラの動きに合わせて一貫性を保った、滑らかで高解像度なビデオが生成され、プロフェッショナル級の制御に向けた一歩を示しました。
最小限の画像による世界の再構成
Atlasは、専用のキャプチャハードウェアを使用することなく、わずか1枚から数十枚の画像だけで複雑な環境を再構築できます。公開デモでは、大学の中庭を地上から撮影した少数の写真から、想定されるレイアウトに一致する空撮視点を合成しました。VGGTやInfiniteVGGTといった競合モデルは、カメラが動くとテクスチャがぼやけたり幾何学的なグリッチが発生したりすることがよくありますが、Atlasは全体を通して構造的な整合性を維持しました。
ビデオだけでなく、このモデルはネイティブな3D形式、つまりポイントクラウド(点群)や3D Gaussian splatsを出力します。ポイントクラウドは表面の形状をエンコードする空間内の点の集合です。一方、Gaussian splatsは各点を滑らかに変化する小さな塊(blob)として保存し、微細なディテールの効率的なレンダリングを可能にします。RGBカラーとともに深度情報を提供することで、Atlasは数枚のスマートフォンの写真から、あらゆる角度から探索可能なデジタルツインへと変換します。
ロボットのためのReal-to-sim
ロボット工学の開発者は、現実世界のデータとシミュレーションによる学習環境との間のギャップに長年悩まされてきました。Atlasは、再構成された部屋の中でロボットが見るのと全く同じセンサーフィードを生成することで、そのギャップを埋めることを約束します。開発者はデジタルツイン内のオブジェクト、照明、背景を変更できるため、単一の現実世界のキャプチャから数千ものバリエーション豊かなシナリオを作成できます。World Labsは、シーン合成に特化したスタートアップから取得した技術を使用してこのワークフローを実演しました。このパイプラインは、5つの異なるロボットプラットフォームを、人間の介入なしに1時間自律的に稼働させ続けられるほどのバリエーションを生成しました。
ベンチマークと性能に関する主張
直接対決のテストにおいて、人間の評価者は、ペア比較の94%でAtlasのカメラ誘導ビデオを主要な競合他社よりも好み、別の主要モデルに対しても81%のケースでAtlasを好みました。再構成に関しては、Atlasは中央値誤差25.3を達成し、より高い誤差スコアを報告したライバルを上回りました。このモデルは、中間計算を再利用するためにキーバリュー(KV)キャッシュを使用する大規模言語モデルのスピードの利点と、画像を反復的に洗練させる拡散モデル(diffusion models)の高品質な出力を組み合わせています。
潜在的な欠点と未解決の疑問
World Labsの発表は印象的なデモに裏打ちされていますが、技術はまだ初期段階にあります。高解像度でテキスト、画像、ビデオ、3Dデータを扱うモデルの学習と実行には膨大な計算リソースが必要ですが、同社はハードウェアの仕様や推論コストを開示していません。ベンチマークは人間の好みや中央値誤差の指標に依存しており、純粋な現実データと比較した場合のロボットの操作成功率といったダウンストリームのタスクでAtlasがどのように機能するかはまだ示されていません。また、批判的な見方としては、モデルは少数の画像から妥当な幾何学構造を生成できるものの、正確な測定が必要な場合にLiDARスキャンや構造化光キャプチャの忠実度に取って代わることはできない、という点も挙げられます。
今後の注目点
- ロボティクス・プラットフォームへの採用 – ロボット開発チームがAtlasによって生成された世界を学習ループに組み込み、測定可能な成果を報告すれば、より安価で多様なシミュレーションが可能であるという主張の信頼性が高まります。
- コンテンツ制作パイプライン – 迅速なプロトタイピングのためにAtlasを試行しているスタジオやゲーム開発者は、このモデルのネイティブな3D出力が既存のアセットパイプラインに適合するかどうかを明らかにできる可能性があります。
- オープンソースまたは第三者による評価 – ベンチマーク数値を再現する独立した研究者たちは、現在の標準に対するこのモデルの優位性を裏付ける助けとなるでしょう。
- ハードウェアおよびコストの開示 – 推論に必要な計算リソースを把握することで、Atlasがエッジデバイス上で動作可能なのか、あるいはクラウド専用のサービスに留まるのかが決まります。
結論
Atlasは、AIトークンを物理空間に紐付けることで、最小限の視覚入力から単一のモデルで環境全体を生成、再構成、およびシミュレーションできることを示しています。もし約束された性能が、法外な計算コストをかけることなく実世界の展開へとスケールするならば、このモデルはロボットの学習方法や没入型コンテンツの構築方法を再定義し、数枚の写真から完全にインタラクティブなデジタル世界を作り出すことになるでしょう。
