Wan 3.0は、キャラクターの顔が崩れたりカメラが揺れたりすることなく、30秒間のAI生成映像を繋ぎ合わせることが可能になりました。これは、生成ビデオを単なる短いクリップから、実用的なストーリーテリングへと押し上げる飛躍的な進歩です。
この画期的な技術は、密接に連携するスタックによって支えられています。空間と時間を単一のボリュームとして扱う因果的3D変分オートエンコーダー(causal 3-D VAE)、そのボリュームをパッチトークンに変換する拡散ベースのTransformer、そしてシーンレベルのプランニングとピクセルレベルの仕上げを分離するMixture-of-Experts(MoE)ルーターです。また、Wan 3.0はテキスト、画像、音声、リファレンスビデオを独立したコンディショニング・ストリームとして受け入れるため、それぞれが他の要素を上書きすることなく出力に影響を与えることができます。その結果、パン操作に合わせてキャラクターを追いかけたり、回転しても製品の形状を維持したり、音声の合図に合わせて足音が正確に鳴ったりする、一貫性のある視聴覚の世界が実現します。
なぜ長尺のAIビデオは障壁となってきたのか
初期の生成ビデオモデルは数秒のアニメーションを生成することはできましたが、タイムラインを延長しようとすると2つの根本的な欠陥が露呈しました。第一に、フレームごとの合成は時間的な依存関係を無視していたため、最初はリアルに見えた顔が数フレーム後には歪んでしまいました。第二に、ほとんどのパイプラインにおいて音声は後回しにされており、リップシンクの不一致や効果音(Foley)のタイミングのズレが生じていました。これらの問題を力任せのサンプリングで解決しようとすると、長さとともにコストが爆発的に増大し、クリエイターにとって数秒を超える制作は非現実的なものとなっていました。
Wan 3.0の技術的柱
Causal 3-D VAE – 従来のVAEは単一の画像を潜在コードに圧縮します。Wanのバージョンは、ビデオキューブ全体(高さ × 幅 × 時間)を一度に圧縮します。エンコーダーとデコーダーがフレームの因果的順序を尊重するため、潜在表現にはすでに「次に何が起こるか」がエンコードされており、後続のモジュールが孤立した画像ではなく、時間的な整合性を持った基盤として扱うことができます。
Diffusion Transformers – エンコード後、ビデオは文章内の単語のように機能する3Dパッチに分割されます。Transformerが各パッチの拡散軌道を予測し、オブジェクトの動き、照明の変化、フレーム間でのパースの変化を学習します。このトークンベースの視点により、モデルは微細なディテールを扱いながら、動きの全体的な感覚を把握できます。
Mixture-of-Experts (MoE) – 単一のネットワークにマクロなレイアウトとミクロなテクスチャの両方を学習させるのではなく、Wanは拡散の初期ステップをシーン構成と広範な動きに焦点を当てた「エキスパート」にルーティングし、その後のステップを肌の毛穴、反射、微妙な影を精緻化する第2のエキスパートに引き継ぎます。この分割により、高解像度を必要としないタスクへの計算資源の浪費を防ぎ、推論時間を管理可能な範囲に抑えています。
Multimodal Conditioning – テキストプロンプト、リファレンス画像、短いビデオクリップ、オーディオトラックは、それぞれ独自の埋め込み(embedding)を生成します。モデルはこれらの埋め込みを個性を保ったまま融合させるため、「左に歩く」というテキスト指示によって提供されたキャラクターの顔のリファレンス画像が消えたり、バックグラウンドミュージックがセリフをかき消したりすることはありません。
Identity and Camera Control – 提供された画像やクリップから抽出されたリファレンス特徴量は、生成プロセス全体を通じてアンカーとして機能します。仮想カメラがパンする際、システムはその動きを後処理のフィルターとしてではなく、潜在空間の幾何学的変換として扱うため、視点や照明が変化しても被写体のアイデンティティを安定して保つことができます。
Audiovisual Sync – 専用のアライメントヘッドが、ビデオストリーム内のどのタイミングで音声イベントが現れるべきかを予測します。足音、拍手、あるいはセリフの合図は、音の波形がピークに達する正確なフレームに配置され、手動の編集なしに視覚と聴覚の緊密な同期を実現します。
恩恵を受けるのは誰か
コンテンツクリエイター、広告主、ゲーム開発者は、数十もの短いクリップを繋ぎ合わせることなく、より長いシーケンスのプロトタイプを作成できるようになります。MoEアーキテクチャが不要な計算を削減するため、生成される1分あたりのコストは、以前は手作業のアニメーションパイプラインに頼っていた中規模スタジオでも手の届く範囲に収まります。また、研究者は、医療画像や科学的視覚化などのドメイン固有のタスクに合わせて、因果的3D VAEの再利用可能な潜在空間を微調整することも可能です。
トレードオフと未解決の課題
アーキテクチャの高度さは、ハードウェアコストという代償を伴います。3Dパッチを用いたdiffusion transformerの学習には、依然としてハイエンドGPUや専用のアクセンレータが必要です。MoEは推論時の無駄を削減しますが、ルーティングロジックによってレイテンシが発生し、リアルタイムアプリケーションではそれが顕著になる可能性があります。マルチモーダル・コンディショニングは強力ですが、プロンプトが曖昧な場合に競合が生じることがあります。モデルがあるモダリティを他よりも優先してしまい、エッジケースにおいて微妙なアイデンティティのドリフトを引き起こす可能性があるのです。
また、批評家たちは、世界観の一貫性が必ずしも物語の一貫性を保証するわけではないと指摘しています。Wan 3.0は視覚的・聴覚的な連続性に優れていますが、ストーリーアーク、キャラクターの動機、あるいはテンポをまだ理解しているわけではありません。こうした高次のストーリーテリング要素は、依然として人間のエディターの手に委ねられています。
今後の注目点
Wan 3.0の開発チームは、hierarchical diffusionを試行する次期バージョンの存在をほのめかしています。これにより、一度のパスで大まかな絵コンテを作成してから詳細を精緻化することが可能になります。また、普及している編集スイートとの統合もロードマップに含まれており、現在の研究用プロトタイプが、非技術的なユーザーでも直接扱えるプラグインへと進化する可能性があります。
もし今回のリリースが多様なハードウェア上で安定していることが証明されれば、インディーズスタジオが従来のモーションキャプチャ機材を介さず、数枚のリファレンスショットとテキストスクリプトのみを頼りにフル尺のシーンを生成するという波が起こるかもしれません。技術的な進歩が制作ワークフローの転換につながるのか、それとも研究コミュニティにとっての「高コストな好奇心の対象」に留まるのかは、これからの数ヶ月で明らかになるでしょう。
