Wan 3.0 potrafi teraz połączyć pół minuty materiału wygenerowanego przez AI bez efektu „topnienia” twarzy postaci czy drżenia kamery – to skok, który przesuwa generatywne wideo z poziomu krótkich klipów do użytecznego opowiadania historii.

Przełom opiera się na ściśle powiązanym stosie technologicznym: przyczynowym (causal) 3-D wariacyjnym autoenkoderze (VAE), który traktuje przestrzeń i czas jako jedną objętość, transformerach opartych na dyfuzji, które przekształcają tę objętość w tokeny łatek (patch-tokens), oraz routerze typu mixture-of-experts, który oddziela planowanie na poziomie sceny od dopracowywania na poziomie pikseli. Wan 3.0 przyjmuje również tekst, obrazy, dźwięk i wideo referencyjne jako niezależne strumienie warunkujące (conditioning streams), pozwalając każdemu z nich wpływać na wynik bez nadpisywania pozostałych. Rezultatem jest spójny świat audiowizualny, w którym postać można śledzić podczas panoramowania, produkt zachowuje swój kształt podczas obrotu, a krok stopy wypada dokładnie w momencie pojawienia się sygnału dźwiękowego.

Dlaczego długie formy wideo AI stanowiły problem

Wczesne modele generatywnego wideo potrafiły stworzyć kilka sekund animacji, ale wydłużenie osi czasu ujawniło dwie fundamentalne wady. Po pierwsze, synteza klatka po klatce ignorowała zależności czasowe, przez co twarz, która początkowo wyglądała realistycznie, po kilku klatkach ulegała zniekształceniu. Po drugie, większość potoków (pipelines) traktowała dźwięk jako dodatek, co prowadziło do niedopasowanego lip-syncu lub niewłaściwie umiejscowionych efektów Foley. Próby naprawy tych problemów poprzez próbkowanie metodą brute-force powodowały gwałtowny wzrost kosztów wraz z długością materiału, co sprawiało, że wszystko powyżej kilku sekund było niepraktyczne dla twórców.

Techniczne filary Wan 3.0

  • Causal 3-D VAE – Tradycyjne modele VAE kompresują pojedynczy obraz do kodu ukrytego (latent code). Wersja Wan kompresuje cały „sześcian” wideo (wysokość × szerokość × czas) naraz. Ponieważ enkoder i dekoder respektują przyczynowy (causal) porządek klatek, reprezentacja ukryta już koduje informację o tym, „co nastąpi później”, co pozwala modułom następnej generacji pracować na podłożu świadomym czasowo, a nie na izolowanych obrazach.

  • Diffusion Transformers – Po zakodowaniu wideo dzieli się na 3-D łatki (patches), które działają jak słowa w zdaniu. Transformer przewiduje trajektorię dyfuzji dla każdej łatki, ucząc się, jak poruszają się obiekty, jak zmienia się oświetlenie i jak perspektywa zmienia się między klatkami. To podejście oparte na tokenach daje modelowi globalne poczucie ruchu, przy jednoczesnym zachowaniu szczegółowości.

  • Mixture-of-Experts (MoE) – Zamiast zmuszać pojedynczą sieć do nauki zarówno makrostruktury, jak i mikrotekstury, Wan kieruje wczesne etapy dyfuzji do „eksperta” skupiającego się na kompozycji sceny i ogólnym ruchu, a następnie przekazuje późniejsze etapy drugiemu ekspertowi, który dopracowuje pory skóry, refleksy i subtelne cienie. Ten podział zapobiega marnowaniu mocy obliczeniowej na zadania, które nie wymagają wysokiej rozdzielczości, dzięki czemu czas wnioskowania (inference time) pozostaje na akceptowalnym poziomie.

  • Multimodal Conditioning – Prompty tekstowe, obrazy referencyjne, krótkie klipy wideo i ścieżki dźwiękowe generują własne osadzenia (embeddings). Model łączy te osadzenia, zachowując ich indywidualność, dzięki czemu tekstowa instrukcja „idź w lewo” nie usunie dostarczonego obrazu referencyjnego twarzy postaci, a podkład muzyczny nie zagłuszy wypowiadanej kwestii.

  • Identity and Camera Control – Cechy referencyjne wyodrębnione z dostarczonego obrazu lub klipu działają jako kotwice podczas całego procesu generowania. Gdy wirtualna kamera wykonuje panoramowanie, system traktuje ten ruch jako transformację geometryczną przestrzeni ukrytej, a nie jako filtr postprocesowy, co pozwala zachować stabilną tożsamość obiektu mimo zmieniających się punktów widzenia czy oświetlenia.

  • Audiovisual Sync – Dedykowana głowica wyrównująca (alignment head) przewiduje, kiedy zdarzenia dźwiękowe powinny pojawić się w strumieniu wideo. Kroki, klaskanie czy sygnały dialogowe trafiają dokładnie w te klatki, w których osiągany jest szczyt fali dźwiękowej, co zapewnia ścisłą synchronizację obrazu i dźwięku bez konieczności ręcznej edycji.

Kto na tym skorzysta

Twórcy treści, reklamodawcy i deweloperzy gier mogą teraz tworzyć prototypy dłuższych sekwencji bez konieczności łączenia dziesiątek krótkich klipów. Dzięki architekturze MoE, która ogranicza zbędne obliczenia, koszt wygenerowania minuty materiału pozostaje w zasięgu średniej wielkości studiów, które wcześniej polegały na ręcznie tworzonych potokach animacji. Badacze mogą również dostrajać (fine-tune) wielorazową przestrzeń ukrytą causal 3-D VAE do zadań specyficznych dla danej dziedziny, takich jak obrazowanie medyczne czy wizualizacja naukowa.

Kompromisy i otwarte pytania

Wyrafinowanie tej architektury wiąże się z wysoką ceną sprzętową: trenowanie transformera dyfuzyjnego na 3D-patchach wciąż wymaga wysokiej klasy procesorów GPU lub specjalistycznych akceleratorów. MoE redukuje marnotrawstwo podczas wnioskowania, ale logika routingu dodaje opóźnienia, które mogą być zauważalne w aplikacjach czasu rzeczywistego. Warunkowanie multimodalne, choć potężne, może powodować konflikty w przypadku niejednoznacznych promptów; model może faworyzować jedną modalność kosztem innej, co prowadzi do subtelnego dryfu tożsamości w przypadkach brzegowych.

Krytycy zauważają również, że spójny świat nie gwarantuje spójności narracyjnej. Wan 3.0 doskonale radzi sobie z ciągłością wizualną i dźwiękową, ale nie rozumie jeszcze łuków fabularnych, motywacji postaci ani tempa akcji. Te wyższego rzędu elementy narracyjne pozostają w rękach ludzkich redaktorów.

Co warto śledzić

Zespół stojący za Wan 3.0 zasugerował nadchodzącą wersję, która będzie eksperymentować z dyfuzją hierarchiczną, pozwalającą na pojedyncze przejście w celu stworzenia wstępnego storyboardu przed dopracowaniem szczegółów. Integracja z popularnymi pakietami edycyjnymi również znajduje się w planach rozwoju, co mogłoby przekształcić obecny prototyp badawczy w wtyczkę, którą użytkownicy nietechniczni mogliby obsługiwać bezpośrednio.

Jeśli obecna wersja okaże się stabilna na różnorodnym sprzęcie, możemy być świadkami fali niezależnych studiów omijających tradycyjne systemy motion-capture, polegających zamiast tego na kilku ujęciach referencyjnych i scenariuszu tekstowym w celu generowania pełnowymiarowych scen. Najbliższe miesiące pokażą, czy zyski techniczne przełożą się na zmianę w procesach produkcyjnych, czy pozostaną jedynie kosztowną ciekawostką dla społeczności badawczej.