Wan 3.0 kini dapat menyatukan cuplikan video buatan AI berdurasi setengah menit tanpa wajah karakter yang meleleh atau kamera yang bergoyang—sebuah lompatan yang mendorong video generatif dari sekadar klip pendek menjadi penceritaan yang dapat digunakan.

Terobosan ini bertumpu pada tumpukan teknologi (stack) yang terintegrasi erat: causal 3-D variational auto-encoder (VAE) yang memperlakukan ruang dan waktu sebagai satu volume tunggal, diffusion-based transformers yang mengubah volume tersebut menjadi patch-tokens, dan mixture-of-experts router yang memisahkan perencanaan tingkat adegan dari pemolesan tingkat piksel. Wan 3.0 juga menerima teks, gambar, audio, dan video referensi sebagai aliran pengkondisian (conditioning streams) yang independen, memungkinkan masing-masing memengaruhi hasil tanpa menimpa yang lain. Hasilnya adalah dunia audiovisual yang koheren di mana karakter dapat diikuti saat kamera melakukan pan, sebuah produk tetap mempertahankan bentuknya saat berputar, dan langkah kaki mendarat tepat saat isyarat audio terdengar.

Mengapa video AI berdurasi panjang menjadi hambatan

Model video generatif awal dapat menghasilkan beberapa detik animasi, tetapi memperpanjang linimasa mengungkap dua kelemahan mendasar. Pertama, sintesis bingkai demi bingkai (frame-by-frame) mengabaikan ketergantungan temporal, sehingga wajah yang awalnya tampak realistis berubah menjadi distorsi setelah beberapa bingkai. Kedua, sebagian besar alur kerja (pipeline) menganggap suara sebagai tambahan belaka, yang menyebabkan ketidaksesuaian sinkronisasi bibir (lip-sync) atau efek Foley yang tidak tepat. Memperbaiki masalah ini dengan pengambilan sampel paksa (brute-force sampling) menyebabkan biaya melonjak seiring bertambahnya durasi, membuat apa pun yang lebih dari beberapa detik menjadi tidak praktis bagi para kreator.

Pilar teknis Wan 3.0

  • Causal 3-D VAE – VAE tradisional mengompresi satu gambar menjadi kode laten. Versi Wan mengompresi seluruh kubus video (tinggi × lebar × waktu) sekaligus. Karena encoder dan decoder menghormati urutan kausal dari bingkai-bingkai tersebut, representasi latennya sudah mengodekan "apa yang akan terjadi selanjutnya," memungkinkan modul hilir (downstream) untuk bekerja dengan substrat yang sadar secara temporal alih-alih gambar yang terisolasi.

  • Diffusion Transformers – Setelah pengodean, video dipecah menjadi 3-D patches yang bertindak seperti kata-kata dalam sebuah kalimat. Sebuah transformer memprediksi lintasan difusi untuk setiap patch, mempelajari bagaimana objek bergerak, bagaimana pencahayaan berubah, dan bagaimana perspektif berubah di seluruh bingkai. Pandangan berbasis token ini memberikan model pemahaman gerakan global sambil tetap menangani detail yang sangat halus.

  • Mixture-of-Experts (MoE) – Alih-alih memaksa satu jaringan untuk mempelajari tata letak makro sekaligus tekstur mikro, Wan mengarahkan langkah-langkah difusi awal ke seorang "pakar" (expert) yang berfokus pada komposisi adegan dan gerakan luas, lalu menyerahkan langkah-langkah berikutnya ke pakar kedua yang menyempurnakan pori-pori kulit, pantulan, dan bayangan halus. Pembagian ini mencegah pemborosan komputasi pada tugas yang tidak memerlukan resolusi tinggi, sehingga waktu inferensi tetap terkendali.

  • Multimodal Conditioning – Perintah teks (text prompts), gambar referensi, klip video pendek, dan trek audio masing-masing menghasilkan embedding mereka sendiri. Model menggabungkan embedding ini sambil tetap mempertahankan individualitasnya, sehingga instruksi tekstual untuk "berjalan ke kiri" tidak akan menghapus gambar referensi wajah karakter yang disediakan, dan trek musik latar tidak akan menenggelamkan dialog yang diucapkan.

  • Identity and Camera Control – Fitur referensi yang diekstraksi dari gambar atau klip yang disediakan bertindak sebagai jangkar selama proses pembuatan. Saat kamera virtual melakukan pan, sistem memperlakukan gerakan tersebut sebagai transformasi geometris dari ruang laten, bukan sebagai filter pasca-proses, sehingga menjaga identitas subjek tetap stabil meskipun sudut pandang atau pencahayaan berubah.

  • Audiovisual Sync – Sebuah alignment head khusus memprediksi kapan peristiwa audio harus muncul dalam aliran video. Langkah kaki, tepukan, atau isyarat dialog mendarat tepat pada bingkai di mana puncak gelombang suara terjadi, menghasilkan sinkronisasi yang erat antara penglihatan dan suara tanpa pengeditan manual.

Siapa yang akan diuntungkan

Kreator konten, pengiklan, dan pengembang gim kini dapat membuat prototipe urutan yang lebih panjang tanpa harus menyatukan puluhan klip pendek. Karena arsitektur MoE memangkas komputasi yang tidak perlu, biaya per menit video yang dihasilkan tetap terjangkau bagi studio skala menengah yang sebelumnya bergantung pada alur kerja animasi buatan tangan. Peneliti juga dapat melakukan fine-tuning pada ruang laten causal 3-D VAE yang dapat digunakan kembali untuk tugas-tugas spesifik domain seperti pencitraan medis atau visualisasi ilmiah.

Pertukaran (trade-offs) dan pertanyaan terbuka

Kecanggihan arsitektur ini membawa konsekuensi biaya perangkat keras: melatih diffusion transformer pada patch 3-D masih membutuhkan GPU kelas atas atau akselerator khusus. MoE mengurangi pemborosan inferensi, tetapi logika peruteannya menambah latensi yang mungkin terasa pada aplikasi real-time. Pengkondisian multimodal, meskipun kuat, dapat menghasilkan konflik saat prompt bersifat ambigu; model mungkin lebih mengutamakan satu modalitas di atas yang lain, yang menyebabkan pergeseran identitas (identity drift) yang halus pada kasus-kasus ekstrem (edge cases).

Kritikus juga mencatat bahwa dunia yang koheren tidak menjamin koherensi naratif. Wan 3.0 unggul dalam kontinuitas visual dan auditori, tetapi belum memahami alur cerita, motivasi karakter, atau tempo (pacing). Elemen penceritaan tingkat tinggi tersebut tetap berada di tangan editor manusia.

Apa yang perlu diperhatikan selanjutnya

Tim di balik Wan 3.0 telah mengisyaratkan versi mendatang yang akan bereksperimen dengan hierarchical diffusion, yang memungkinkan satu kali proses (single pass) untuk menyusun storyboard kasar sebelum menyempurnakan detailnya. Integrasi dengan editing suite populer juga masuk dalam roadmap, yang dapat mengubah prototipe penelitian saat ini menjadi plug-in yang dapat digunakan langsung oleh pengguna non-teknis.

Jika rilis saat ini terbukti stabil di berbagai perangkat keras, kita mungkin akan melihat gelombang studio indie yang meninggalkan perangkat motion-capture tradisional, dan sebaliknya mengandalkan beberapa cuplikan referensi serta naskah tekstual untuk menghasilkan adegan berdurasi penuh. Beberapa bulan ke depan akan mengungkap apakah kemajuan teknis ini akan diterjemahkan menjadi pergeseran dalam alur kerja produksi atau tetap menjadi rasa ingin tahu berbiaya tinggi bagi komunitas peneliti.