Wan 3.0 आता पात्राचा चेहरा विद्रूप न होता किंवा कॅमेरा थरथर न होता, अर्ध्या मिनिटाचे AI-जनरेटेड फुटेज एकत्र जोडू शकते—हा एक असा टप्पा आहे जो जनरेटिव्ह व्हिडिओला लहान क्लिप्समधून वापरण्यायोग्य कथा सांगण्याच्या (storytelling) क्षेत्रात नेतो.

हा breakthrough एका घट्ट जोडलेल्या स्टॅकवर आधारित आहे: एक causal 3-D variational auto-encoder (VAE) जो अवकाश (space) आणि वेळ (time) यांना एकाच व्हॉल्यूमप्रमाणे मानतो, diffusion-based transformers जे त्या व्हॉल्यूमचे patch-tokens मध्ये रूपांतर करतात, आणि एक mixture-of-experts router जो सीन-लेव्हल प्लॅनिंगला पिक्सेल-लेव्हल पॉलिशिंगपासून वेगळे करतो. Wan 3.0 मजकूर (text), प्रतिमा (images), ऑडिओ आणि संदर्भ व्हिडिओ (reference video) स्वतंत्र conditioning streams म्हणून स्वीकारते, ज्यामुळे प्रत्येक घटक दुसऱ्याला ओव्हरराईट न करता आउटपुटवर प्रभाव टाकू शकतो. याचा परिणाम एक सुसंगत ऑडिओव्हिज्युअल जग म्हणून होतो, जिथे कॅमेरा पॅन करताना पात्राचा मागोवा घेता येतो, एखादी वस्तू फिरताना तिचा आकार कायम राहतो आणि ऑडिओ क्यू (audio cue) येताच पाऊलाचा आवाज अगदी त्याच वेळी येतो.

लाँग-फॉर्म AI व्हिडिओ हा अडथळा का ठरला आहे

सुरुवातीचे जनरेटिव्ह व्हिडिओ मॉडेल्स काही सेकंदांचे ॲनिमेशन तयार करू शकत होते, परंतु टाइमलाइन वाढवल्यामुळे दोन मूलभूत त्रुटी समोर आल्या. पहिले म्हणजे, फ्रेम-बाय-फ्रेम सिंथेसिसमध्ये temporal dependencies कडे दुर्लक्ष केले जात असे, त्यामुळे सुरुवातीला वास्तववादी दिसणारा चेहरा काही फ्रेम्सनंतर विद्रूप होऊ लागला. दुसरे म्हणजे, बहुतेक पाइपलाईन्समध्ये आवाजाकडे दुय्यम महत्त्व दिले जात असे, ज्यामुळे लिप-सिंक (lip-sync) किंवा फोले इफेक्ट्स (Foley effects) चुकीचे होत असत. ब्रूट-फोर्स सॅम्पलिंगद्वारे या समस्या सोडवल्यामुळे लांबीनुसार खर्च प्रचंड वाढू लागला, ज्यामुळे काही सेकंदांपेक्षा जास्त व्हिडिओ तयार करणे निर्मात्यांसाठी अव्यवहार्य झाले.

Wan 3.0 चे तांत्रिक आधारस्तंभ

  • Causal 3-D VAE – पारंपारिक VAEs एका सिंगल इमेजला latent code मध्ये कॉम्प्रेस करतात. Wan ची आवृत्ती संपूर्ण व्हिडिओ क्यूब (height × width × time) एकाच वेळी कॉम्प्रेस करते. कारण एन्कोडर आणि डिकोडर फ्रेम्सच्या causal ordering चा आदर करतात, त्यामुळे latent representation मध्ये आधीच "पुढे काय येईल" हे एनकोड केलेले असते, ज्यामुळे डाउनस्ट्रीम मॉड्यूल्सना विलग फोटोंऐवजी temporally aware substrate सोबत काम करणे शक्य होते.

  • Diffusion Transformers – एन्कोडिंगनंतर, व्हिडिओ 3-D patches मध्ये विभागला जातो जे वाक्यातील शब्दांप्रमाणे काम करतात. एक transformer प्रत्येक patch साठी diffusion trajectory चे भाकीत करते, ज्यामुळे वस्तू कशा हलतात, प्रकाश कसा बदलतो आणि फ्रेम्समध्ये दृष्टीकोन (perspective) कसा बदलतो हे मॉडेल शिकते. हा token-based दृष्टिकोन मॉडेलला सूक्ष्म तपशील हाताळतानाच हालचालीची जागतिक समज (global sense of motion) देतो.

  • Mixture-of-Experts (MoE) – एकाच नेटवर्कवर मॅक्रो लेआउट आणि मायक्रो टेक्सचर दोन्ही शिकण्याची जबरदस्ती करण्याऐवजी, Wan सुरुवातीच्या diffusion स्टेप्स अशा “expert” कडे वळवते जो सीन कंपोझिशन आणि व्यापक हालचालींवर लक्ष केंद्रित करतो, आणि नंतरच्या स्टेप्स दुसऱ्या expert कडे सोपवतो जो त्वचेची छिद्रे (skin pores), परावर्तन (reflections) आणि सूक्ष्म सावल्या सुधारतो. या विभाजनामुळे ज्या कामांसाठी उच्च रिझोल्यूशनची गरज नाही, तिथे संगणकीय शक्ती (compute) वाया जात नाही आणि inference time नियंत्रणात राहतो.

  • Multimodal Conditioning – टेक्स्ट प्रॉम्प्ट्स, संदर्भ प्रतिमा, लहान व्हिडिओ क्लिप्स आणि ऑडिओ ट्रॅक्स प्रत्येक स्वतःचे embedding तयार करतात. मॉडेल त्यांची वैयक्तिक ओळख जपून हे embeddings एकत्र करते, त्यामुळे “walk left” या टेक्स्ट सूचनांमुळे पात्राच्या चेहऱ्याची दिलेली संदर्भ प्रतिमा पुसली जाणार नाही आणि बॅकग्राउंड म्युझिक ट्रॅकमुळे बोललेले संवाद दबले जाणार नाहीत.

  • Identity and Camera Control – पुरवलेल्या इमेज किंवा क्लिपमधून काढलेले संदर्भ वैशिष्ट्ये (reference features) संपूर्ण जनरेशन दरम्यान अँकर म्हणून काम करतात. जेव्हा व्हर्च्युअल कॅमेरा पॅन करतो, तेव्हा सिस्टम त्या हालचालीला post-process फिल्टरऐवजी latent space चे geometric transformation मानते, ज्यामुळे बदलत्या व्ह्यूपॉइंट्स किंवा प्रकाशामुळेही विषयाची ओळख (identity) स्थिर राहते.

  • Audiovisual Sync – एक समर्पित alignment head व्हिडिओ स्ट्रीममध्ये ऑडिओ इव्हेंट्स कधी दिसले पाहिजेत याचे भाकीत करते. पाऊलखुणा, टाळ्या किंवा संवादाचे संकेत (dialogue cues) नेमक्या त्याच फ्रेम्सवर येतात जिथे साऊंड वेव्हफॉर्म पीक (peak) होतो, ज्यामुळे मॅन्युअल एडिटिंगशिवाय दृश्य आणि ध्वनीमध्ये अचूक ताळमेळ साधला जातो.

कोणाला फायदा होईल

कंटेंट क्रिएटर्स, जाहिरातदार आणि गेम डेव्हलपर्स आता डझनभर लहान क्लिप्स एकत्र न जोडता लांब सीक्वेन्सचे प्रोटोटाइप तयार करू शकतात. MoE आर्किटेक्चरमुळे अनावश्यक गणना (computation) कमी होते, त्यामुळे प्रति मिनिट जनरेटेड व्हिडिओचा खर्च मध्यम आकाराच्या स्टुडिओच्या आवाक्यात राहतो, जे पूर्वी हाताने बनवलेल्या ॲनिमेशन पाइपलाईन्सवर अवलंबून होते. संशोधक वैद्यकीय इमेजिंग किंवा वैज्ञानिक व्हिज्युअलायझेशन सारख्या विशिष्ट क्षेत्रातील कामांसाठी causal 3-D VAE च्या पुन्हा वापरण्यायोग्य latent space ला fine-tune देखील करू शकतात.

तडजोडी आणि उघडे प्रश्न

या आर्किटेक्चरमधील गुंतागुंत हार्डवेअरच्या खर्चात दिसून येते: ३-डी (3-D) पॅचेसवर डिफ्यूजन ट्रान्सफॉर्मर (diffusion transformer) प्रशिक्षित करण्यासाठी अजूनही हाय-एंड GPUs किंवा विशेष अ‍ॅक्सिलरेटर्सची गरज भासते. MoE मुळे इन्फरन्सचा (inference) अपव्यय कमी होतो, परंतु राउटिंग लॉजिकमुळे लॅटन्सी (latency) वाढते, जी रिअल-टाइम ॲप्लिकेशन्समध्ये जाणवू शकते. मल्टिमॉडल कंडिशनिंग (Multimodal conditioning) शक्तिशाली असले तरी, प्रॉम्प्ट्स (prompts) संदिग्ध असल्यास ते संघर्ष निर्माण करू शकतात; मॉडेल एका मोडॅलिटीला दुसऱ्यापेक्षा जास्त महत्त्व देऊ शकते, ज्यामुळे काही विशिष्ट प्रकरणांमध्ये (edge cases) सूक्ष्म 'आयडेंटिटी ड्रिफ्ट' (identity drift) होऊ शकतो.

टीकाकारांचे असेही मत आहे की, एक सुसंगत जग निर्माण करणे म्हणजे कथानकाची सुसंगतता (narrative coherence) सुनिश्चित करणे नव्हे. Wan 3.0 दृश्य आणि श्राव्य सातत्य (visual and auditory continuity) राखण्यात उत्कृष्ट आहे, परंतु त्याला अद्याप स्टोरी आर्क्स (story arcs), पात्रांची प्रेरणा किंवा गती (pacing) समजत नाही. गोष्टी सांगण्याचे हे उच्च-स्तरीय घटक अद्याप मानवी संपादकांच्या हातातच आहेत.

पुढे काय पाहावे

Wan 3.0 च्या टीमने आगामी आवृत्तीबद्दल संकेत दिले आहेत, ज्यामध्ये हायरार्किकल डिफ्यूजन (hierarchical diffusion) सोबत प्रयोग केले जातील; यामुळे तपशील सुधारण्यापूर्वी एकाच पासमध्ये (single pass) एक कच्चा स्टोरीबोर्ड तयार करणे शक्य होईल. लोकप्रिय एडिटिंग सूट्ससोबतचे एकत्रीकरण (integration) देखील रोडमॅपमध्ये आहे, ज्यामुळे सध्याचा रिसर्च प्रोटोटाइप एका प्लग-इनमध्ये रूपांतरित होऊ शकतो, ज्याचा वापर तांत्रिक ज्ञान नसलेले वापरकर्ते थेट करू शकतील.

जर सध्याची आवृत्ती विविध हार्डवेअरवर स्थिर असल्याचे सिद्ध झाले, तर आपण इंडी स्टुडिओची अशी लाट पाहू शकतो जे पारंपारिक मोशन-कॅप्चर रिग्स (motion-capture rigs) सोडून, पूर्ण लांबीचे सीन्स तयार करण्यासाठी केवळ काही संदर्भ शॉट्स आणि लिखित स्क्रिप्टवर अवलंबून राहतील. येणारे काही महिने हे स्पष्ट करतील की हे तांत्रिक फायदे उत्पादन कार्यप्रवाहामध्ये (production workflows) बदल घडवून आणतात की केवळ संशोधन समुदायासाठी एक महागडे कुतूहल म्हणून राहतात.