Wan 3.0 હવે પાત્રનો ચહેરો વિકૃત થયા વગર અથવા કેમેરા હલ્યા વગર અડધા મિનિટના AI-જનરેટેડ ફૂટેજને જોડી શકે છે—આ એક એવો કૂદકો છે જે જનરેટિવ વીડિયોને ટૂંકી ક્લિપ્સમાંથી ઉપયોગી સ્ટોરીટેલિંગમાં લઈ જાય છે.

આ સફળતા એક મજબૂત ટેકનિકલ સ્ટૅક પર આધારિત છે: એક causal 3-D variational auto-encoder (VAE) જે અવકાશ (space) અને સમયને એક જ વોલ્યુમ તરીકે ગણે છે, diffusion-based transformers જે તે વોલ્યુમને patch-tokens માં ફેરવે છે, અને એક mixture-of-experts router જે સીન-લેવલ પ્લાનિંગને પિક્સેલ-લેવલ પોલિશિંગથી અલગ કરે છે. Wan 3.0 ટેક્સ્ટ, ઈમેજ, ઓડિયો અને રેફરન્સ વીડિયોને સ્વતંત્ર conditioning streams તરીકે પણ સ્વીકારે છે, જેનાથી દરેક અન્યને ઓવરરાઈટ કર્યા વગર આઉટપુટને પ્રભાવિત કરી શકે છે. તેનું પરિણામ એક સુસંગત ઓડિયોવિઝ્યુઅલ વિશ્વ છે જ્યાં પાત્રને પેન (pan) દરમિયાન ફોલો કરી શકાય છે, પ્રોડક્ટ તેના સ્પિન દરમિયાન પોતાનો આકાર જાળવી રાખે છે, અને ઓડિયો ક્યુ (audio cue) સાથે પગલાનો અવાજ બરાબર તે જ સમયે આવે છે.

શા માટે લાંબા સમયના AI વીડિયો એક અવરોધ રહ્યા છે

શરૂઆતના જનરેટિવ વીડિયો મોડલ્સ થોડી સેકન્ડોનું એનિમેશન બનાવી શકતા હતા, પરંતુ સમયગાળો વધારવાથી બે મૂળભૂત ખામીઓ સામે આવી હતી. પ્રથમ, frame-by-frame synthesis ટેમ્પોરલ ડિપેન્ડન્સીઝ (temporal dependencies) ને અવગણતું હતું, તેથી જે ચહેરો શરૂઆતમાં વાસ્તવિક દેખાતો હતો તે થોડા જ ફ્રેમ્સ પછી વિકૃત થવા લાગતો હતો. બીજું, મોટાભાગના પાઇપલાઇન્સ અવાજને ગૌણ ગણતા હતા, જેના કારણે લિપ-સિંક (lip-sync) માં તફાવત અથવા ખોટા Foley ઇફેક્ટ્સ જોવા મળતા હતા. બ્રુટ-ફોર્સ સેમ્પલિંગ દ્વારા આ સમસ્યાઓ સુધારવાથી લંબાઈ સાથે ખર્ચમાં મોટો વધારો થતો હતો, જેના કારણે સર્જકો માટે થોડી સેકન્ડોથી વધુનું કંઈપણ વ્યવહારુ રહેતું નહોતું.

Wan 3.0 ના ટેકનિકલ સ્તંભો

  • Causal 3-D VAE – પરંપરાગત VAEs એક સિંગલ ઈમેજને latent code માં કોમ્પ્રેસ કરે છે. Wan નું વર્ઝન આખા વીડિયો ક્યુબ (height × width × time) ને એકસાથે કોમ્પ્રેસ કરે છે. કારણ કે encoder અને decoder ફ્રેમ્સના causal ordering ને અનુસરે છે, તેથી latent representation પહેલેથી જ "આગળ શું આવશે" તે એન્કોડ કરે છે, જે ડાઉનસ્ટ્રીમ મોડ્યુલ્સને અલગ-અલગ ચિત્રોને બદલે ટેમ્પોરલી અવેર (temporally aware) સબસ્ટ્રેટ સાથે કામ કરવાની મંજૂરી આપે છે.

  • Diffusion Transformers – એન્કોડિંગ પછી, વીડિયો 3-D patches માં વિભાજિત થાય છે જે વાક્યમાં શબ્દોની જેમ કામ કરે છે. એક transformer દરેક patch માટે diffusion trajectory ની આગાહી કરે છે, જે વસ્તુઓ કેવી રીતે હલે છે, લાઇટિંગ કેવી રીતે બદલાય છે અને ફ્રેમ્સમાં પર્સ્પેક્ટિવ કેવી રીતે બદલાય છે તે શીખે છે. આ token-based વ્યુ મોડલને ગ્લોબલ મોશનનો અહેસાસ આપે છે અને સાથે સાથે ઝીણી વિગતોનું પણ સંચાલન કરે છે.

  • Mixture-of-Experts (MoE) – એક જ નેટવર્કને macro layout અને micro texture બંને શીખવા માટે મજબૂર કરવાને બદલે, Wan શરૂઆતના diffusion steps ને એક “expert” ને મોકલે છે જે સીન કમ્પોઝિશન અને વ્યાપક ગતિ પર ધ્યાન કેન્દ્રિત કરે છે, અને પછી પછીના સ્ટેપ્સ બીજા expert ને સોંપે છે જે સ્કીન પોર્સ, રિફ્લેક્શન અને સૂક્ષ્મ પડછાયાઓને રિફાઇન કરે છે. આ વિભાજન એવા કાર્યો પર બિનજરૂરી કમ્પ્યુટિંગ ખર્ચ થતો અટકાવે છે જેને હાઈ રિઝોલ્યુશનની જરૂર નથી, જેનાથી inference time વ્યવસ્થિત રહે છે.

  • Multimodal Conditioning – ટેક્સ્ટ પ્રોમ્પ્ટ્સ, રેફરન્સ ઈમેજીસ, ટૂંકી વીડિયો ક્લિપ્સ અને ઓડિયો ટ્રેક્સ દરેક પોતાનું embedding જનરેટ કરે છે. મોડલ તેમની વ્યક્તિગતતા જાળવી રાખીને આ embeddings ને જોડે છે, જેથી “walk left” (ડાબે ચાલો) સૂચના પાત્રના ચહેરાની આપેલી રેફરન્સ ઈમેજને ભૂંસી નાખશે નહીં, અને બેકગ્રાઉન્ડ મ્યુઝિક ટ્રેક બોલાયેલા સંવાદને દબાવી દેશે નહીં.

  • Identity and Camera Control – આપેલી ઈમેજ અથવા ક્લિપમાંથી કાઢવામાં આવેલા રેફરન્સ ફીચર્સ જનરેશન દરમિયાન એન્કર તરીકે કામ કરે છે. જ્યારે વર્ચ્યુઅલ કેમેરા પેન કરે છે, ત્યારે સિસ્ટમ આ હલનચલનને post-process filter ને બદલે latent space ના geometric transformation તરીકે ગણે છે, જેનાથી બદલાતા વ્યુપોઈન્ટ્સ અથવા લાઇટિંગ હોવા છતાં વિષયની ઓળખ સ્થિર રહે છે.

  • Audiovisual Sync – એક સમર્પિત alignment head આગાહી કરે છે કે વીડિયો સ્ટ્રીમમાં ઓડિયો ઇવેન્ટ્સ ક્યારે દેખાવી જોઈએ. પગલાનો અવાજ, તાળીઓ અથવા સંવાદના ક્યુ બરાબર તે જ ફ્રેમ્સ પર આવે છે જ્યાં સાઉન્ડ વેવફોર્મ પીક પર હોય છે, જેનાથી મેન્યુઅલ એડિટિંગ વગર દ્રશ્ય અને શ્રાવ્ય વચ્ચે સચોટ સુમેળ સાધવામાં આવે છે.

કોને ફાયદો થઈ શકે છે

કન્ટેન્ટ ક્રિએટર્સ, જાહેરાતકર્તાઓ અને ગેમ ડેવલપર્સ હવે ડઝનબંધ ટૂંકી ક્લિપ્સને જોડ્યા વગર લાંબા સિક્વન્સના પ્રોટોટાઇપ બનાવી શકે છે. કારણ કે MoE આર્કિટેક્ચર બિનજરૂરી કમ્પ્યુટેશન ઘટાડે છે, તેથી જનરેટ થયેલા પ્રતિ મિનિટનો ખર્ચ મધ્યમ કદના સ્ટુડિયો માટે પરવડે તેવો રહે છે જેઓ અગાઉ હેન્ડ-ક્રાફ્ટેડ એનિમેશન પાઇપલાઇન્સ પર નિર્ભર હતા. સંશોધકો મેડિકલ ઇમેજિંગ અથવા સાયન્ટિફિક વિઝ્યુલાઇઝેશન જેવા ડોમેન-સ્પેસિફિક કાર્યો માટે causal 3-D VAE ના રીયુઝેબલ latent space ને પણ fine-tune કરી શકે છે.

ટ્રેડ-ઓફ્સ અને ખુલ્લા પ્રશ્નો

આ આર્કિટેક્ચરની જટિલતા સાથે હાર્ડવેરનો ખર્ચ પણ જોડાયેલો છે: 3-D patches પર diffusion transformer ને તાલીમ આપવા માટે હજુ પણ હાઈ-એન્ડ GPUs અથવા વિશિષ્ટ એક્સિલરેટર્સની જરૂર પડે છે. MoE ઇન્ફરન્સનો બગાડ ઘટાડે છે, પરંતુ રાઉટિંગ લોજિક લેટન્સી વધારે છે જે રિયલ-ટાઇમ એપ્લિકેશન્સમાં નોંધપાત્ર હોઈ શકે છે. મલ્ટિમોડલ કંડિશનિંગ, જોકે શક્તિશાળી છે, પરંતુ જ્યારે પ્રોમ્પ્ટ્સ અસ્પષ્ટ હોય ત્યારે તે સંઘર્ષ પેદા કરી શકે છે; મોડેલ અન્ય કરતા એક મોડાલિટીને વધુ પસંદ કરી શકે છે, જેનાથી એજ કેસમાં સૂક્ષ્મ આઇડેન્ટિટી ડ્રિફ્ટ થઈ શકે છે.

ટીકાકારો એ પણ નોંધે છે કે એક સુસંગત વિશ્વ વાર્તાની સુસંગતતાની ખાતરી આપતું નથી. Wan 3.0 વિઝ્યુઅલ અને ઓડિટરી કન્ટીન્યુટીમાં ઉત્કૃષ્ટ છે, પરંતુ તે હજુ સુધી સ્ટોરી આર્ક, પાત્રની પ્રેરણા અથવા પેસિંગને સમજતું નથી. વાર્તા કહેવાના તે ઉચ્ચ સ્તરના તત્વો હજુ પણ માનવ સંપાદકોના હાથમાં છે.

આગળ શું જોવું

Wan 3.0 ની પાછળની ટીમે આગામી વર્ઝન વિશે સંકેત આપ્યો છે જે હાયરાર્કિકલ ડિફ્યુઝન સાથે પ્રયોગ કરશે, જે વિગતોને શુદ્ધ કરતા પહેલા એક સિંગલ પાસ દ્વારા રફ સ્ટોરીબોર્ડ તૈયાર કરવાની મંજૂરી આપશે. લોકપ્રિય એડિટિંગ સૂટ્સ સાથેનું ઇન્ટિગ્રેશન પણ રોડમેપ પર છે, જે વર્તમાન રિસર્ચ પ્રોટોટાઇપને એવા પ્લગ-ઇનમાં બદલી શકે છે જેનો બિન-તકનીકી વપરાશકર્તાઓ સીધો ઉપયોગ કરી શકે છે.

જો વર્તમાન રિલીઝ વિવિધ હાર્ડવેર પર સ્થિર સાબિત થાય છે, તો આપણે ઇન્ડી સ્ટુડિયોઝની એક લહેર જોઈ શકીએ છીએ જે પરંપરાગત મોશન-કેપ્ચર રિગ્સને બદલે થોડા રેફરન્સ શોટ્સ અને ટેક્સ્ટ્યુઅલ સ્ક્રિપ્ટ પર આધાર રાખીને સંપૂર્ણ દ્રશ્યો જનરેટ કરશે. આગામી થોડા મહિનાઓ એ જણાવશે કે આ ટેકનિકલ લાભો પ્રોડક્શન વર્કફ્લોમાં પરિવર્તન લાવશે કે રિસર્ચ સમુદાય માટે માત્ર એક ઉચ્ચ-ખર્ચાળ કુતૂહલ બનીને રહેશે.