Wan 3.0-ന് ഇപ്പോൾ കഥാപാത്രത്തിന്റെ മുഖം വികൃതമാകാതെയോ ക്യാമറ കുലുങ്ങാതെയോ അര മിനിറ്റ് ദൈർഘ്യമുള്ള AI-ജനറേറ്റഡ് ദൃശ്യങ്ങൾ ഒന്നിച്ച് ചേർക്കാൻ സാധിക്കും—ഇത് ജനറേറ്റീവ് വീഡിയോയെ ചെറിയ ക്ലിപ്പുകളിൽ നിന്ന് ഉപയോഗപ്രദമായ കഥപറച്ചിലിലേക്ക് (storytelling) എത്തിക്കുന്ന ഒരു വലിയ കുതിച്ചുചാട്ടമാണ്.

ഈ മുന്നേറ്റം ശക്തമായ ഒരു സാങ്കേതിക ഘടനയിൽ (stack) അധിഷ്ഠിതമാണ്: സ്ഥലത്തെയും (space) സമയത്തെയും (time) ഒരൊറ്റ വോളിയമായി പരിഗണിക്കുന്ന ഒരു causal 3-D variational auto-encoder (VAE), ആ വോളിയത്തെ patch-tokens ആക്കി മാറ്റുന്ന diffusion-based transformers, കൂടാതെ സീൻ-ലെവൽ പ്ലാനിംഗിനെയും പിക്സൽ-ലെവൽ പോളിഷിംഗിനെയും വേർതിരിക്കുന്ന ഒരു mixture-of-experts router എന്നിവ ഇതിൽ ഉൾപ്പെടുന്നു. Wan 3.0 ടെക്സ്റ്റ്, ഇമേജ്, ഓഡിയോ, റഫറൻസ് വീഡിയോ എന്നിവയെ സ്വതന്ത്രമായ conditioning streams ആയി സ്വീകരിക്കുന്നു, ഇത് മറ്റുള്ളവയെ മായ്ച്ചുകളയാതെ തന്നെ ഓരോന്നിനും ഔട്ട്‌പുട്ടിനെ സ്വാധീനിക്കാൻ അനുവാദം നൽകുന്നു. ഇതിന്റെ ഫലമായി, ഒരു ക്യാമറ പാൻ ചെയ്യുമ്പോൾ കഥാപാത്രത്തെ പിന്തുടരാനും, ഒരു ഉൽപ്പന്നം കറങ്ങുമ്പോൾ അതിന്റെ രൂപം നിലനിർത്താനും, ഓഡിയോ സിഗ്നലുകൾക്കനുസരിച്ച് കൃത്യസമയത്ത് കാലടി ശബ്ദം കേൾപ്പിക്കാനും കഴിയുന്ന ഒരൊറ്റപ്പെട്ട ഓഡിയോവിഷ്വൽ ലോകം സൃഷ്ടിക്കപ്പെടുന്നു.

എന്തുകൊണ്ടാണ് ദൈർഘ്യമേറിയ AI വീഡിയോകൾ ഒരു തടസ്സമായിരുന്നത്

ആദ്യകാല ജനറേറ്റീവ് വീഡിയോ മോഡലുകൾക്ക് ഏതാനും സെക്കൻഡുകൾ മാത്രം ദൈർഘ്യമുള്ള ആനിമേഷനുകൾ നിർമ്മിക്കാൻ കഴിയുമായിരുന്നു, എന്നാൽ വീഡിയോയുടെ ദൈർഘ്യം കൂട്ടാൻ ശ്രമിച്ചപ്പോൾ രണ്ട് അടിസ്ഥാനപരമായ പോരായ്മകൾ വെളിപ്പെട്ടു. ഒന്നാമതായി, frame-by-frame synthesis സമയക്രമത്തിലുള്ള ബന്ധങ്ങളെ (temporal dependencies) അവഗണിച്ചു, അതിനാൽ തുടക്കത്തിൽ യാഥാർത്ഥ്യബോധമുള്ളതായി തോന്നുന്ന മുഖം ഏതാനും ഫ്രെയിമുകൾക്ക് ശേഷം വികൃതമായി മാറി. രണ്ടാമതായി, മിക്ക പൈപ്പ്‌ലൈനുകളും ശബ്ദത്തെ ഒരു അനുബന്ധ കാര്യമായിട്ടാണ് കണ്ടത്, ഇത് ലിപ്-സിങ്കിംഗിലെ (lip-sync) പൊരുത്തക്കേടുകൾക്കോ തെറ്റായ Foley ഇഫക്റ്റുകൾക്കോ കാരണമായി. ഇത്തരം പ്രശ്നങ്ങൾ brute-force sampling വഴി പരിഹരിക്കാൻ ശ്രമിച്ചപ്പോൾ വീഡിയോയുടെ ദൈർഘ്യം കൂടുന്നതിനനുസരിച്ച് ചിലവ് കുതിച്ചുയരുകയും, ഏതാനും സെക്കൻഡുകൾക്ക് അപ്പുറമുള്ള വീഡിയോകൾ നിർമ്മാതാക്കൾക്ക് പ്രായോഗികമല്ലാതാവുകയും ചെയ്തു.

Wan 3.0-ന്റെ സാങ്കേതിക തൂണുകൾ

  • Causal 3-D VAE – പരമ്പരാഗത VAE-കൾ ഒരു ചിത്രം ഒരു latent code ആയി ചുരുക്കുന്നു. എന്നാൽ Wan-ന്റെ പതിപ്പ് ഒരു മുഴുവൻ വീഡിയോ ക്യൂബിനെയും (height × width × time) ഒരേസമയം ചുരുക്കുന്നു. എൻകോഡറും ഡീകോഡറും ഫ്രെയിമുകളുടെ causal ordering മാനിക്കുന്നതിനാൽ, "അടുത്തത് എന്ത് വരും" എന്നത് latent representation-ൽ തന്നെ രേഖപ്പെടുത്തപ്പെടുന്നു. ഇത് ഡൗൺസ്ട്രീം മോഡ്യൂളുകൾക്ക് ഒറ്റപ്പെട്ട ചിത്രങ്ങൾക്ക് പകരം സമയക്രമം തിരിച്ചറിയുന്ന ഒരു substratum ഉപയോഗിച്ച് പ്രവർത്തിക്കാൻ സഹായിക്കുന്നു.

  • Diffusion Transformers – എൻകോഡിംഗിന് ശേഷം, വീഡിയോ ഒരു വാചകത്തിലെ വാക്കുകളെപ്പോലെ പ്രവർത്തിക്കുന്ന 3-D patches ആയി വിഭജിക്കപ്പെടുന്നു. ഓരോ പാച്ചിനും വേണ്ടിയുള്ള diffusion trajectory ഒരു transformer പ്രവചിക്കുന്നു, ഇതിലൂടെ വസ്തുക്കൾ എങ്ങനെ നീങ്ങുന്നുവെന്നും, വെളിച്ചം എങ്ങനെ മാറുന്നുവെന്നും, ഫ്രെയിമുകൾക്കിടയിൽ കാഴ്ചപ്പാട് (perspective) എങ്ങനെ മാറുന്നുവെന്നും മോഡൽ പഠിക്കുന്നു. ഈ token-based കാഴ്ചപ്പാട് മോഡലിന് സൂക്ഷ്മമായ വിശദാംശങ്ങൾ കൈകാര്യം ചെയ്യുമ്പോൾ തന്നെ ചലനങ്ങളെക്കുറിച്ചുള്ള ഒരു ആഗോള ധാരണ (global sense) നൽകുന്നു.

  • Mixture-of-Experts (MoE) – ഒരു സിംഗിൾ നെറ്റ്‌വർക്കിനെ macro layout-ഉം micro texture-ഉം ഒരേസമയം പഠിക്കാൻ നിർബന്ധിക്കുന്നതിന് പകരം, Wan ആദ്യകാല diffusion ഘട്ടങ്ങളെ സീൻ കോമ്പോസിഷനിലും (scene composition) വലിയ ചലനങ്ങളിലും ശ്രദ്ധ കേന്ദ്രീകരിക്കുന്ന ഒരു "expert"-ലേക്ക് എത്തിക്കുന്നു. പിന്നീട്, ചർമ്മത്തിലെ സുഷിരങ്ങൾ, പ്രതിഫലനങ്ങൾ (reflections), സൂക്ഷ്മമായ നിഴലുകൾ എന്നിവ പരിഷ്കരിക്കുന്നതിനായി രണ്ടാമതൊരു എക്സ്പർട്ടിനെ ഏൽപ്പിക്കുന്നു. ഈ വിഭജനം ഉയർന്ന റെസല്യൂഷൻ ആവശ്യമില്ലാത്ത ജോലികൾക്കായി കമ്പ്യൂട്ടിംഗ് ശേഷി പാഴാകുന്നത് തടയുകയും, inference time നിയന്ത്രിക്കാൻ സഹായിക്കുകയും ചെയ്യുന്നു.

  • Multimodal Conditioning – ടെക്സ്റ്റ് പ്രോംപ്റ്റുകൾ, റഫറൻസ് ഇമേജുകൾ, ചെറിയ വീഡിയോ ക്ലിപ്പുകൾ, ഓഡിയോ ട്രാക്കുകൾ എന്നിവ ഓരോന്നും അവരുടേതായ embedding നിർമ്മിക്കുന്നു. മോഡൽ ഈ എംബഡിംഗുകളെ അവയുടെ വ്യക്തിത്വം നിലനിർത്തിക്കൊണ്ട് തന്നെ സംയോജിപ്പിക്കുന്നു. അതിനാൽ "ഇടത്തോട്ട് നടക്കുക" എന്ന ടെക്സ്റ്റ് നിർദ്ദേശം നൽകിയാൽ അത് കഥാപാത്രത്തിന്റെ മുഖത്തിന്റെ റഫറൻസ് ഇമേജിനെ ഇല്ലാതാക്കില്ല, അതുപോലെ പശ്ചാത്തല സംഗീതം സംഭാഷണങ്ങളെ മറയ്ക്കുകയും ചെയ്യില്ല.

  • Identity and Camera Control – നൽകിയിട്ടുള്ള ഒരു ചിത്രത്തിൽ നിന്നോ ക്ലിപ്പിൽ നിന്നോ വേർതിരിച്ചെടുത്ത റഫറൻസ് ഫീച്ചറുകൾ ജനറേഷൻ സമയമത്രയും ആങ്കറുകളായി (anchors) പ്രവർത്തിക്കുന്നു. വെർച്വൽ ക്യാമറ പാൻ ചെയ്യുമ്പോൾ, സിസ്റ്റം ആ ചലനത്തെ ഒരു post-process filter ആയിട്ടല്ല, മറിച്ച് latent space-ന്റെ ഒരു geometric transformation ആയിട്ടാണ് കാണുന്നത്. ഇത് കാഴ്ചപ്പാടുകളോ വെളിച്ചമോ മാറിയാലും വിഷയത്തിന്റെ (subject) ഐഡന്റിറ്റി സ്ഥിരമായി നിലനിർത്തുന്നു.

  • Audiovisual Sync – ഒരു പ്രത്യേക alignment head, വീഡിയോ സ്ട്രീമിൽ ഓഡിയോ ഇവന്റുകൾ എപ്പോൾ വരണമെന്ന് പ്രവചിക്കുന്നു. കാലടികൾ, കൈയടികൾ അല്ലെങ്കിൽ സംഭാഷണങ്ങൾ എന്നിവ ശബ്ദ തരംഗത്തിന്റെ (sound waveform) ഉച്ചസ്ഥായിയിൽ എത്തുന്ന കൃത്യമായ ഫ്രെയിമുകളിൽ തന്നെ വരുന്നു. ഇത് മാനുവൽ എഡിറ്റിംഗ് ഇല്ലാതെ തന്നെ കാഴ്ചയും ശബ്ദവും തമ്മിൽ കൃത്യമായ പൊരുത്തം ഉണ്ടാക്കുന്നു.

ആർക്കൊക്കെ ഇതിന്റെ ഗുണം ലഭിക്കും

കണ്ടന്റ് ക്രിയേറ്റർമാർക്കും പരസ്യദാതാക്കൾക്കും ഗെയിം ഡെവലപ്പർമാർക്കും ഇനി ഡസൻ കണക്കിന് ചെറിയ ക്ലിപ്പുകൾ കൂട്ടിച്ചേർക്കാതെ തന്നെ ദൈർഘ്യമേറിയ സീക്വൻസുകൾ പ്രോട്ടോടൈപ്പ് ചെയ്യാൻ കഴിയും. MoE ആർക്കിടെക്ചർ അനാവശ്യമായ കമ്പ്യൂട്ടേഷൻ കുറയ്ക്കുന്നതിനാൽ, മുമ്പ് ഹാൻഡ്-ക്രാഫ്റ്റഡ് ആനിമേഷൻ പൈപ്പ്‌ലൈനുകളെ ആശ്രയിച്ചിരുന്ന ഇടത്തരം സ്റ്റുഡിയോകൾക്കും ഇത് താങ്ങാനാവുന്ന ചിലവിൽ ലഭ്യമാണ്. മെഡിക്കൽ ഇമേജിംഗ് അല്ലെങ്കിൽ സയന്റിഫിക് വിഷ്വലൈസേഷൻ പോലുള്ള പ്രത്യേക മേഖലകളിലെ ജോലികൾക്കായി ഗവേഷകർക്ക് causal 3-D VAE-യുടെ റീയൂസബിൾ ആയ latent space ഉപയോഗപ്പെടുത്താനും സാധിക്കും.

പരിമിതികളും തുറന്ന ചോദ്യങ്ങളും

ഈ ആർക്കിടെക്ചറിന്റെ സങ്കീർണ്ണതയ്ക്ക് വലിയൊരു ഹാർഡ്‌വെയർ ചിലവ് ആവശ്യമാണ്: 3-D പാച്ചുകളിൽ ഡിഫ്യൂഷൻ ട്രാൻസ്ഫോർമർ പരിശീലിപ്പിക്കാൻ ഇപ്പോഴും ഹൈ-എൻഡ് ജിപിയുക്കളോ അല്ലെങ്കിൽ പ്രത്യേകമായി രൂപകൽപ്പന ചെയ്ത ആക്സിലറേറ്ററുകളോ ആവശ്യമാണ്. MoE ഇൻഫറൻസ് പാഴാകുന്നത് കുറയ്ക്കുന്നുണ്ടെങ്കിലും, അതിന്റെ റൂട്ടിംഗ് ലോജിക് റിയൽ-ടൈം ആപ്ലിക്കേഷനുകളിൽ പ്രകടമായ ലേറ്റൻസിക്ക് കാരണമായേക്കാം. മൾട്ടിമോഡൽ കണ്ടീഷനിംഗ് ശക്തമാണെങ്കിലും, പ്രോംപ്റ്റുകൾ അവ്യക്തമാകുമ്പോൾ അത് വൈരുദ്ധ്യങ്ങൾ ഉണ്ടാക്കിയേക്കാം; മോഡൽ ഒരു മോഡാലിറ്റിക്ക് മറ്റൊന്നിനേക്കാൾ മുൻഗണന നൽകുന്നത് എഡ്ജ് കേസുകളിൽ നേരിയ ഐഡന്റിറ്റി ഡ്രിഫ്റ്റിന് കാരണമായേക്കാം.

ഒരു വ്യക്തമായ ലോകം സൃഷ്ടിക്കുന്നത് കഥാപരമായ ഏകോപനം ഉറപ്പാക്കില്ലെന്ന് വിമർശകർ ചൂണ്ടിക്കാട്ടുന്നു. Wan 3.0 ദൃശ്യപരവും ശ്രവണപരവുമായ തുടർച്ചയിൽ മികവ് പുലർത്തുന്നുണ്ടെങ്കിലും, സ്റ്റോറി ആർക്കുകൾ, കഥാപാത്രങ്ങളുടെ പ്രേരണകൾ അല്ലെങ്കിൽ കഥയുടെ താളം എന്നിവ അത് ഇതുവരെ മനസ്സിലാക്കിയിട്ടില്ല. കഥപറച്ചിലിന്റെ ഇത്തരം ഉയർന്ന തലത്തിലുള്ള ഘടകങ്ങൾ ഇപ്പോഴും മനുഷ്യരായ എഡിറ്റർമാരുടെ കൈകളിലാണ്.

ഇനി എന്താണ് ശ്രദ്ധിക്കേണ്ടത്

Wan 3.0-ന് പിന്നിലുള്ള ടീം, ഹയരാർക്കിക്കൽ ഡിഫ്യൂഷൻ പരീക്ഷിക്കുന്ന ഒരു വരാനിരിക്കുന്ന പതിപ്പിനെക്കുറിച്ച് സൂചന നൽകിയിട്ടുണ്ട്. ഇത് വിശദാംശങ്ങൾ പരിഷ്കരിക്കുന്നതിന് മുമ്പ് ഒരു ഏകദേശ സ്റ്റോറിബോർഡ് തയ്യാറാക്കാൻ സഹായിക്കും. പ്രശസ്തമായ എഡിറ്റിംഗ് സ്യൂട്ടുകളുമായുള്ള ഇന്റഗ്രേഷനും റോഡ്മാപ്പിലുണ്ട്, ഇത് നിലവിലെ ഗവേഷണ പ്രോട്ടോടൈപ്പിനെ സാങ്കേതിക പരിജ്ഞാനമില്ലാത്ത ഉപയോക്താക്കൾക്കും നേരിട്ട് ഉപയോഗിക്കാവുന്ന ഒരു പ്ലഗ്-ഇനായി മാറ്റിയേക്കാം.

നിലവിലെ റിലീസ് വിവിധ ഹാർഡ്‌വെയറുകളിൽ സ്ഥിരതയുള്ളതാണെന്ന് തെളിഞ്ഞാൽ, പരമ്പരാഗത മോഷൻ-ക്യാപ്ചർ റിഗുകൾ ഒഴിവാക്കി, ഏതാനും റഫറൻസ് ഷോട്ടുകളെയും ഒരു ടെക്സ്റ്റ് സ്ക്രിപ്റ്റിനെയും മാത്രം ആശ്രയിച്ച് പൂർണ്ണമായ രംഗങ്ങൾ നിർമ്മിക്കുന്ന ഒരു ഇൻഡി സ്റ്റുഡിയോകളുടെ പ്രവാഹം നമുക്ക് കാണാൻ കഴിഞ്ഞേക്കും. ഈ സാങ്കേതിക നേട്ടങ്ങൾ പ്രൊഡക്ഷൻ വർക്ക്ഫ്ലോകളിൽ വലിയ മാറ്റം വരുത്തുമോ അതോ ഗവേഷണ സമൂഹത്തിന് മാത്രമുള്ള ഉയർന്ന ചിലവുള്ള ഒരു കൗതുകമായി അവശേഷിക്കുമോ എന്ന് വരും മാസങ്ങളിൽ അറിയാൻ സാധിക്കും.