Wan 3.0 اکنون میتواند نیم دقیقه ویدیو تولید شده توسط هوش مصنوعی را بدون ذوب شدن چهره شخصیت یا لرزش دوربین به هم متصل کند؛ جهشی که ویدیوهای مولد را از کلیپهای کوتاه به سمت داستانسرایی کاربردی سوق میدهد.
این پیشرفت بر پایه یک پشته (stack) بههمپیوسته استوار است: یک خودرمزگذار واریانسی (VAE) سهبعدی علی (causal) که فضا و زمان را به عنوان یک حجم واحد در نظر میگیرد، ترنسفورمرهای مبتنی بر انتشار (diffusion-based transformers) که آن حجم را به توکنهای وصلهای (patch-tokens) تبدیل میکنند، و یک مسیریاب ترکیب متخصصان (mixture-of-experts router) که برنامهریزی در سطح صحنه را از صیقلکاری در سطح پیکسل جدا میکند. Wan 3.0 همچنین متن، تصویر، صدا و ویدیو مرجع را به عنوان جریانهای شرطی (conditioning streams) مستقل میپذیرد و اجازه میدهد هر کدام بدون بازنویسی دیگری بر خروجی تأثیر بگذارند. نتیجه، یک دنیای صوتی-تصویری منسجم است که در آن میتوان یک شخصیت را در طول حرکت دوربین (pan) دنبال کرد، یک محصول شکل خود را در حین چرخش حفظ میکند و صدای قدمها دقیقاً همزمان با سیگنال صوتی شنیده میشود.
چرا ویدیوهای طولانی هوش مصنوعی یک مانع بزرگ بودهاند
مدلهای اولیه ویدیو مولد میتوانستند چند ثانیه انیمیشن تولید کنند، اما طولانیتر کردن بازه زمانی، دو نقص اساسی را آشکار کرد. اول اینکه، سنتز فریمبهفریم وابستگیهای زمانی را نادیده میگرفت، بنابراین چهرهای که در ابتدا واقعگرایانه به نظر میرسید، پس از چند فریم دچار تغییر شکل میشد. دوم اینکه، اکثر خطوط تولید (pipelines) با صدا به عنوان یک موضوع فرعی برخورد میکردند که منجر به عدم هماهنگی لبخوانی (lip-sync) یا قرارگیری نادرست جلوههای صوتی (Foley effects) میشد. رفع این مشکلات از طریق نمونهبرداری با قدرت زیاد (brute-force sampling)، باعث میشد هزینهها با افزایش طول ویدیو به شدت بالا برود و تولید هر چیزی فراتر از چند ثانیه را برای سازندگان غیرعملی کند.
ستونهای فنی Wan 3.0
Causal 3-D VAE – VAEهای سنتی یک تصویر واحد را به یک کد پنهان (latent code) فشرده میکنند. نسخه Wan یک مکعب ویدیویی کامل (ارتفاع × عرض × زمان) را به صورت یکجا فشرده میکند. از آنجایی که رمزگذار (encoder) و رمزگشا (decoder) از ترتیب علی (causal ordering) فریمها پیروی میکنند، نمایش پنهان از قبل «آنچه در ادامه میآید» را رمزگذاری میکند و به ماژولهای پاییندستی اجازه میدهد به جای تصاویر مجزا، با یک بستر آگاه از زمان کار کنند.
Diffusion Transformers – پس از رمزگذاری، ویدیو به وصلههای سهبعدی (3-D patches) تقسیم میشود که مانند کلمات در یک جمله عمل میکنند. یک ترنسفورمر مسیر انتشار (diffusion trajectory) را برای هر وصله پیشبینی میکند و یاد میگیرد که اشیاء چگونه حرکت میکنند، نورپردازی چگونه تغییر میکند و پرسپکتیو در طول فریمها چگونه تغییر مییابد. این دیدگاه مبتنی بر توکن، به مدل یک درک کلی از حرکت میدهد و در عین حال جزئیات دقیق را نیز مدیریت میکند.
Mixture-of-Experts (MoE) – به جای مجبور کردن یک شبکه واحد برای یادگیری همزمان چیدمان کلان (macro layout) و بافت خرد (micro texture)، Wan مراحل اولیه انتشار را به یک «متخصص» که بر ترکیببندی صحنه و حرکت کلی تمرکز دارد هدایت میکند، و سپس مراحل بعدی را به متخصص دومی میسپارد که منافذ پوست، بازتابها و سایههای ظریف را اصلاح میکند. این تقسیمبندی از هدر رفتن محاسبات برای وظایفی که به وضوح بالا نیاز ندارند جلوگیری کرده و زمان استنتاج (inference time) را مدیریتپذیر نگه میدارد.
Multimodal Conditioning – دستورات متنی، تصاویر مرجع، کلیپهای ویدیویی کوتاه و ترکهای صوتی، هر کدام جاسازی (embedding) مخصوص به خود را تولید میکنند. مدل این جاسازیها را ضمن حفظ ویژگیهای فردی آنها با هم ترکیب میکند؛ بنابراین یک دستور متنی مانند «به چپ حرکت کن» تصویر مرجع ارائه شده از چهره شخصیت را پاک نمیکند و یک موسیقی پسزمینه نیز صدای دیالوگ را خفه نمیکند.
Identity and Camera Control – ویژگیهای مرجع استخراج شده از یک تصویر یا کلیپ ارائه شده، در طول فرآیند تولید به عنوان لنگر (anchor) عمل میکنند. وقتی دوربین مجازی حرکت میکند (pan)، سیستم با این حرکت به عنوان یک تبدیل هندسی در فضای پنهان برخورد میکند، نه یک فیلتر پسپردازش؛ این امر باعث میشود هویت سوژه با وجود تغییر زاویه دید یا نورپردازی، پایدار بماند.
Audiovisual Sync – یک بخش همترازسازی (alignment head) اختصاصی پیشبینی میکند که رویدادهای صوتی چه زمانی باید در جریان ویدیو ظاهر شوند. صدای قدمها، دست زدن یا نشانههای دیالوگ دقیقاً در فریمهایی قرار میگیرند که شکل موج صدا به اوج خود میرسد، که این امر باعث ایجاد هماهنگی دقیق بین تصویر و صدا بدون نیاز به ویرایش دستی میشود.
چه کسانی از این فناوری بهرهمند میشوند
تولیدکنندگان محتوا، تبلیغکنندگان و توسعهدهندگان بازی اکنون میتوانند بدون نیاز به چسباندن دهها کلیپ کوتاه، نمونههای اولیه از سکانسهای طولانیتر را بسازند. از آنجایی که معماری MoE محاسبات غیرضروری را کاهش میدهد، هزینه تولید هر دقیقه ویدیو در دسترس استودیوهای متوسطی قرار میگیرد که پیش از این به خطوط تولید انیمیشن دستی متکی بودند. پژوهشگران نیز میتوانند فضای پنهان قابل استفاده مجدد در Causal 3-D VAE را برای وظایف تخصصی مانند تصویربرداری پزشکی یا تجسم علمی تنظیم دقیق (fine-tune) کنند.
موازنهها و پرسشهای بیپاسخ
پیچیدگی این معماری با هزینهای سختافزاری همراه است: آموزش diffusion transformer روی پچهای سهبعدی همچنان نیازمند GPUهای ردهبالا یا شتابدهندههای تخصصی است. MoE میزان اتلاف در استنتاج را کاهش میدهد، اما منطق مسیریابی باعث ایجاد تأخیری میشود که ممکن است در کاربردهای بلادرنگ محسوس باشد. شرطیسازی چندوجهی (Multimodal conditioning)، با وجود قدرتمند بودن، میتواند در صورت مبهم بودن پرامپتها باعث ایجاد تداخل شود؛ مدل ممکن است یک وجه (modality) را بر وجه دیگر ترجیح دهد که منجر به انحراف ظریف هویت در حالات مرزی (edge cases) میشود.
منتقدان همچنین خاطرنشان میکنند که یک دنیای منسجم، تضمینکننده انسجام روایی نیست. Wan 3.0 در تداوم بصری و شنیداری عملکرد درخشانی دارد، اما هنوز قوسهای داستانی، انگیزه شخصیت یا ضربآهنگ را درک نمیکند. این عناصر سطح بالاترِ داستانسرایی همچنان در اختیار تدوینگران انسانی باقی میماند.
آنچه در آینده باید منتظر آن بود
تیم سازنده Wan 3.0 به نسخه آتی خود اشاره کرده است که قرار است با انتشار سلسلهمراتبی (hierarchical diffusion) آزمایش کند؛ به گونهای که یک مرحله پردازش اجازه میدهد پیش از پرداختن به جزئیات، یک استوریبورد اولیه شکل بگیرد. یکپارچهسازی با نرمافزارهای ویرایش محبوب نیز در نقشه راه قرار دارد، که میتواند نمونه اولیه پژوهشی فعلی را به پلاگینی تبدیل کند که کاربران غیرفنی بتوانند مستقیماً از آن استفاده کنند.
اگر نسخه فعلی در سختافزارهای مختلف پایدار باشد، ممکن است شاهد موجی از استودیوهای مستقل باشیم که تجهیزات سنتی ضبط حرکت (motion-capture) را کنار گذاشته و در عوض برای تولید صحنههای کامل، تنها به چند نمای مرجع و یک فیلمنامه متنی تکیه میکنند. چند ماه آینده مشخص خواهد کرد که آیا دستاوردهای فنی به تغییری در جریانهای کاری تولید منجر میشود یا صرفاً به عنوان یک کنجکاوی پرهزینه برای جامعه پژوهشی باقی میماند.
