Wan 3.0 اکنون می‌تواند نیم دقیقه ویدیو تولید شده توسط هوش مصنوعی را بدون ذوب شدن چهره شخصیت یا لرزش دوربین به هم متصل کند؛ جهشی که ویدیوهای مولد را از کلیپ‌های کوتاه به سمت داستان‌سرایی کاربردی سوق می‌دهد.

این پیشرفت بر پایه یک پشته (stack) به‌هم‌پیوسته استوار است: یک خودرمزگذار واریانسی (VAE) سه‌بعدی علی (causal) که فضا و زمان را به عنوان یک حجم واحد در نظر می‌گیرد، ترنسفورمرهای مبتنی بر انتشار (diffusion-based transformers) که آن حجم را به توکن‌های وصله‌ای (patch-tokens) تبدیل می‌کنند، و یک مسیریاب ترکیب متخصصان (mixture-of-experts router) که برنامه‌ریزی در سطح صحنه را از صیقل‌کاری در سطح پیکسل جدا می‌کند. Wan 3.0 همچنین متن، تصویر، صدا و ویدیو مرجع را به عنوان جریان‌های شرطی (conditioning streams) مستقل می‌پذیرد و اجازه می‌دهد هر کدام بدون بازنویسی دیگری بر خروجی تأثیر بگذارند. نتیجه، یک دنیای صوتی-تصویری منسجم است که در آن می‌توان یک شخصیت را در طول حرکت دوربین (pan) دنبال کرد، یک محصول شکل خود را در حین چرخش حفظ می‌کند و صدای قدم‌ها دقیقاً همزمان با سیگنال صوتی شنیده می‌شود.

چرا ویدیوهای طولانی هوش مصنوعی یک مانع بزرگ بوده‌اند

مدل‌های اولیه ویدیو مولد می‌توانستند چند ثانیه انیمیشن تولید کنند، اما طولانی‌تر کردن بازه زمانی، دو نقص اساسی را آشکار کرد. اول اینکه، سنتز فریم‌به‌فریم وابستگی‌های زمانی را نادیده می‌گرفت، بنابراین چهره‌ای که در ابتدا واقع‌گرایانه به نظر می‌رسید، پس از چند فریم دچار تغییر شکل می‌شد. دوم اینکه، اکثر خطوط تولید (pipelines) با صدا به عنوان یک موضوع فرعی برخورد می‌کردند که منجر به عدم هماهنگی لب‌خوانی (lip-sync) یا قرارگیری نادرست جلوه‌های صوتی (Foley effects) می‌شد. رفع این مشکلات از طریق نمونه‌برداری با قدرت زیاد (brute-force sampling)، باعث می‌شد هزینه‌ها با افزایش طول ویدیو به شدت بالا برود و تولید هر چیزی فراتر از چند ثانیه را برای سازندگان غیرعملی کند.

ستون‌های فنی Wan 3.0

  • Causal 3-D VAE – VAEهای سنتی یک تصویر واحد را به یک کد پنهان (latent code) فشرده می‌کنند. نسخه Wan یک مکعب ویدیویی کامل (ارتفاع × عرض × زمان) را به صورت یکجا فشرده می‌کند. از آنجایی که رمزگذار (encoder) و رمزگشا (decoder) از ترتیب علی (causal ordering) فریم‌ها پیروی می‌کنند، نمایش پنهان از قبل «آنچه در ادامه می‌آید» را رمزگذاری می‌کند و به ماژول‌های پایین‌دستی اجازه می‌دهد به جای تصاویر مجزا، با یک بستر آگاه از زمان کار کنند.

  • Diffusion Transformers – پس از رمزگذاری، ویدیو به وصله‌های سه‌بعدی (3-D patches) تقسیم می‌شود که مانند کلمات در یک جمله عمل می‌کنند. یک ترنسفورمر مسیر انتشار (diffusion trajectory) را برای هر وصله پیش‌بینی می‌کند و یاد می‌گیرد که اشیاء چگونه حرکت می‌کنند، نورپردازی چگونه تغییر می‌کند و پرسپکتیو در طول فریم‌ها چگونه تغییر می‌یابد. این دیدگاه مبتنی بر توکن، به مدل یک درک کلی از حرکت می‌دهد و در عین حال جزئیات دقیق را نیز مدیریت می‌کند.

  • Mixture-of-Experts (MoE) – به جای مجبور کردن یک شبکه واحد برای یادگیری هم‌زمان چیدمان کلان (macro layout) و بافت خرد (micro texture)، Wan مراحل اولیه انتشار را به یک «متخصص» که بر ترکیب‌بندی صحنه و حرکت کلی تمرکز دارد هدایت می‌کند، و سپس مراحل بعدی را به متخصص دومی می‌سپارد که منافذ پوست، بازتاب‌ها و سایه‌های ظریف را اصلاح می‌کند. این تقسیم‌بندی از هدر رفتن محاسبات برای وظایفی که به وضوح بالا نیاز ندارند جلوگیری کرده و زمان استنتاج (inference time) را مدیریت‌پذیر نگه می‌دارد.

  • Multimodal Conditioning – دستورات متنی، تصاویر مرجع، کلیپ‌های ویدیویی کوتاه و ترک‌های صوتی، هر کدام جاسازی (embedding) مخصوص به خود را تولید می‌کنند. مدل این جاسازی‌ها را ضمن حفظ ویژگی‌های فردی آن‌ها با هم ترکیب می‌کند؛ بنابراین یک دستور متنی مانند «به چپ حرکت کن» تصویر مرجع ارائه شده از چهره شخصیت را پاک نمی‌کند و یک موسیقی پس‌زمینه نیز صدای دیالوگ را خفه نمی‌کند.

  • Identity and Camera Control – ویژگی‌های مرجع استخراج شده از یک تصویر یا کلیپ ارائه شده، در طول فرآیند تولید به عنوان لنگر (anchor) عمل می‌کنند. وقتی دوربین مجازی حرکت می‌کند (pan)، سیستم با این حرکت به عنوان یک تبدیل هندسی در فضای پنهان برخورد می‌کند، نه یک فیلتر پس‌پردازش؛ این امر باعث می‌شود هویت سوژه با وجود تغییر زاویه دید یا نورپردازی، پایدار بماند.

  • Audiovisual Sync – یک بخش هم‌ترازسازی (alignment head) اختصاصی پیش‌بینی می‌کند که رویدادهای صوتی چه زمانی باید در جریان ویدیو ظاهر شوند. صدای قدم‌ها، دست زدن یا نشانه‌های دیالوگ دقیقاً در فریم‌هایی قرار می‌گیرند که شکل موج صدا به اوج خود می‌رسد، که این امر باعث ایجاد هماهنگی دقیق بین تصویر و صدا بدون نیاز به ویرایش دستی می‌شود.

چه کسانی از این فناوری بهره‌مند می‌شوند

تولیدکنندگان محتوا، تبلیغ‌کنندگان و توسعه‌دهندگان بازی اکنون می‌توانند بدون نیاز به چسباندن ده‌ها کلیپ کوتاه، نمونه‌های اولیه از سکانس‌های طولانی‌تر را بسازند. از آنجایی که معماری MoE محاسبات غیرضروری را کاهش می‌دهد، هزینه تولید هر دقیقه ویدیو در دسترس استودیوهای متوسطی قرار می‌گیرد که پیش از این به خطوط تولید انیمیشن دستی متکی بودند. پژوهشگران نیز می‌توانند فضای پنهان قابل استفاده مجدد در Causal 3-D VAE را برای وظایف تخصصی مانند تصویربرداری پزشکی یا تجسم علمی تنظیم دقیق (fine-tune) کنند.

موازنه‌ها و پرسش‌های بی‌پاسخ

پیچیدگی این معماری با هزینه‌ای سخت‌افزاری همراه است: آموزش diffusion transformer روی پچ‌های سه‌بعدی همچنان نیازمند GPUهای رده‌بالا یا شتاب‌دهنده‌های تخصصی است. MoE میزان اتلاف در استنتاج را کاهش می‌دهد، اما منطق مسیریابی باعث ایجاد تأخیری می‌شود که ممکن است در کاربردهای بلادرنگ محسوس باشد. شرطی‌سازی چندوجهی (Multimodal conditioning)، با وجود قدرتمند بودن، می‌تواند در صورت مبهم بودن پرامپت‌ها باعث ایجاد تداخل شود؛ مدل ممکن است یک وجه (modality) را بر وجه دیگر ترجیح دهد که منجر به انحراف ظریف هویت در حالات مرزی (edge cases) می‌شود.

منتقدان همچنین خاطرنشان می‌کنند که یک دنیای منسجم، تضمین‌کننده انسجام روایی نیست. Wan 3.0 در تداوم بصری و شنیداری عملکرد درخشانی دارد، اما هنوز قوس‌های داستانی، انگیزه شخصیت یا ضرب‌آهنگ را درک نمی‌کند. این عناصر سطح بالاترِ داستان‌سرایی همچنان در اختیار تدوین‌گران انسانی باقی می‌ماند.

آنچه در آینده باید منتظر آن بود

تیم سازنده Wan 3.0 به نسخه آتی خود اشاره کرده است که قرار است با انتشار سلسله‌مراتبی (hierarchical diffusion) آزمایش کند؛ به گونه‌ای که یک مرحله پردازش اجازه می‌دهد پیش از پرداختن به جزئیات، یک استوری‌بورد اولیه شکل بگیرد. یکپارچه‌سازی با نرم‌افزارهای ویرایش محبوب نیز در نقشه راه قرار دارد، که می‌تواند نمونه اولیه پژوهشی فعلی را به پلاگینی تبدیل کند که کاربران غیرفنی بتوانند مستقیماً از آن استفاده کنند.

اگر نسخه فعلی در سخت‌افزارهای مختلف پایدار باشد، ممکن است شاهد موجی از استودیوهای مستقل باشیم که تجهیزات سنتی ضبط حرکت (motion-capture) را کنار گذاشته و در عوض برای تولید صحنه‌های کامل، تنها به چند نمای مرجع و یک فیلم‌نامه متنی تکیه می‌کنند. چند ماه آینده مشخص خواهد کرد که آیا دستاوردهای فنی به تغییری در جریان‌های کاری تولید منجر می‌شود یا صرفاً به عنوان یک کنجکاوی پرهزینه برای جامعه پژوهشی باقی می‌ماند.