أصبح بإمكان Wan 3.0 الآن دمج نصف دقيقة من اللقطات المولدة بالذكاء الاصطناعي دون ذوبان وجه الشخصية أو اهتزاز الكاميرا—وهي قفزة تنقل الفيديو التوليدي من مجرد مقاطع قصيرة إلى سرد قصصي قابل للاستخدام.

يعتمد هذا الاختراق على حزمة تقنية مترابطة بإحكام: مشفر تلقائي تبايني ثلاثي الأبعاد سببي (causal 3-D VAE) يعامل الزمان والمكان كحجم واحد، ومحولات تعتمد على الانتشار (diffusion-based transformers) تحول هذا الحجم إلى رموز بقعية (patch-tokens)، وموجه "خليط من الخبراء" (mixture-of-experts router) يفصل بين التخطيط على مستوى المشهد والتحسين على مستوى البكسل. كما يقبل Wan 3.0 النصوص والصور والصوت والفيديو المرجعي كتدفقات شرطية مستقلة، مما يسمح لكل منها بالتأثير على المخرجات دون إلغاء تأثير الآخرين. والنتيجة هي عالم سمعي بصري متماسك حيث يمكن تتبع الشخصية عبر حركة بانورامية (pan)، ويحتفظ المنتج بشكله أثناء الدوران، وتصادف خطوة القدم اللحظة التي يظهر فيها المؤشر الصوتي تماماً.

لماذا كان الفيديو الطويل المولد بالذكاء الاصطناعي يمثل عقبة؟

كانت نماذج الفيديو التوليدية المبكرة قادرة على إنتاج بضع ثوانٍ من الرسوم المتحركة، لكن تمديد الجدول الزمني كشف عن عيبين جوهريين. أولاً، تجاهل التوليف إطاراً بإطار (frame-by-frame synthesis) التبعيات الزمنية، مما أدى إلى تحول الوجه الذي بدا واقعياً في البداية إلى تشوه بعد عدد قليل من الإطارات. ثانياً، تعاملت معظم مسارات العمل مع الصوت كفكرة ثانوية، مما أدى إلى عدم تطابق حركة الشفاه أو وضع تأثيرات "فولي" (Foley effects) في غير مكانها. وأدى إصلاح هذه المشكلات عن طريق أخذ العينات بالقوة الغاشمة (brute-force sampling) إلى انفجار التكاليف مع زيادة الطول، مما جعل أي شيء يتجاوز بضع ثوانٍ غير عملي للمبدعين.

الركائز التقنية لـ Wan 3.0

  • Causal 3-D VAE – تقوم نماذج VAE التقليدية بضغط صورة واحدة في رمز كامن (latent code). أما نسخة Wan، فتضغط مكعب فيديو كاملاً (الارتفاع × العرض × الزمن) دفعة واحدة. ولأن المشفر وفك التشفير يحترمان الترتيب السببي للإطارات، فإن التمثيل الكامن يرمز بالفعل إلى "ما سيأتي لاحقاً"، مما يسمح للوحدات اللاحقة بالعمل مع ركيزة مدركة زمنياً بدلاً من صور معزولة.

  • Diffusion Transformers – بعد التشفير، ينقسم الفيديو إلى بقع ثلاثية الأبعاد (3-D patches) تعمل مثل الكلمات في الجملة. يتنبأ المحول (transformer) بمسار الانتشار لكل بقعة، ويتعلم كيفية تحرك الأشياء، وكيفية تغير الإضاءة، وكيفية تغير المنظور عبر الإطارات. تمنح هذه الرؤية القائمة على الرموز (token-based view) النموذج إحساساً عالمياً بالحركة مع الاستمرار في التعامل مع التفاصيل الدقيقة.

  • Mixture-of-Experts (MoE) – بدلاً من إجبار شبكة واحدة على تعلم كل من التخطيط الكلي (macro layout) والنسيج الدقيق (micro texture)، يقوم Wan بتوجيه خطوات الانتشار المبكرة إلى "خبير" يركز على تكوين المشهد والحركة الواسعة، ثم يسلم الخطوات اللاحقة إلى خبير ثانٍ يقوم بتحسين مسام الجلد والانعكاسات والظلال الدقيقة. يمنع هذا التقسيم هدر العمليات الحسابية في مهام لا تتطلب دقة عالية، مما يحافظ على وقت استدلال (inference time) يمكن التحكم فيه.

  • Multimodal Conditioning – تولد المطالبات النصية، والصور المرجعية، ومقاطع الفيديو القصيرة، والمسارات الصوتية، كل منها تضميناً (embedding) خاصاً بها. يقوم النموذج بدمج هذه التضمينات مع الحفاظ على فرديتها، بحيث لا تؤدي تعليمات نصية مثل "امشِ يساراً" إلى مسح صورة مرجعية مقدمة لوجه الشخصية، ولا يطغى مسار الموسيقى الخلفية على جملة منطوقة.

  • Identity and Camera Control – تعمل الميزات المرجعية المستخرجة من صورة أو مقطع مقدم كمرتكزات طوال عملية التوليد. عندما تتحرك الكاميرا الافتراضية (pan)، يعامل النظام الحركة كتحويل هندسي للمساحة الكامنة بدلاً من كونها مرشحاً (filter) في مرحلة ما بعد المعالجة، مما يحافظ على استقرار هوية الهدف رغم تغير زوايا الرؤية أو الإضاءة.

  • Audiovisual Sync – يتنبأ رأس محاذاة مخصص (alignment head) بموعد ظهور الأحداث الصوتية في تدفق الفيديو. فتأتي خطوات الأقدام أو التصفيق أو إشارات الحوار في الإطارات الدقيقة التي تصل فيها الموجة الصوتية إلى ذروتها، مما ينتج تزامناً وثيقاً بين الرؤية والصوت دون الحاجة إلى تحرير يدوي.

المستفيدون من هذه التقنية

يمكن لصناع المحتوى والمعلنين ومطوري الألعاب الآن إنشاء نماذج أولية لتسلسلات أطول دون الحاجة إلى دمج عشرات المقاطع القصيرة. ولأن بنية MoE تقلل من العمليات الحسابية غير الضرورية، تظل تكلفة الدقيقة المولدة في متناول الاستوديوهات متوسطة الحجم التي كانت تعتمد سابقاً على مسارات عمل الرسوم المتحركة المصنوعة يدوياً. كما يمكن للباحثين ضبط المساحة الكامنة القابلة لإعادة الاستخدام في الـ causal 3-D VAE لمهام محددة مثل التصوير الطبي أو التصور العلمي.

المقايضات والأسئلة المفتوحة

تفرض دقة هذه البنية ضريبة باهظة على الأجهزة: فتدريب محول الانتشار (diffusion transformer) على رقع ثلاثية الأبعاد (3-D patches) لا يزال يتطلب وحدات معالجة رسومية (GPUs) متطورة أو مسرعات متخصصة. تقلل تقنية MoE من هدر عمليات الاستدلال، لكن منطق التوجيه (routing logic) يضيف تأخراً قد يكون ملحوظاً في تطبيقات الوقت الفعلي. وعلى الرغم من قوة التكييف متعدد الوسائط (Multimodal conditioning)، إلا أنه قد يؤدي إلى تضاربات عندما تكون الأوامر (prompts) غامضة؛ فقد يفضل النموذج وسيطاً واحداً على آخر، مما يؤدي إلى انحراف طفيف في الهوية في الحالات الاستثنائية.

كما يشير النقاد إلى أن وجود عالم متماسك لا يضمن تماسكاً سردياً. يتفوق Wan 3.0 في الاستمرارية البصرية والسمعية، لكنه لا يفهم بعد مسارات القصة، أو دوافع الشخصيات، أو وتيرة الأحداث. تظل عناصر السرد القصصي رفيعة المستوى هذه في أيدي المحررين البشر.

ما الذي يجب ترقبه لاحقاً

ألمح الفريق المسؤول عن Wan 3.0 إلى إصدار قادم سيختبر تقنية الانتشار الهرمي (hierarchical diffusion)، مما يسمح بمرور واحد لإعداد لوحة قصة (storyboard) أولية قبل تنقيح التفاصيل. كما يتضمن مخطط العمل التكامل مع مجموعات أدوات التحرير الشهيرة، مما قد يحول النموذج البحثي الحالي إلى إضافة (plug-in) يمكن للمستخدمين غير التقنيين استخدامها مباشرة.

إذا أثبت الإصدار الحالي استقراره عبر مختلف الأجهزة، فقد نشهد موجة من الاستوديوهات المستقلة التي تتجاوز معدات التقاط الحركة التقليدية، وتعتمد بدلاً من ذلك على بضع لقطات مرجعية ونص مكتوب لإنشاء مشاهد كاملة الطول. ستكشف الأشهر القليلة القادمة ما إذا كانت المكاسب التقنية ستترجم إلى تحول في سير عمل الإنتاج، أم ستظل مجرد فضول عالي التكلفة لمجتمع الأبحاث.