Wan 3.0 יכול כעת לחבר יחד חצי דקה של פוטאז שנוצר על ידי בינה מלאכותית מבלי שפני הדמות יימסו או שהמצלמה תרעד – קפיצת מדרגה שדוחפת את הווידאו הגנרטיבי מסרטונים קצרים לסיפור סיפורים (storytelling) שמיש.

הפריצה מבוססת על מחסנית (stack) המקושרת היטב: causal 3-D variational auto-encoder (VAE) המתייחס למרחב ולזמן כנפח אחד, diffusion-based transformers שהופכים את הנפח הזה ל-patch-tokens, ו-mixture-of-experts router שמפריד בין תכנון ברמת הסצנה לבין ליטוש ברמת הפיקסל. Wan 3.0 מקבל גם טקסט, תמונות, אודיו ווידאו ייחוס כזרמי התניה (conditioning streams) עצמאיים, מה שמאפשר לכל אחד להשפיע על הפלט מבלי לדרוס את האחרים. התוצאה היא עולם אודיו-ויזואלי קוהרנטי שבו ניתן לעקוב אחר דמות במהלך פניית מצלמה (pan), מוצר שומר על צורתו במהלך סיבוב, וצעד נשמע בדיוק ברגע שבו מופיע הרמז הקולי.

מדוע וידאו AI ארוך היה מכשול משמעותי

מודלים מוקדמים של וידאו גנרטיבי יכלו להפיק כמה שניות של אנימציה, אך הארכת ציר הזמן חשפה שני פגמים בסיסיים. ראשית, סינתזה מסגרת-אחרי-מסגרת (frame-by-frame) התעלמה מתלות זמנית (temporal dependencies), כך שפנים שהתחילו להיראות ריאליסטיות נטו לעיוות לאחר מספר מסגרות בודדות. שנית, רוב תהליכי העבודה (pipelines) התייחסו לסאונד כאל מחשבה מאוחרת, מה שהוביל לסנכרון שפתיים לקוי או לאפקטים של Foley שאינם במקום. תיקון בעיות אלו באמצעות דגימה בכוח גס (brute-force sampling) גרם לעלויות לזנק ככל שהאורך גדל, מה שהפך כל דבר מעבר לכמה שניות לבלתי מעשי עבור יוצרים.

עמודי התווך הטכניים של Wan 3.0

  • Causal 3-D VAE – מודלי VAE מסורתיים דוחסים תמונה בודדת לקוד חבוי (latent code). הגרסה של Wan דוחסת קוביית וידאו שלמה (גובה × רוחב × זמן) בבת אחת. מכיוון שהמקודד (encoder) והמפענח (decoder) מכבדים את הסדר הסיבתי (causal ordering) של המסגרות, הייצוג החבוי כבר מקודד את "מה יבוא אחר כך", מה שמאפשר למודולים הבאים לעבוד עם תשתית מודעת-זמן במקום תמונות מבודדות.

  • Diffusion Transformers – לאחר הקידוד, הווידאו מתחלק לכתמים (patches) תלת-ממדיים שמתפקדים כמו מילים במשפט. Transformer חוזה את מסלול הדיפוזיה (diffusion trajectory) עבור כל patch, ולומד כיצד אובייקטים נעים, כיצד התאורה משתנה וכיצד הפרספקטיבה משתנה לאורך המסגרות. מבט מבוסס-token זה מעניק למודל תחושה גלובלית של תנועה תוך שהוא עדיין מטפל בפרטים עדינים.

  • Mixture-of-Experts (MoE) – במקום לאלץ רשת אחת ללמוד גם פריסה מאקרוסקופית וגם טקסטורה מיקרוסקופית, Wan מפנה שלבי דיפוזיה מוקדמים ל"מומחה" המתמקד בקומפוזיציה של הסצנה ובתנועה רחבה, ואז מעביר את השלבים המאוחרים יותר למומחה שני המלטש נקבוביות עור, השתקפויות וצללים עדינים. הפיצול מונע בזבוז של כוח מחשוב על משימות שאינן זקוקות לרזולוציה גבוהה, ושומר על זמן הסקה (inference time) בר השגה.

  • Multimodal Conditioning – הנחיות טקסט (prompts), תמונות ייחוס, קטעי וידאו קצרים וערוצי אודיו יוצרים כל אחד את ה-embedding שלו. המודל ממזג את ה-embeddings הללו תוך שמירה על הייחודיות שלהם, כך שהוראה טקסטואלית ל"ללכת שמאלה" לא תמחק תמונת ייחוס שסופקה של פני הדמות, ורצועת מוזיקת רקע לא תטשטש דיאלוג מדובר.

  • Identity and Camera Control – מאפייני ייחוס המופקים מתמונה או קליפ שסופקו משמשים כעוגנים לאורך כל תהליך היצירה. כאשר המצלמה הווירטואלית מבצעת pan, המערכת מתייחסת לתנועה כאל טרנספורמציה גיאומטרית של המרחב החבוי (latent space) ולא כאל פילטר של עיבוד-לאחר (post-process), מה ששומר על יציבות הזהות של הנושא למרות שינויים בזווית הצפייה או בתאורה.

  • Audiovisual Sync – יחידת יישור (alignment head) ייעודית חוזה מתי אירועי אודיו צריכים להופיע בזרם הווידאו. צעדים, מחיאות כפיים או רמזי דיאלוג מופיעים בדיוק במסגרות שבהן גל הקול מגיע לשיא, מה שיוצר סנכרון הדוק בין ראייה לצליל ללא צורך בעריכה ידנית.

מי עומד להרוויח

יוצרי תוכן, מפרסמים ומפתחי משחקים יכולים כעת ליצור אבות-טיפוס לרצפים ארוכים יותר מבלי לחבר עשרות קטעי וידאו קצרים. מכיוון שארכיטקטורת ה-MoE מצמצמת חישובים מיותרים, העלות לכל דקה שנוצרת נשארת נגישה עבור אולפנים בינוניים שבעבר הסתמכו על תהליכי אנימציה בעבודת יד. חוקרים יכולים גם לבצע כוונון עדין (fine-tune) למרחב החבוי הניתן לשימוש חוזר של ה-causal 3-D VAE עבור משימות ספציפיות לתחום, כגון דימות רפואי או ויזואליזציה מדעית.

הפשרות והשאלות הפתוחות

The architecture’s sophistication carries a hardware price tag: training the diffusion transformer on 3-D patches still demands high-end GPUs or specialized accelerators. MoE reduces inference waste, but the routing logic adds latency that may be noticeable in real-time applications. Multimodal conditioning, though powerful, can produce conflicts when prompts are ambiguous; the model may favor one modality over another, leading to subtle identity drift in edge cases.

Critics also note that a coherent world does not guarantee narrative coherence. Wan 3.0 excels at visual and auditory continuity, but it does not yet understand story arcs, character motivation or pacing. Those higher-level storytelling elements remain in the hands of human editors.

What to watch next

The team behind Wan 3.0 has hinted at a forthcoming version that will experiment with hierarchical diffusion, allowing a single pass to set up a rough storyboard before refining details. Integration with popular editing suites also sits on the roadmap, which could turn the current research prototype into a plug-in that non-technical users can wield directly.

If the current release proves stable across varied hardware, we may see a wave of indie studios bypass traditional motion-capture rigs, relying instead on a few reference shots and a textual script to generate full-length scenes. The next few months will reveal whether the technical gains translate into a shift in production workflows or remain a high-cost curiosity for the research community.