Wan 3.0 สามารถสร้างฟุตเทจที่สร้างโดย AI ต่อเนื่องกันได้นานถึงครึ่งนาที โดยที่ใบหน้าของตัวละครไม่บิดเบี้ยวหรือกล้องไม่สั่นไหว ซึ่งถือเป็นก้าวกระโดดที่ผลักดันวิดีโอแบบ Generative จากเพียงคลิปสั้นๆ ไปสู่การเล่าเรื่องที่ใช้งานได้จริง

ความสำเร็จครั้งนี้ตั้งอยู่บนโครงสร้างที่เชื่อมโยงกันอย่างแน่นหนา ได้แก่ causal 3-D variational auto-encoder (VAE) ที่จัดการพื้นที่และเวลาเสมือนเป็นปริมาตรเดียว, diffusion-based transformers ที่เปลี่ยนปริมาตรนั้นให้เป็น patch-tokens และ mixture-of-experts router ที่แยกการวางแผนระดับฉากออกจากความละเอียดประณีตระดับพิกเซล นอกจากนี้ Wan 3.0 ยังรองรับข้อความ รูปภาพ เสียง และวิดีโออ้างอิง ในฐานะกระแสข้อมูลเงื่อนไข (conditioning streams) ที่เป็นอิสระต่อกัน ทำให้แต่ละส่วนสามารถส่งผลต่อผลลัพธ์ได้โดยไม่ไปทับซ้อนกัน ผลลัพธ์ที่ได้คือโลกภาพและเสียงที่มีความสอดคล้องกัน โดยที่สามารถติดตามตัวละครผ่านการแพนกล้องได้ ผลิตภัณฑ์ยังคงรูปทรงเดิมแม้จะถูกหมุน และเสียงฝีเท้าจะเกิดขึ้นตรงกับจังหวะเสียงที่ได้ยินพอดี

ทำไมวิดีโอ AI แบบยาวจึงเป็นอุปสรรคสำคัญที่ผ่านมา

โมเดลวิดีโอแบบ Generative ในยุคแรกสามารถสร้างแอนิเมชันสั้นๆ เพียงไม่กี่วินาทีได้ แต่เมื่อพยายามขยายระยะเวลาออกไป กลับพบข้อบกพร่องพื้นฐานสองประการ ประการแรก การสังเคราะห์แบบเฟรมต่อเฟรมไม่ได้คำนึงถึงความสัมพันธ์เชิงเวลา (temporal dependencies) ทำให้ใบหน้าที่ดูสมจริงในตอนแรกเริ่มบิดเบี้ยวหลังจากผ่านไปเพียงไม่กี่เฟรม ประการที่สอง กระบวนการส่วนใหญ่ถือว่าเสียงเป็นเพียงส่วนเสริม ทำให้การขยับปาก (lip-sync) ไม่ตรงกับเสียง หรือเอฟเฟกต์เสียงประกอบ (Foley effects) วางผิดจังหวะ การแก้ไขปัญหาเหล่านี้ด้วยการสุ่มตัวอย่างแบบ brute-force ทำให้ต้นทุนพุ่งสูงขึ้นตามความยาวของวิดีโอ ส่งผลให้การสร้างวิดีโอที่ยาวเกินไม่กี่วินาทีนั้นไม่คุ้มค่าสำหรับผู้สร้าง

เสาหลักทางเทคนิคของ Wan 3.0

  • Causal 3-D VAE – VAE แบบดั้งเดิมจะบีบอัดรูปภาพเดี่ยวให้เป็น latent code แต่เวอร์ชันของ Wan จะบีบอัดวิดีโอทั้งก้อน (ความสูง × ความกว้าง × เวลา) ในคราวเดียว เนื่องจาก encoder และ decoder เคารพลำดับเหตุการณ์ (causal ordering) ของเฟรม ทำให้การแทนค่าแบบ latent มีการเข้ารหัส "สิ่งที่จะเกิดขึ้นต่อไป" ไว้แล้ว ช่วยให้โมดูลในขั้นตอนถัดไปสามารถทำงานบนโครงสร้างที่รับรู้ถึงมิติเวลา แทนที่จะเป็นเพียงภาพที่แยกจากกัน

  • Diffusion Transformers – หลังจากการเข้ารหัส วิดีโอจะถูกแบ่งออกเป็น 3-D patches ซึ่งทำหน้าที่เหมือนคำในประโยค โดย transformer จะทำนายวิถีการแพร่กระจาย (diffusion trajectory) ของแต่ละ patch เรียนรู้วิธีที่วัตถุเคลื่อนที่ การเปลี่ยนแปลงของแสง และการเปลี่ยนมุมมองในแต่ละเฟรม มุมมองแบบอิงตาม token นี้ช่วยให้โมเดลรับรู้การเคลื่อนไหวในภาพรวม (global sense of motion) ในขณะที่ยังคงจัดการรายละเอียดที่ซับซ้อนได้

  • Mixture-of-Experts (MoE) – แทนที่จะบังคับให้เครือข่ายเดียวต้องเรียนรู้ทั้งโครงสร้างระดับมหภาค (macro layout) และพื้นผิวระดับจุลภาค (micro texture) Wan จะส่งขั้นตอนการ diffusion ในช่วงแรกไปยัง "ผู้เชี่ยวชาญ" (expert) ที่เน้นการจัดองค์ประกอบฉากและการเคลื่อนไหวในวงกว้าง จากนั้นจึงส่งต่อขั้นตอนหลังๆ ให้กับผู้เชี่ยวชาญคนที่สองเพื่อขัดเกลารูขุมขน การสะท้อน และเงาที่ละเอียดอ่อน การแบ่งงานแบบนี้ช่วยป้องกันการสิ้นเปลืองทรัพยากรคำนวณในงานที่ไม่ต้องการความละเอียดสูง ทำให้เวลาในการประมวลผล (inference time) อยู่ในระดับที่จัดการได้

  • Multimodal Conditioning – ทั้งคำสั่งข้อความ (text prompts), รูปภาพอ้างอิง, คลิปวิดีโอสั้น และแทร็กเสียง ต่างสร้าง embedding ของตนเองขึ้นมา โมเดลจะหลอมรวม embedding เหล่านี้เข้าด้วยกันโดยยังคงเอกลักษณ์ของแต่ละส่วนไว้ ดังนั้นคำสั่งข้อความว่า “walk left” จะไม่ไปลบภาพใบหน้าตัวละครที่ให้มาเป็นภาพอ้างอิง และเพลงประกอบก็จะไม่ไปกลบเสียงพูด

  • Identity and Camera Control – คุณลักษณะอ้างอิง (reference features) ที่สกัดมาจากรูปภาพหรือคลิปที่ให้มาจะทำหน้าที่เป็นจุดยึด (anchors) ตลอดกระบวนการสร้าง เมื่อกล้องเสมือนแพนไป ระบบจะจัดการการเคลื่อนไหวในฐานะการแปลงทางเรขาคณิต (geometric transformation) ของ latent space แทนที่จะเป็นเพียงฟิลเตอร์หลังการประมวลผล ช่วยรักษาอัตลักษณ์ของตัวละครให้คงที่แม้จะมีการเปลี่ยนมุมมองหรือแสงไฟ

  • Audiovisual Sync – ส่วนประมวลผลการจัดวาง (alignment head) ที่ออกแบบมาโดยเฉพาะจะทำนายว่าเหตุการณ์ทางเสียงควรปรากฏขึ้นเมื่อใดในวิดีโอ เสียงฝีเท้า เสียงตบมือ หรือจังหวะการพูด จะตรงกับเฟรมที่คลื่นเสียงพุ่งขึ้นสูงสุดพอดี ทำให้ภาพและเสียงสอดประสานกันอย่างแนบแน่นโดยไม่ต้องตัดต่อด้วยมือ

ใครจะได้รับประโยชน์

ผู้สร้างคอนเทนต์ นักโฆษณา และนักพัฒนาเกม สามารถสร้างต้นแบบลำดับภาพที่ยาวขึ้นได้โดยไม่ต้องนำคลิปสั้นๆ หลายสิบคลิปมาต่อกัน เนื่องจากสถาปัตยกรรม MoE ช่วยลดการคำนวณที่ไม่จำเป็น ต้นทุนต่อนาทีของวิดีโอที่สร้างขึ้นจึงอยู่ในระดับที่สตูดิโอขนาดกลางที่เคยพึ่งพากระบวนการทำแอนิเมชันแบบดั้งเดิมสามารถเข้าถึงได้ นอกจากนี้ นักวิจัยยังสามารถปรับจูน (fine-tune) พื้นที่ latent ที่นำกลับมาใช้ใหม่ได้ของ causal 3-D VAE สำหรับงานเฉพาะทาง เช่น การสร้างภาพทางการแพทย์หรือการจำลองภาพทางวิทยาศาสตร์

ข้อแลกเปลี่ยนและคำถามที่ยังคงค้างอยู่

ความซับซ้อนของสถาปัตยกรรมนี้ต้องแลกมาด้วยต้นทุนด้านฮาร์ดแวร์: การฝึกฝน diffusion transformer บน 3-D patches ยังคงต้องใช้ GPU ระดับไฮเอนด์หรือตัวเร่งความเร็วเฉพาะทาง MoE ช่วยลดความสิ้นเปลืองในการทำ inference แต่ตรรกะการทำ routing ก็เพิ่มความหน่วง (latency) ที่อาจสังเกตเห็นได้ในการใช้งานแบบเรียลไทม์ แม้ว่า multimodal conditioning จะทรงพลัง แต่ก็อาจทำให้เกิดความขัดแย้งได้เมื่อ prompt มีความคลุมเครือ โดยโมเดลอาจให้ความสำคัญกับ modality หนึ่งมากกว่าอีก modality หนึ่ง ซึ่งนำไปสู่การเปลี่ยนแปลงอัตลักษณ์ (identity drift) เล็กน้อยในกรณีที่เป็น edge cases

นักวิจารณ์ยังตั้งข้อสังเกตว่า โลกที่ดูสอดคล้องกันนั้นไม่ได้การันตีความต่อเนื่องของเนื้อเรื่อง (narrative coherence) Wan 3.0 ทำได้ดีเยี่ยมในด้านความต่อเนื่องทางภาพและเสียง แต่ยังไม่เข้าใจโครงสร้างเรื่องราว (story arcs) แรงจูงใจของตัวละคร หรือจังหวะการดำเนินเรื่อง (pacing) องค์ประกอบการเล่าเรื่องในระดับที่สูงกว่าเหล่านี้ยังคงต้องพึ่งพาบรรณาธิการที่เป็นมนุษย์

สิ่งที่น่าจับตามองต่อไป

ทีมผู้พัฒนา Wan 3.0 ได้บอกใบ้ถึงเวอร์ชันที่จะตามมา ซึ่งจะมีการทดลองใช้ hierarchical diffusion เพื่อช่วยให้การประมวลผลเพียงรอบเดียว (single pass) สามารถสร้างสตอรี่บอร์ดคร่าวๆ ก่อนที่จะขัดเกลารายละเอียดให้สมบูรณ์ การรวมเข้ากับโปรแกรมตัดต่อยอดนิยมก็อยู่ในแผนงาน (roadmap) เช่นกัน ซึ่งอาจเปลี่ยนจากต้นแบบงานวิจัยในปัจจุบันให้กลายเป็นปลั๊กอินที่ผู้ใช้ทั่วไปที่ไม่ใช่สายเทคนิคสามารถใช้งานได้โดยตรง

หากเวอร์ชันปัจจุบันพิสูจน์ได้ว่ามีความเสถียรบนฮาร์ดแวร์ที่หลากหลาย เราอาจได้เห็นคลื่นสตูดิโออิสระที่ข้ามขั้นตอนการใช้ชุดอุปกรณ์ motion-capture แบบดั้งเดิม โดยหันไปพึ่งพาเพียงภาพอ้างอิงไม่กี่ช็อตและบทเขียนเพื่อสร้างฉากที่มีความยาวเต็มรูปแบบแทน ในอีกไม่กี่เดือนข้างหน้า จะเป็นตัวบ่งชี้ว่าความก้าวหน้าทางเทคนิคนี้จะนำไปสู่การเปลี่ยนแปลงในกระบวนการทำงาน (workflow) ของการผลิต หรือจะเป็นเพียงสิ่งที่น่าสนใจแต่มีต้นทุนสูงสำหรับชุมชนนักวิจัยเท่านั้น