นักวิจัยได้เปิดตัว GraphVid ซึ่งเป็นระบบสร้างวิดีโอที่สามารถลดค่า Fréchet Inception Distance ลงได้ 39.9% และลดค่า Fréchet Video Distance ลงได้ 37.6% เมื่อเทียบกับโมเดลรุ่นก่อนหน้า การเพิ่มขึ้นของความสมจริงและความแม่นยำในการเคลื่อนไหว (motion fidelity) นี้มีความสำคัญอย่างยิ่งต่อผู้ที่สร้างโปรแกรมจำลองหุ่นยนต์ (robotics simulators), ชุดฝึกฝนการขับขี่อัตโนมัติ (autonomous-driving training suites) หรือแอนิเมชันที่สร้างด้วยคอมพิวเตอร์

ข้อจำกัดของวิธีการในปัจจุบัน

เครื่องมือสร้างวิดีโอแบบควบคุมได้ (controllable video generators) ในปัจจุบันอาศัยอินพุตสองรูปแบบ ข้อความสั่งการ (Text prompts) ให้คำอธิบายที่คลุมเครือและไม่สามารถระบุเส้นทางที่แน่นอนของวัตถุได้ ส่วนเครื่องมือสร้างเส้นทางการเคลื่อนที่ (Trajectory tools) บังคับให้ผู้ใช้ต้องวาดเส้นทางในระดับพิกเซลสำหรับตัวละครทุกตัว ซึ่งมักจะล้มเหลวเมื่อฉากนั้นมีวัตถุหลายอย่างที่มีปฏิสัมพันธ์กันหรือมีการบดบังกัน (occlusions) ส่งผลให้วิศวกรต้องเสียเวลาไปกับการแก้ไขเส้นทางที่ผิดพลาดบ่อยครั้ง มากกว่าการสร้างการเคลื่อนไหวตามที่ตั้งใจไว้

แนวทางแบบ interaction-graph ของ GraphVid

GraphVid เปลี่ยนจากการวาดเส้นทางด้วยมือมาเป็นการใช้กราฟปฏิสัมพันธ์ระดับสูง (high-level interaction graph) แทนที่จะต้องกำหนดพิกเซลแต่ละจุด ผู้ใช้เพียงแค่กำหนดความสัมพันธ์ เช่น "วัตถุ A เข้าใกล้วัตถุ B", "วัตถุ C ตามวัตถุ D" หรือ "วัตถุ E ชนกับวัตถุ F" โมเดลจะอ่านกราฟนี้ในฐานะพิมพ์เขียว และแปลงสัญญาณความสัมพันธ์เหล่านี้ให้เป็นการเคลื่อนไหวและรูปลักษณ์ที่สอดคล้องกัน ด้วยการมุ่งเน้นไปที่ความหมาย (semantics) แทนที่จะเป็นพิกัดดิบ (raw coordinates) ทำให้มันสามารถติดตามวัตถุได้แม้ว่าวัตถุเหล่านั้นจะหายไปหลังวัตถุอื่นก็ตาม

ทีมงานได้สร้างชุดข้อมูลสำหรับฝึกฝนโดยเฉพาะที่ชื่อว่า GraphVid-Bench ซึ่งจับคู่คลิปวิดีโอกับข้อมูลความสัมพันธ์ที่มีโครงสร้าง ชุดข้อมูลนี้แสดงให้โมเดลเห็นว่าวัตถุหลายอย่างเคลื่อนที่ไปด้วยกันอย่างไรภายใต้รูปแบบปฏิสัมพันธ์ที่แตกต่างกัน ทำให้โมเดลมี "คลังคำศัพท์การเคลื่อนไหว" (motion vocabulary) ที่สามารถนำมาผสมผสานใหม่ได้ในช่วงเวลาการประมวลผล (inference time)

ประสิทธิภาพที่เพิ่มขึ้น

ตัวชี้วัด โมเดลรุ่นก่อนหน้า GraphVid
Fréchet Inception Distance (FID) ↓ 39.9 %
Fréchet Video Distance (FVD) ↓ 37.6 %
Peak Signal-to-Noise Ratio (PSNR) 9.87 15.98
Structural Similarity Index (SSIM) 0.38 0.61

คะแนน FID และ FVD ที่ต่ำลงหมายความว่าวิดีโอที่สร้างขึ้นจะดูสมจริงมากขึ้น และการเคลื่อนไหวจะราบรื่นขึ้นในแต่ละเฟรม การเพิ่มขึ้นของค่า PSNR และ SSIM บ่งบอกถึงพื้นผิว (textures) ที่คมชัดขึ้นและการรักษาโครงสร้างที่ดีขึ้น ตัวเลขเหล่านี้แสดงให้เห็นว่า GraphVid สามารถสร้างวิดีโอที่มีความใกล้เคียงกับฟุตเทจจริงได้อย่างเห็นได้ชัด

ประสิทธิภาพและผลกระทบในเชิงปฏิบัติ

GraphVid บรรลุประสิทธิภาพเหล่านี้ได้โดยใช้พารามิเตอร์น้อยลงและใช้ข้อมูลในการฝึกฝนน้อยกว่าแนวทางก่อนหน้านี้ โมเดลใช้การให้เหตุผลเกี่ยวกับโครงสร้างของฉาก แทนที่จะเป็นการจดจำไดนามิกในระดับพิกเซล สำหรับวิศวกร AI ขั้นตอนการทำงานจะเปลี่ยนจากการวาดเส้นทางที่ยุ่งยาก ไปเป็นการออกแบบข้อมูลความสัมพันธ์ ซึ่งเป็นการเปลี่ยนแปลงที่สามารถขยายขอบเขตได้โดยธรรมชาติเมื่อจำนวนวัตถุเพิ่มขึ้น

ผู้ที่อาจได้รับประโยชน์ ได้แก่:

  • หุ่นยนต์ (Robotics) – สภาพแวดล้อมจำลองสามารถสะท้อนปฏิสัมพันธ์ของวัตถุที่สมจริงได้โดยไม่ต้องเขียนสคริปต์เส้นทางการเคลื่อนที่ด้วยตนเอง
  • การขับขี่อัตโนมัติ (Autonomous-driving) – สถานการณ์การจราจรที่มีรถยนต์ คนเดินเท้า และนักปั่นจักรยานจำนวนมาก สามารถสร้างขึ้นจากกฎปฏิสัมพันธ์ระดับสูง ซึ่งจะช่วยเร่งกระบวนการเพิ่มพูนข้อมูล (data-augmentation pipelines) ให้เร็วขึ้น
  • แอนิเมชัน (Animation) – ศิลปินสามารถมุ่งเน้นไปที่ความสัมพันธ์เชิงเรื่องราว ในขณะที่ระบบจะจัดการเรื่องฟิสิกส์ของการเคลื่อนไหวที่อยู่เบื้องหลังให้เอง

บทสรุป: ด้วยการปฏิบัติกับความสัมพันธ์ของวัตถุในฐานะสัญญาณควบคุมหลัก GraphVid จึงทำให้การสร้างวิดีโอเป็นเรื่องที่เข้าใจง่ายขึ้นสำหรับผู้สร้าง และมีความใกล้เคียงกับการเคลื่อนไหวในโลกแห่งความเป็นจริงมากขึ้น ซึ่งเป็นการชี้ทิศทางใหม่สำหรับการสังเคราะห์ภาพแบบควบคุมได้ (controllable synthesis)