World Labs เปิดตัว Atlas ซึ่งเป็น omni-model ที่เปลี่ยนภาพถ่ายธรรมดาเพียงไม่กี่ภาพให้กลายเป็นโลก 3 มิติที่สำรวจได้อย่างสมบูรณ์ และสามารถเรนเดอร์วิดีโอความละเอียด 1440p ได้นานถึงหนึ่งนาที บริษัทระบุว่าเทคโนโลยีนี้สร้างไปป์ไลน์แบบ “real-to-sim”
ทำไมการเปลี่ยนจากลำดับข้อมูลแบบระนาบจึงมีความสำคัญ
ระบบ AI แบบ multimodal ส่วนใหญ่ในปัจจุบันประมวลผลข้อมูลนำเข้าเป็นกระแสข้อมูลแบบหนึ่งหรือสองมิติ เช่น ข้อความ (text strings), ตารางรูปภาพ (image grids) หรือเฟรมวิดีโอ การออกแบบเช่นนี้บีบให้โมเดลต้องอนุมานความสัมพันธ์เชิงพื้นที่จากข้อมูลที่ขาดเรขาคณิตที่ชัดเจน ซึ่งเป็นการจำกัดความแม่นยำของการสร้างวิดีโอและการสร้างภาพจำลอง 3 มิติขึ้นมาใหม่ Atlas จึงละทิ้งแนวทางดังกล่าว โดยทุกโทเคน (token) ที่โมเดลประมวลผลจะถูกเชื่อมโยงกับจุดที่จับต้องได้ในพื้นที่สามมิติ ซึ่งเป็นเทคนิคที่บริษัทเรียกว่า spatial anchoring การฝึกฝนโมเดลตั้งแต่เริ่มต้นด้วยข้อความ, รูปภาพ, วิดีโอ และข้อมูล 3 มิติ ด้วยสถาปัตยกรรมที่รับรู้ถึงโครงสร้างแบบ 3 มิติ หรือแม้แต่ 4 มิติ (เวลา) ทำให้ Atlas สามารถเข้าใจและจัดการกับเรขาคณิตได้โดยตรง
จากวิดีโอแบบ “ตู้สล็อต” สู่การสร้างภาพที่ควบคุมด้วยกล้อง
เครื่องมือสร้างวิดีโอ (generative video) ในปัจจุบันต้องพึ่งพาคำสั่งข้อความ (text prompts) ที่คลุมเครือในการเคลื่อนกล้องเสมือน ซึ่งมักให้ผลลัพธ์ที่คาดเดาไม่ได้ Atlas จึงแทนที่การใช้ prompt ด้วยข้อมูลนำเข้าเชิงเรขาคณิต โดยผู้ใช้สามารถระบุตำแหน่งกล้อง (camera pose) หรือเส้นทางการเคลื่อนที่ และโมเดลจะเรนเดอร์ฉากจากมุมมองนั้นโดยเฉพาะ ในการสาธิต ระบบสามารถสร้างวิดีโอที่มีความละเอียดสูงและลื่นไหล โดยที่ภาพยังคงความต่อเนื่องแม้มีการเคลื่อนกล้อง ซึ่งถือเป็นก้าวสำคัญสู่การควบคุมในระดับมืออาชีพ
การสร้างโลกขึ้นใหม่ด้วยภาพถ่ายเพียงเล็กน้อย
Atlas สามารถสร้างสภาพแวดล้อมที่ซับซ้อนขึ้นมาใหม่ได้โดยใช้ภาพถ่ายเพียงภาพเดียวไปจนถึงไม่กี่สิบภาพ โดยไม่ต้องใช้อุปกรณ์บันทึกภาพพิเศษใดๆ ในการสาธิตต่อสาธารณะ โมเดลได้นำชุดภาพถ่ายระดับพื้นดินจำนวนเล็กน้อยของลานมหาวิทยาลัยมาสังเคราะห์เป็นมุมมองจากมุมสูงที่สอดคล้องกับผังพื้นที่จริง ในขณะที่โมเดลคู่แข่งอย่าง VGGT และ InfiniteVGGT มักจะทำให้เกิดพื้นผิวที่เบลอหรือความผิดเพี้ยนทางเรขาคณิตเมื่อมีการเคลื่อนกล้อง แต่ Atlas สามารถรักษาความสมบูรณ์ของโครงสร้างไว้ได้ตลอดการทำงาน
นอกเหนือจากวิดีโอแล้ว โมเดลยังให้ผลลัพธ์ในรูปแบบ 3 มิติโดยตรง ได้แก่ point clouds และ 3-D Gaussian splats โดย point clouds คือกลุ่มของจุดในพื้นที่ที่เข้ารหัสรูปร่างของพื้นผิว ส่วน Gaussian splats จะเก็บข้อมูลแต่ละจุดในลักษณะของกลุ่มก้อน (blob) ขนาดเล็กที่มีการเปลี่ยนแปลงอย่างราบรื่น ช่วยให้การเรนเดอร์รายละเอียดที่ซับซ้อนเป็นไปอย่างมีประสิทธิภาพ ด้วยการให้ข้อมูลความลึกควบคู่ไปกับสี RGB ทำให้ Atlas สามารถเปลี่ยนภาพถ่ายจากสมาร์ทโฟนเพียงไม่กี่ภาพให้กลายเป็นฝาแฝดดิจิทัล (digital twin) ที่สามารถสำรวจได้จากทุกมุมมอง
Real-to-sim สำหรับหุ่นยนต์
นักพัฒนาหุ่นยนต์ต้องเผชิญกับช่องว่างระหว่างข้อมูลในโลกจริงและสภาพแวดล้อมการฝึกฝนแบบจำลองมาอย่างยาวนาน Atlas สัญญาว่าจะช่วยปิดช่องว่างนั้นด้วยการสร้างข้อมูลจากเซนเซอร์ (sensor feed) ที่เหมือนกับสิ่งที่หุ่นยนต์จะเห็นในห้องที่ถูกสร้างขึ้นใหม่ นักพัฒนาจึงสามารถปรับเปลี่ยนวัตถุ แสง หรือพื้นหลังในฝาแฝดดิจิทัล เพื่อสร้างสถานการณ์ที่หลากหลายนับพันรูปแบบจากการบันทึกภาพในโลกจริงเพียงครั้งเดียว World Labs ได้สาธิตเวิร์กโฟลว์นี้โดยใช้เทคโนโลยีที่ได้รับมาจากสตาร์ทอัพที่เชี่ยวชาญด้านการสังเคราะห์ฉาก (scene synthesis) โดยไปป์ไลน์นี้สามารถสร้างความหลากหลายได้มากพอที่จะทำให้แพลตฟอร์มหุ่นยนต์ 5 รูปแบบทำงานได้อย่างอิสระเป็นเวลาหนึ่งชั่วโมงโดยไม่ต้องมีการแทรกแซงจากมนุษย์
เกณฑ์มาตรฐานและคำกล่าวอ้างด้านประสิทธิภาพ
ในการทดสอบแบบตัวต่อตัว ผู้ประเมินที่เป็นมนุษย์เลือกวิดีโอที่ควบคุมด้วยกล้องของ Atlas มากกว่าคู่แข่งชั้นนำถึง 94% ในการเปรียบเทียบแบบคู่ และมากกว่าโมเดลหลักอีกตัวหนึ่งถึง 81% สำหรับการสร้างภาพจำลองใหม่ Atlas ทำค่าความผิดพลาดมัธยฐาน (median error) ได้ที่ 25.3 ซึ่งเอาชนะคู่แข่งที่มีคะแนนความผิดพลาดสูงกว่า โมเดลนี้ผสมผสานข้อดีด้านความเร็วของโมเดลภาษาขนาดใหญ่ โดยใช้การทำ key-value (KV) caching เพื่อนำการคำนวณระหว่างทางกลับมาใช้ใหม่ เข้ากับผลลัพธ์คุณภาพสูงของ diffusion models ที่ทำการปรับปรุงรูปภาพแบบวนซ้ำ
ข้อเสียที่อาจเกิดขึ้นและคำถามที่ยังไม่มีคำตอบ
การประกาศของ World Labs ได้รับการสนับสนุนด้วยการสาธิตที่น่าประทับใจ แต่เทคโนโลยีนี้ยังอยู่ในช่วงเริ่มต้น การฝึกฝนและรันโมเดลที่จัดการทั้งข้อความ, รูปภาพ, วิดีโอ และข้อมูล 3 มิติที่ความละเอียดสูงนั้นต้องใช้พลังการประมวลผล (compute) มหาศาล และบริษัทยังไม่ได้เปิดเผยข้อมูลจำเพาะของฮาร์ดแวร์หรือต้นทุนในการประมวลผล (inference costs) เกณฑ์มาตรฐานเหล่านี้ยังอิงตามความพึงพอใจของมนุษย์และค่าความผิดพลาดมัธยฐาน ซึ่งยังไม่ได้แสดงให้เห็นว่า Atlas มีประสิทธิภาพอย่างไรในงานปลายน้ำ (downstream tasks) เช่น อัตราความสำเร็จในการควบคุมหุ่นยนต์เมื่อเทียบกับข้อมูลจริงล้วนๆ นอกจากนี้ นักวิจารณ์อาจตั้งข้อสังเกตว่าแม้โมเดลจะสามารถสร้างเรขาคณิตที่ดูสมจริงจากภาพเพียงไม่กี่ภาพได้ แต่ก็ไม่สามารถทดแทนความแม่นยำของการสแกนด้วย lidar หรือการบันทึกด้วยแสงโครงสร้าง (structured-light captures) เมื่อต้องการการวัดค่าที่แม่นยำได้
สิ่งที่ต้องจับตามองต่อไป
- การนำไปใช้โดยแพลตฟอร์มหุ่นยนต์ – หากทีมพัฒนาหุ่นยนต์นำโลกที่สร้างโดย Atlas เข้าไปรวมไว้ในวงจรการฝึกฝน (training loops) และรายงานผลลัพธ์ที่วัดผลได้ คำกล่าวอ้างที่ว่าการจำลองนั้นมีราคาถูกลงและมีความหลากหลายมากขึ้นก็จะได้รับความน่าเชื่อถือ
- กระบวนการสร้างเนื้อหา (Content-creation pipelines) – สตูดิโอและนักพัฒนาเกมที่ทดลองใช้ Atlas เพื่อการสร้างต้นแบบอย่างรวดเร็ว (rapid prototyping) อาจช่วยเผยให้เห็นว่าผลลัพธ์ 3 มิติโดยกำเนิดของโมเดลนั้นเข้ากับกระบวนการจัดการทรัพยากร (asset pipelines) ที่มีอยู่เดิมหรือไม่
- การประเมินโดยโอเพนซอร์สหรือบุคคลที่สาม – นักวิจัยอิสระที่ทำการทดสอบซ้ำเพื่อยืนยันตัวเลขเกณฑ์มาตรฐาน (benchmark numbers) จะช่วยยืนยันความได้เปรียบของโมเดลเมื่อเทียบกับมาตรฐานปัจจุบัน
- การเปิดเผยข้อมูลด้านฮาร์ดแวร์และต้นทุน – การทำความเข้าใจงบประมาณการประมวลผลสำหรับการอนุมาน (inference) จะเป็นตัวกำหนดว่า Atlas จะสามารถทำงานบนอุปกรณ์ปลายทาง (edge devices) ได้ หรือจะเป็นเพียงบริการบนคลาวด์เท่านั้น
บทสรุป
Atlas แสดงให้เห็นว่าการยึดโยง AI tokens ไว้กับพื้นที่ทางกายภาพ ช่วยให้โมเดลเพียงโมเดลเดียวสามารถสร้างขึ้นใหม่ (generate), สร้างซ้ำ (reconstruct) และจำลองสภาพแวดล้อมทั้งหมดได้จากข้อมูลภาพเพียงเล็กน้อย หากประสิทธิภาพตามที่สัญญาไว้สามารถขยายผลไปสู่การใช้งานจริงได้โดยไม่มีต้นทุนการประมวลผลที่สูงเกินไป โมเดลนี้อาจพลิกโฉมวิธีการเรียนรู้ของหุ่นยนต์และวิธีการสร้างเนื้อหาที่ให้ความรู้สึกสมจริง (immersive content) โดยเปลี่ยนภาพถ่ายเพียงไม่กี่ภาพให้กลายเป็นโลกดิจิทัลที่โต้ตอบได้อย่างสมบูรณ์
