Black Forest Labs เปิดตัว Flux 3: ก้าวกระโดดสู่ความเป็น Multimodal ในด้านวิดีโอและเสียง

Black Forest Labs (BFL) ได้ก้าวเข้าสู่พรมแดนของ "world models" อย่างเป็นทางการด้วยการเปิดตัว Flux 3 ซึ่งเป็นโมเดลพื้นฐานแบบ multimodal ที่ออกแบบมาเพื่อเชื่อมช่องว่างระหว่างการสร้างสรรค์แบบดิจิทัลและความฉลาดทางกายภาพ ด้วยการฝึกฝนจากทั้งภาพ วิดีโอ และเสียงไปพร้อมกัน Flux 3 จึงสามารถบรรลุระดับความสอดประสานทางประสาทสัมผัสที่โมเดลแบบ single-modality ทั่วไปทำได้ยาก

พลังของการฝึกฝนแบบ Multimodal และเสียงแบบ Native

ต่างจากโมเดลวิดีโอในรุ่นก่อนๆ ที่มักต้องใช้กระบวนการแยกกันเพื่อซิงค์เสียง Flux 3 ได้นำเสนอการสร้างเสียงแบบ native สำหรับคลิปวิดีโอที่มีความยาวสูงสุดถึง 20 วินาที การพัฒนานี้มีรากฐานมาจากปรัชญาของ BFL ที่ว่าไม่มี modality ใดเพียงอย่างเดียวที่จะสามารถจับภาพความเป็นจริงได้อย่างครบถ้วน ในขณะที่ภาพให้โครงสร้างเชิงพื้นที่และวิดีโอให้การเปลี่ยนแปลงเชิงเวลา เสียงจะเป็นตัวเผยให้เห็นความเชื่อมโยงเชิงเหตุและผลระหว่างเหตุการณ์ทางกลไกและเสียงที่เกิดขึ้น

ด้วยการใช้ multimodal transformer ที่อิงตามแนวทาง "Self-Flow" ซึ่งเป็นกรรมสิทธิ์ของ BFL โมเดลนี้จะเปลี่ยนภาพ วิดีโอ เสียง และแม้กระทั่งการกระทำ (actions) ให้กลายเป็นตัวแทนข้อมูลภายในที่ใช้ร่วมกัน การฝึกฝนแบบรวมศูนย์นี้ช่วยให้โมเดลสามารถเติมเต็มช่องว่างของข้อมูลได้ เช่น การใช้สัญญาณเสียงเพื่อทำความเข้าใจฟิสิกส์ของการเคลื่อนไหวทางภาพได้ดียิ่งขึ้น Flux 3 รองรับฟีเจอร์ขั้นสูงมากมาย รวมถึง text-to-video, image-to-video, การเปลี่ยนผ่านแบบ keyframe-based และแม้กระทั่งบทสนทนาหลายภาษา

การทดสอบประสิทธิภาพของ Flux 3 เปรียบเทียบกับยักษ์ใหญ่ในอุตสาหกรรม

ในการประเมินเบื้องต้นโดยใช้คลิปความยาว 10 วินาทีที่ความละเอียด 720p พบว่า Flux 3 แสดงให้เห็นถึงความได้เปรียบในการแข่งขันอย่างมีนัยสำคัญ จากการทดสอบความพึงพอใจของผู้ใช้แบบตัวต่อตัว BFL รายงานว่า Flux 3 ได้รับความนิยมมากกว่า Luma Ray 3.2 ในการเปรียบเทียบถึง 93% และมากกว่า Runway Gen-4.5 ใน 77% ของกรณีทั้งหมด

แม้ว่าช่องว่างจะแคบลงเมื่อเทียบกับคู่แข่งระดับแนวหน้า แต่ Flux 3 ยังคงรักษาความเป็นผู้นำเหนือ Grok Imagine Video (69%) และ Kling v3 Pro (60%) นอกจากนี้ยังทำผลงานได้ดีกว่า Seedance 2.0 และ Gemini Omni Flash ด้วยอัตราความพึงพอใจที่ 52% ผลลัพธ์เหล่านี้บ่งชี้ว่า Flux 3 กำลังวางตำแหน่งตัวเองให้อยู่ในระดับสูงสุดของโมเดลวิดีโอแบบ generative ซึ่งสามารถแข่งขันกับระบบที่เริ่มมีการนำไปใช้ในกระบวนการทำงานระดับมืออาชีพของ Hollywood ได้แล้ว

เหนือกว่าการสร้างคอนเทนต์: มุ่งสู่เทคโนโลยีหุ่นยนต์

สิ่งที่อาจเป็นด้านที่ทะเยอทะยานที่สุดของ Flux 3 คือการก้าวไปสู่ "ความฉลาดทางภาพในโลกแห่งความเป็นจริง" BFL ไม่ได้เพียงแค่สร้างเครื่องมือสร้างสรรค์เท่านั้น แต่พวกเขากำลังสร้างโมเดลที่สามารถรับรู้ คาดการณ์ และลงมือทำได้ ด้วยส่วนประกอบด้านการกระทำ (action component) ที่ออกแบบมาโดยเฉพาะภายในสถาปัตยกรรม transformer โมเดลนี้กำลังถูกนำไปใช้เพื่อพัฒนา "Flux-mimic" ซึ่งเป็นโมเดลวิดีโอ-การกระทำ (video-action model)

ในการประยุกต์ใช้ในโลกแห่งความเป็นจริงที่มีความสำคัญสูง BFL ได้ร่วมมือกับ Mimic Robotics เพื่อทดสอบเทคโนโลยีนี้กับงานด้านการผลิตที่ Audi สิ่งนี้บ่งชี้ว่าสถาปัตยกรรมพื้นฐานของ Flux 3 มีจุดประสงค์เพื่อใช้เป็นรากฐานสำหรับหุ่นยนต์ ซึ่งการทำความเข้าใจกฎทางฟิสิกส์ของโลกนั้นมีความสำคัญพอๆ กับการสร้างวิดีโอที่มีความละเอียดสูง

การปรับใช้และคำมั่นสัญญาเรื่อง open-weight ของ "Flux 3 Dev"

BFL กำลังใช้กลยุทธ์การเปิดตัวแบบเป็นระยะเพื่อรับประกันความปลอดภัยและรวบรวมความคิดเห็นจากผู้ใช้ ขณะนี้ Flux 3 Video พร้อมใช้งานแล้ว โดยคาดว่า Flux 3 Image จะเปิดให้เข้าถึงในช่วงแรก (early access) ภายในไม่กี่สัปดาห์ข้างหน้า และเมื่อมองไปไกลกว่านั้น BFL ได้ให้คำมั่นว่าจะเปิดให้เข้าถึงแบบ open-weight สำหรับโครงสร้างหลักแบบ multimodal ภายใต้ชื่อ "Flux 3 Dev" ซึ่งเป็นการเคลื่อนไหวที่จะช่วยเพิ่มศักยภาพให้แก่นักพัฒนาและนักวิจัยทั่วโลกในการต่อยอดจากสถาปัตยกรรมของพวกเขา

สรุปประเด็นสำคัญ

  • Native Multimodality: Flux 3 รวมการฝึกฝนภาพ วิดีโอ และเสียงเข้าไว้ใน "Self-Flow" transformer เพียงหนึ่งเดียว ทำให้สามารถสร้างวิดีโอความยาว 20 วินาทีพร้อมเสียงแบบ native ที่ซิงค์กันได้อย่างสมบูรณ์
  • ประสิทธิภาพระดับแนวหน้า: ในการทดสอบช่วงแรก Flux 3 ทำผลงานได้เหนือกว่าคู่แข่งรายใหญ่ รวมถึง Luma Ray 3.2 (ความพึงพอใจ 93%) และ Runway Gen-4.5 (ความพึงพอใจ 77%)
  • การบูรณาการกับหุ่นยนต์: โมเดลนี้ประกอบด้วยส่วนประกอบการคาดการณ์การกระทำ (action-prediction) ซึ่งปัจจุบันกำลังถูกทดสอบสำหรับงานด้านหุ่นยนต์ในสายการผลิตที่ Audi ผ่าน Mimic Robotics