Black Forest Labs חושפת את Flux 3: קפיצת מדרגה מולטי-מודאלית בווידאו ובאודיו

Black Forest Labs (BFL) נכנסה רשמית לחזית של "מודלי עולם" (world models) עם השקת Flux 3, מודל יסוד מולטי-מודאלי שנועד לגשר על הפער בין יצירה דיגיטלית לבין אינטליגנציה פיזית. באמצעות אימון על תמונות, וידאו ואודיו בו-זמנית, Flux 3 משיג רמה של לכידות חושית שמודלים מסורתיים בעלי מודאליות בודדת מתקשים לשחזר.

העוצמה של אימון מולטי-מודאלי ואודיו מובנה (Native Audio)

בניגוד לדורות קודמים של מודלי וידאו, שלעיתים קרובות דורשים תהליכים נפרדים כדי לסנכרן סאונד, Flux 3 מציג יצירת אודיו מובנית (native audio generation) עבור קטעי וידאו באורך של עד 20 שניות. פיתוח זה נטוע בפילוסופיה של BFL, לפיה אף מודאליות בודדת אינה יכולה ללכוד את המציאות במלואה. בעוד שתמונות מספקות מבנה מרחבי ווידאו מספק שינויים זמניים, אודיו חושף את הקשרים הסיבתיים בין אירועים מכניים לבין הצלילים שלהם.

באמצעות שימוש ב-multimodal transformer המבוסס על גישת ה-"Self-Flow" הקניינית של BFL, המודל ממיר תמונות, וידאו, אודיו ואפילו פעולות לייצוג פנימי משותף. אימון מאוחד זה מאפשר למודל למלא פערים מידעניים – למשל, שימוש ברמזים קוליים כדי להבין טוב יותר את הפיזיקה של תנועה ויזואלית. Flux 3 תומך במגוון רחב של תכונות מתקדמות, כולל text-to-video, image-to-video, מעברים מבוססי keyframe ואפילו דיאלוג רב-לשוני.

השוואת ביצועים (Benchmarking) של Flux 3 מול ענקיות התעשייה

בהערכות ראשוניות באמצעות קטעים של 10 שניות ברזולוציית 720p, Flux 3 הפגין יתרונות תחרותיים משמעותיים. במבחני העדפת משתמשים ישירים (head-to-head), BFL דיווחה כי Flux 3 הועדף על פני Luma Ray 3.2 ב-93% מההשוואות ועל פני Runway Gen-4.5 ב-77% מהמקרים.

למרות שהפערים מצטמצמים מול המתחרים מהשורה הראשונה, Flux 3 עדיין שמר על הובלה על פני Grok Imagine Video (69%) ו-Kling v3 Pro (60%). הוא גם עקף את Seedance 2.0 ו-Gemini Omni Flash עם שיעור העדפה של 52%. תוצאות אלו מצביעות על כך ש-Flux 3 ממצב את עצמו בדרג הגבוה ביותר של מודלי וידאו גנרטיביים, המסוגלים להתחרות במערכות שכבר משולבות בתהליכי עבודה מקצועיים בהוליווד.

מעבר ליצירת תוכן: בתנועה לעבר רובוטיקה

אולי ההיבט השאפתני ביותר של Flux 3 הוא המעבר שלו לעבר "אינטליגנציה ויזואלית בעולם האמיתי". BFL לא רק בונה כלי יצירתי; הם בונים מודל שיכול לתפוס, לחזות ולפעול. באמצעות רכיב פעולה (action component) ייעודי בתוך ארכיטקטורת ה-transformer שלו, המודל משמש לפיתוח "Flux-mimic", מודל וידאו-פעולה (video-action model).

ביישום בעולם האמיתי בעל חשיבות גבוהה, BFL שיתפה פעולה עם Mimic Robotics כדי לבחון את הטכנולוגיה הזו במשימות ייצור ב-Audi. הדבר מעיד על כך שארכיטקטורת הבסיס של Flux 3 נועדה לשמש כתשתית לרובוטיקה, שבה הבנת החוקים הפיזיקליים של העולם חשובה לא פחות מיצירת וידאו באיכות גבוהה (high-fidelity).

פריסה וההבטחה לגישה ב-"Flux 3 Dev" עם משקלים פתוחים (Open-Weight)

BFL מאמצת אסטרטגיית פריסה מדורגת כדי להבטיח בטיחות ולאסוף משוב ממשתמשים. Flux 3 Video זמין כעת, כאשר Flux 3 Image צפוי להשיק בגישה מוקדמת (early access) במהלך השבועות הקרובים. במבט קדימה, BFL התחייבה לשחרר גישה עם משקלים פתוחים (open-weight) לעמוד השדרה המולטי-מודאלי תחת השם "Flux 3 Dev", מהלך שסביר להניח שיאפשר למפתחים וחוקרים ברחבי העולם לבנות על גבי הארכיטקטורה שלהם.

נקודות מרכזיות

  • מולטי-מודאליות מובנית: Flux 3 משלב אימון של תמונה, וידאו ואודיו בתוך transformer "Self-Flow" יחיד, מה שמאפשר יצירת סרטוני וידאו של 20 שניות עם אודיו מובנה מסונכרן.
  • ביצועי פסגה: בבדיקות מוקדמות, Flux 3 עקף יריבים מרכזיים כולל Luma Ray 3.2 (93% העדפה) ו-Runway Gen-4.5 (77% העדפה).
  • אינטגרציה לרובוטיקה: המודל כולל רכיב לחיזוי פעולה (action-prediction) שנבדק כעת למשימות רובוטיקה בייצור ב-Audi באמצעות Mimic Robotics.