Black Forest Labs представляет Flux 3: мультимодальный скачок в области видео и аудио
Black Forest Labs (BFL) официально вышла на передовую разработки «моделей мира» с выпуском Flux 3 — мультимодальной базовой модели, призванной преодолеть разрыв между цифровой генерацией и физическим интеллектом. Благодаря одновременному обучению на изображениях, видео и аудио, Flux 3 достигает такого уровня сенсорной связности, который традиционным одномодальным моделям трудно воспроизвести.
Мощь мультимодального обучения и нативного аудио
В отличие от предыдущих поколений видеомоделей, которые часто требуют отдельных процессов для синхронизации звука, Flux 3 внедряет нативную генерацию аудио для видеоклипов длительностью до 20 секунд. Эта разработка основана на философии BFL: ни одна отдельная модальность не способна полностью запечатлеть реальность. В то время как изображения обеспечивают пространственную структуру, а видео — временные изменения, аудио раскрывает причинно-следственные связи между механическими событиями и их звучанием.
Используя мультимодальный трансформер на основе проприетарного подхода «Self-Flow» от BFL, модель преобразует изображения, видео, аудио и даже действия в единое внутреннее представление. Такое унифицированное обучение позволяет модели восполнять информационные пробелы — например, использовать аудиоподсказки для лучшего понимания физики визуального движения. Flux 3 поддерживает широкий спектр расширенных функций, включая text-to-video, image-to-video, переходы на основе ключевых кадров и даже многоязычные диалоги.
Сравнение Flux 3 с гигантами индустрии
В предварительных оценках с использованием 10-секундных клипов в разрешении 720p Flux 3 продемонстрировала значительные конкурентные преимущества. В прямых тестах пользовательских предпочтений BFL сообщила, что Flux 3 выбирали чаще, чем Luma Ray 3.2, в 93% случаев, и чаще, чем Runway Gen-4.5, в 77% случаев.
Хотя разрыв с элитными конкурентами сокращается, Flux 3 все же удерживает лидерство перед Grok Imagine Video (69%) и Kling v3 Pro (60%). Она также превзошла Seedance 2.0 и Gemini Omni Flash с показателем предпочтений 52%. Эти результаты позволяют предположить, что Flux 3 занимает место в высшей лиге генеративных видеомоделей, способных конкурировать с системами, которые уже интегрируются в профессиональные рабочие процессы в Голливуде.
Больше чем создание контента: движение в сторону робототехники
Пожалуй, самым амбициозным аспектом Flux 3 является ее движение в сторону «визуального интеллекта реального мира». BFL создает не просто творческий инструмент; они строят модель, которая может воспринимать, предсказывать и действовать. Благодаря выделенному компоненту действий в архитектуре трансформера, модель используется для разработки «Flux-mimic» — модели видео-действий.
В рамках важных прикладных задач в реальном мире BFL в партнерстве с Mimic Robotics тестирует эту технологию на производственных задачах в Audi. Это указывает на то, что базовая архитектура Flux 3 предназначена для того, чтобы служить фундаментом для робототехники, где понимание физических законов мира так же важно, как и генерация высококачественного видео.
Развертывание и обещание открытых весов «Flux 3 Dev»
BFL применяет стратегию поэтапного развертывания, чтобы обеспечить безопасность и собрать отзывы пользователей. Flux 3 Video уже доступна, а запуск Flux 3 Image в режиме раннего доступа ожидается в течение ближайших нескольких недель. Заглядывая вперед, BFL обязалась предоставить доступ к мультимодальной основе с открытыми весами под названием «Flux 3 Dev» — этот шаг, вероятно, позволит разработчикам и исследователям по всему миру создавать решения на базе их архитектуры.
Основные выводы
- Нативная мультимодальность: Flux 3 объединяет обучение на изображениях, видео и аудио в единый трансформер «Self-Flow», позволяя создавать 20-секундные видео с синхронизированным нативным аудио.
- Высочайшая производительность: В ходе ранних тестов Flux 3 превзошла основных конкурентов, включая Luma Ray 3.2 (93% предпочтений) и Runway Gen-4.5 (77% предпочтений).
- Интеграция с робототехникой: Модель включает компонент прогнозирования действий, который в настоящее время тестируется для производственных задач в робототехнике в Audi совместно с Mimic Robotics.
