Black Forest Labs 发布 Flux 3:视频与音频领域的跨模态飞跃

Black Forest Labs (BFL) 随着 Flux 3 的发布,正式进入了“世界模型”的前沿领域。Flux 3 是一款多模态基础模型,旨在弥合数字生成与物理智能之间的鸿沟。通过同时对图像、视频和音频进行训练,Flux 3 实现了一种传统单模态模型难以复制的感官一致性。

多模态训练与原生音频的力量

与以往通常需要通过独立流程来同步声音的视频模型不同,Flux 3 为长达 20 秒的视频片段引入了原生音频生成功能。这一进展植根于 BFL 的理念,即没有任何单一模态能够完整地捕捉现实。图像提供了空间结构,视频提供了时间变化,而音频则揭示了机械事件与其声音之间的因果联系。

通过利用基于 BFL 专利“Self-Flow”方法的多模态 Transformer,该模型将图像、视频、音频甚至动作转化为共享的内部表示。这种统一训练使模型能够填补信息空白——例如,利用音频线索来更好地理解视觉运动的物理特性。Flux 3 支持广泛的高级功能,包括文本生成视频 (text-to-video)、图像生成视频 (image-to-video)、基于关键帧的过渡,甚至是多语言对话。

Flux 3 与行业巨头的基准测试对比

在针对 720p 分辨率、10 秒片段进行的初步评估中,Flux 3 展示了显著的竞争优势。在直接的用户偏好测试中,BFL 报告称,在 93% 的对比中 Flux 3 优于 Luma Ray 3.2,在 77% 的案例中优于 Runway Gen-4.5。

虽然与顶尖竞争对手的差距正在缩小,但 Flux 3 仍然领先于 Grok Imagine Video (69%) 和 Kling v3 Pro (60%)。它还以 52% 的偏好率超越了 Seedance 2.0 和 Gemini Omni Flash。这些结果表明,Flux 3 正将自己定位在生成式视频模型的最顶层,能够与已经集成到好莱坞专业工作流中的系统相竞争。

超越内容创作:迈向机器人技术

Flux 3 最具雄心的方面或许在于其向“现实世界视觉智能”的迈进。BFL 不仅仅是在构建一个创意工具;他们正在构建一个能够感知、预测并行动的模型。通过其 Transformer 架构中专门的动作组件,该模型正被用于开发“Flux-mimic”,这是一种视频-动作模型。

在一项高要求的现实应用中,BFL 已与 Mimic Robotics 合作,在 Audi 的生产任务中测试这项技术。这表明 Flux 3 的底层架构旨在作为机器人技术的基础,在这种应用中,理解世界的物理规律与生成高保真视频同样重要。

部署与“Flux 3 Dev”开源权重承诺

BFL 正在采取分阶段推出策略,以确保安全性并收集用户反馈。Flux 3 Video 目前已可用,Flux 3 Image 预计将在未来几周内推出早期访问版。展望未来,BFL 已承诺以“Flux 3 Dev”之名开放其多模态骨干网络的开源权重访问,此举可能会赋能全球开发者和研究人员,让他们基于该架构进行构建。

核心要点

  • 原生多模态: Flux 3 将图像、视频和音频训练集成到单个“Self-Flow”Transformer 中,能够生成带有同步原生音频的 20 秒视频。
  • 顶尖性能: 在早期测试中,Flux 3 的表现优于包括 Luma Ray 3.2 (93% 偏好率) 和 Runway Gen-4.5 (77% 偏好率) 在内的主要对手。
  • 机器人集成: 该模型包含一个动作预测组件,目前正通过 Mimic Robotics 在 Audi 的生产机器人任务中进行测试。