阿里巴巴发布 Wan3.0:重新定义多模态 AI 视频生成

阿里巴巴已正式进入 Wan3.0 的测试阶段。这是一款强大的全新视频生成模型,能够制作长达 30 秒的高质量视频片段。通过扩展输入能力,使其能够处理文档和复杂的多模态提示词,Wan3.0 致力于成为创作者、营销人员以及机器人工程师的通用型工具。

时长翻倍并扩展多模态输入

Wan3.0 相比其前身 Wan2.5 实现了重大飞跃,将最大视频时长翻倍至 30 秒。真正让该模型脱颖而出的是其先进的多模态处理引擎。与传统的文本生成视频工具不同,Wan3.0 可以同时处理文本、图像、视频和音频。

该模型支持高度复杂的提示词,允许用户在单次请求中包含多达 10 张图像、5 段视频和 5 段音频剪辑。或许最令人印象深刻的是,Wan3.0 可以摄取非传统媒体,如 PDF、网页和 PowerPoint 演示文稿,从而有效地将静态专业文档转化为动态视频内容。该系统甚至包含一项智能功能,可根据用户的特定提示词推荐最佳视频长度。

解决“视觉漂移”挑战

AI 视频生成中最持久的障碍之一是“视觉漂移”(visual drift)——即角色、面部特征和空间布局随着时间推移而发生扭曲或不自然变化的倾向。阿里巴巴专门设计了 Wan3.0 来对抗这些不一致性。

通过优先保留参考材料中的细节,该模型在角色、道具和复杂用户界面方面保持了更高的保真度。这种对时间一致性的关注,使得该模型在品牌身份和角色连续性不容妥协的专业工作流中更具可行性。

可扩展的定价与行业应用

用户可以通过 wan.video 网站、Alibaba Cloud Model Studio 或通过 Qwen Cloud 上的 API 使用 Wan3.0。阿里巴巴提供两个不同的版本:标准版(Standard version,目前享 7 折优惠)和高速版(Prime version)。定价随分辨率而变化,从标准版 480p 30 秒片段的 1.50 美元,到 Prime 版 1080p 片段的 8.40 美元不等。

其部署策略针对三个不同的领域:

  • 娱乐: 加速电影制作,并生成短剧或社交媒体剪辑。
  • 企业: 将营销文案和培训手册转化为引人入胜的视频资产。
  • 深科技: 提供逼真的模拟画面,用于训练自动驾驶汽车和机器人系统。

此次发布是在阿里巴巴进行大规模注资之后进行的,阿里巴巴最近通过大规模股票出售来为其激进的 AI 扩张筹集资金,尽管高昂的投资成本影响了季度利润。

核心要点

  • 增强的多模态能力: Wan3.0 可以将 PDF、PowerPoint 和网页转换为视频,支持包含多达 20 个组合媒体资产的复杂提示词。
  • 提升的一致性: 该模型专门解决了视觉漂移问题,确保在 30 秒的时长内,角色、道具和环境具有更好的稳定性。
  • 广泛的实用性: 专为各类用户设计,从需要社交媒体剪辑的内容创作者,到需要机器人训练模拟数据的工程师。