Wan 3.0 现在可以拼接长达半分钟的 AI 生成视频,而不会出现角色面部扭曲或镜头晃动的问题——这一飞跃将生成式视频从短片段推向了可用于叙事的阶段。
这一突破基于一个紧密耦合的技术栈:一个将空间和时间视为单一体积的因果 3-D 变分自编码器 (VAE),将该体积转化为 patch-tokens 的基于扩散的 Transformer,以及一个将场景级规划与像素级润色分离的混合专家 (MoE) 路由。Wan 3.0 还接受文本、图像、音频和参考视频作为独立的条件流,让每种输入都能影响输出而不会相互覆盖。其结果是一个连贯的视听世界:角色可以在摇摄过程中被持续追踪,产品在旋转时能保持形状,脚步声也能在音频信号出现时精准落地。
为什么长篇 AI 视频一直是一个瓶颈
早期的生成式视频模型可以生成几秒钟的动画,但延长时长会暴露两个根本缺陷。首先,逐帧合成忽略了时间依赖性,导致原本看起来真实的脸部在几帧之后就开始扭曲。其次,大多数流水线将声音视为事后补充,导致口型同步不匹配或拟音效果错位。通过暴力采样来解决这些问题会导致成本随长度呈爆炸式增长,使得对于创作者来说,生成超过几秒钟的内容变得不切实际。
Wan 3.0 的技术支柱
Causal 3-D VAE – 传统的 VAE 将单张图像压缩为潜码 (latent code)。Wan 的版本则一次性压缩整个视频立方体(高 × 宽 × 时间)。由于编码器和解码器遵循帧的因果顺序,潜层表示已经编码了“接下来会发生什么”,从而允许下游模块在具有时间感知能力的基质上工作,而不是处理孤立的图像。
Diffusion Transformers – 编码后,视频被分割成类似于句子中单词的 3-D patches。Transformer 预测每个 patch 的扩散轨迹,学习物体如何移动、光影如何变化以及透视如何在帧间改变。这种基于 token 的视角赋予了模型全局运动感,同时仍能处理细粒度的细节。
Mixture-of-Experts (MoE) – Wan 不再强迫单个网络同时学习宏观布局和微观纹理,而是将早期的扩散步骤路由给专注于场景构图和宏观运动的“专家”,然后将后续步骤交给第二个专家来细化皮肤毛孔、反射和细微阴影。这种拆分防止了在不需要高分辨率的任务上浪费计算资源,使推理时间保持在可控范围内。
Multimodal Conditioning – 文本提示、参考图像、短视频片段和音频轨道各生成自己的嵌入 (embedding)。模型在融合这些嵌入的同时保留了它们的独立性,因此“向左走”的文本指令不会抹除提供的角色面部参考图像,背景音乐也不会淹没说话声。
Identity and Camera Control – 从提供的图像或片段中提取的参考特征在整个生成过程中起到锚点的作用。当虚拟摄像机摇摄时,系统将这种运动视为潜空间的几何变换,而非后期处理滤镜,从而在视角或光照变化时保持主体身份的稳定性。
Audiovisual Sync – 一个专门的对齐头 (alignment head) 预测音频事件应在视频流中出现的时间点。脚步声、掌声或对话提示会精准落在声波峰值的帧上,无需手动编辑即可实现视听的高度同步。
谁将从中受益
内容创作者、广告商和游戏开发人员现在可以原型化更长的序列,而无需拼接数十个短片段。由于 MoE 架构削减了不必要的计算,每分钟生成的成本对于此前依赖手工动画流水线的中型工作室来说也是可以承受的。研究人员还可以针对医学成像或科学可视化等特定领域任务,对 Causal 3-D VAE 的可重用潜空间进行微调。
权衡与悬而未决的问题
架构的复杂性带来了硬件成本:在 3D 分块上训练扩散 Transformer 仍需要高端 GPU 或专用加速器。MoE 减少了推理浪费,但其路由逻辑增加了延迟,这在实时应用中可能会比较明显。多模态条件控制虽然强大,但在提示词模糊时可能会产生冲突;模型可能会偏向于某种模态而非另一种,从而在极端情况下导致细微的身份漂移。
批评者还指出,连贯的世界观并不保证叙事的连贯性。Wan 3.0 在视觉和听觉的连续性方面表现出色,但它尚未理解故事情节、角色动机或节奏。这些更高层级的叙事元素仍掌握在人类编辑手中。
后续关注点
Wan 3.0 背后的团队暗示即将推出的版本将尝试分层扩散,允许通过单次处理建立粗略的分镜脚本,然后再细化细节。与流行编辑软件的集成也在开发路线图中,这可能会将目前的科研原型转变为非技术用户可以直接使用的插件。
如果当前版本在各种硬件上都能证明其稳定性,我们可能会看到一波独立工作室开始绕过传统的动作捕捉设备,转而依靠少量参考镜头和文本剧本来生成完整的场景。接下来的几个月将揭示这些技术进步是会转化为生产工作流的变革,还是仅仅作为研究界的一个高成本奇观而存在。
