Alibaba lance Wan3.0 : la génération de vidéos par IA multimodale redéfinie
Alibaba est officiellement entré dans la phase bêta de Wan3.0, un nouveau modèle puissant de génération de vidéos capable de produire des clips de haute qualité allant jusqu'à 30 secondes. En élargissant ses capacités d'entrée pour inclure des documents et des invites multimodales complexes, Wan3.0 se positionne comme un outil polyvalent pour les créateurs, les spécialistes du marketing et les ingénieurs en robotique.
Doubler la durée et étendre les entrées multimodales
Wan3.0 marque un bond significatif par rapport à son prédécesseur, Wan2.5, en doublant la durée maximale de la vidéo à 30 secondes. Ce qui distingue véritablement ce modèle, c'est son moteur de traitement multimodal sophistiqué. Contrairement aux outils traditionnels de texte-en-vidéo, Wan3.0 peut traiter simultanément du texte, des images, de la vidéo et de l'audio.
Le modèle prend en charge des invites extrêmement complexes, permettant aux utilisateurs d'inclure jusqu'à dix images, cinq vidéos et cinq clips audio dans une seule requête. Plus impressionnant encore, Wan3.0 peut ingérer des médias non traditionnels tels que des PDF, des pages web et des présentations PowerPoint, transformant ainsi efficacement des documents professionnels statiques en contenu vidéo dynamique. Le système inclut même une fonctionnalité intelligente qui recommande la durée de vidéo optimale en fonction de l'invite spécifique de l'utilisateur.
Résoudre le défi de la dérive visuelle
L'un des obstacles les plus persistants dans la génération de vidéos par IA est la « dérive visuelle » (visual drift) — la tendance des personnages, des traits du visage et des agencements spatiaux à se déformer ou à changer de manière non naturelle au fil du temps. Alibaba a conçu Wan3.0 spécifiquement pour combattre ces incohérences.
En privilégiant la préservation des détails issus des documents de référence, le modèle maintient une fidélité bien plus élevée pour les personnages, les accessoires et les interfaces utilisateur complexes. Cette attention portée à la cohérence temporelle rend le modèle bien plus viable pour les flux de travail professionnels où l'identité de la marque et la continuité des personnages sont non négociables.
Tarification évolutive et applications industrielles
Wan3.0 est accessible via le site web wan.video, Alibaba Cloud Model Studio, ou via une API sur Qwen Cloud. Alibaba propose deux niveaux distincts : une version Standard (actuellement avec une remise de 30 %) et une version Prime à haute vitesse. Les tarifs évoluent selon la résolution, allant de 1,50 $ pour un clip de 30 secondes en 480p sur le niveau Standard à 8,40 $ pour un clip en 1080p sur le niveau Prime.
La stratégie de déploiement cible trois secteurs distincts :
- Divertissement : Accélérer la production cinématographique et générer des mini-séries ou des clips pour les réseaux sociaux.
- Entreprise : Convertir des textes marketing et des manuels de formation en contenus vidéo attrayants.
- Deep Tech : Fournir des séquences de simulation réalistes pour entraîner des véhicules autonomes et des systèmes robotiques.
Ce lancement fait suite à une injection massive de capitaux par Alibaba, qui a récemment réalisé une vente d'actions majeure pour financer son expansion agressive dans l'IA, alors même que des coûts d'investissement élevés ont impacté les bénéfices trimestriels.
Points clés à retenir
- Multimodalité améliorée : Wan3.0 peut transformer des PDF, des PowerPoint et des pages web en vidéo, prenant en charge des invites complexes avec jusqu'à 20 éléments multimédias combinés.
- Cohérence améliorée : Le modèle traite spécifiquement la dérive visuelle, assurant une meilleure stabilité des personnages, des accessoires et des environnements sur des durées de 30 secondes.
- Grande utilité : Conçu pour un large éventail d'utilisateurs, des créateurs de contenu ayant besoin de clips pour les réseaux sociaux aux ingénieurs nécessitant des données de simulation pour l'entraînement de la robotique.
