← Tous les articlesTests de modèles d’IA

Avis Wan 2.7 : le modèle vidéo d'Alibaba qui garde les textes lisibles et les produits crédibles

Hugo Lefèvre30 septembre 2026Lecture : 9 min
Avis Wan 2.7 : le modèle vidéo d'Alibaba qui garde les textes lisibles et les produits crédibles

Avis pratique du Wan 2.7 : étiquettes lisibles, visages distincts, physique des objets, clips de 15 secondes avec son, prix API et le revers open source.

Quel modèle dessine une étiquette lisible sur un carton sans donner le même visage lisse à chaque personnage ? Si vous me posiez la question demain, je répondrais Wan 2.7 avant la fin de votre phrase. C'est un peu tout cet avis de Wan 2.7 résumé en une ligne. Je sortais d'une longue série de tests sur Hailuo et les gros plans chargés d'émotion, et Wan s'est révélé être une bête complètement différente.

Mon lot de tests portait sur des plans produit où le texte sur l'emballage devait rester lisible : un nom de marque sur le couvercle, un logo sur le côté, une ligne de texte en dessous. La plupart des modèles se ridiculisent sur cet exercice et griffonnent de fausses lettres. Wan s'en sort le plus souvent très bien.

Qui fait Wan, et cette histoire de « réflexion » ?

Wan vient d'Alibaba, plus précisément de son laboratoire Tongyi. Le volet vidéo de la version 2.7 a été annoncé le 7 avril 2026 sous la forme de quatre modèles : texte-vers-vidéo, image-vers-vidéo, référence-vers-vidéo et un modèle d'édition à part. Le discours d'Alibaba tournait entièrement autour de la mise en scène :

« Un seul prompt peut suffire à produire un storyboard complet, permettant aux utilisateurs de créer des œuvres dignes d'un réalisateur. »

Une bonne partie du bruit médiatique autour du lancement, y compris nos propres notes sur le sujet, s'est concentrée sur un Thinking Mode censé planifier le plan avant de lancer le rendu. Voici ce que je n'ai remarqué qu'en vérifiant la documentation pour cet article : ce commutateur thinking_mode vit en réalité dans les modèles image de Wan 2.7. Côté vidéo, l'API image-vers-vidéo propose plutôt une option prompt_extend. Elle réécrit votre prompt en une version plus complète avant que le rendu ne démarre, et la documentation prévient que cela rallonge le temps de traitement.

Peu importe comment on l'appelle, l'idée reste la même. Le modèle détermine d'abord la composition et où placer chaque objet. Le mouvement de caméra est planifié lui aussi, et le rendu ne commence qu'ensuite. Dans mes essais, cette étape de planification a payé sur les scènes chargées avec plusieurs objets, où moins de choses partaient de travers. On paie ça en temps d'attente. Pour un simple plan produit qui tourne sur lui-même, je ne suis pas sûr que ça vaille le coup d'attendre.

Trois raisons pour lesquelles il reste un de mes choix par défaut

Le texte d'abord. Enseignes, légendes, étiquettes sur l'emballage : Wan les rend lisibles bien plus souvent que la plupart des modèles vidéo que j'ai essayés. Pour la publicité et l'e-commerce, où le produit doit afficher clairement son nom de marque, c'est le critère qui tranche. Une réserve tout de même : la fameuse annonce des « 12 langues » d'Alibaba concerne le modèle image de Wan 2.7, et je n'ai trouvé aucun chiffre équivalent pour les modèles vidéo.

Les visages sont la deuxième raison. Vous connaissez cet effet où tout le monde, dans une vidéo IA, ressemble au même inconnu joli et sans relief ? Wan m'a donné des personnages vraiment différents les uns des autres, avec des formes de visage et des yeux différents. Si vous menez une campagne avec plusieurs personnages, ou une série récurrente, ça compte plus qu'on ne le pense.

Vient ensuite la physique. Wan sait montrer comment un objet fonctionne réellement à l'écran. Le mixeur tourne comme un vrai mixeur, le fer à repasser glisse sur la chemise sans flotter au-dessus, et sur l'un de mes essais, une perceuse mord la planche et projette de vrais copeaux. Pour des images « produit en action », c'est en général mon premier choix.

Les caractéristiques à comparer

Les clips vont de 2 à 15 secondes. La sortie est en 720p ou 1080p, d'après la documentation API d'Alibaba. Le son natif sort de la même passe, avec la synchronisation labiale. Vous pouvez aussi fournir votre propre piste vocale pour que la bouche et les mouvements du personnage la suivent. C'est une vraie avancée en durée par rapport aux premières versions de Wan.

Quelques autres détails glanés dans la documentation :

  • partir d'une première image, ou fixer à la fois la première et la dernière image ;
  • prolonger un clip existant ;
  • référence-vers-vidéo, avec jusqu'à cinq personnages distincts dans une même scène selon l'annonce d'Alibaba ;
  • un modèle d'édition dédié qui modifie une vidéo existante à partir d'une instruction texte.

Les formats d'image sont les habituels 16:9, 9:16 et 1:1 sur Flami, plus quelques autres. Ce contrôle de couleur en HEX dont vous avez peut-être entendu parler, où vous entrez le code exact de la couleur de votre marque, appartient là encore au modèle image. Si c'est ce qu'il vous faut, c'est sur la page Wan 2.7 Image, et je l'ai détaillé dans l'avis Wan 2.7 Image.

Le prix

À la source, la grille tarifaire de Model Studio d'Alibaba Cloud affiche Wan 2.7 texte-vers-vidéo et image-vers-vidéo à 0,10 $ par seconde en 720p et 0,15 $ par seconde en 1080p, sur la zone internationale. Un clip de 10 secondes en 1080p revient donc à 1,50 $ via l'API.

Sur Flami, Wan 2.7 est inclus dans l'abonnement classique et payé en crédits. À côté du modèle phare, vous avez aussi accès à Wan 2.6, 2.5, 2.2 Fast et 2.2. Ma logique reste simple : 2.7 donne les meilleurs résultats mais prend plus de temps et coûte plus cher, tandis que les anciennes versions sont plus rapides et moins chères pour les gros volumes.

Le revers de la médaille : des poids qui ne sont plus ouverts

Wan a bâti sa réputation comme modèle ouvert. On téléchargeait les poids et on le faisait tourner sur ses propres GPU. Ce n'est plus le cas pour les dernières versions. La page Wan-AI d'Alibaba sur Hugging Face s'arrête encore à la famille 2.2 de l'été dernier, et les versions 2.5, 2.6, 2.7 ainsi que la nouvelle 3.0 ne sont disponibles que via l'API.

Si vous utilisez Wan via un service, ça ne change rien pour vous. Si vous comptiez héberger 2.7 sur votre propre matériel, c'est raté : 2.2 reste la version la plus récente que vous puissiez encore faire tourner en local.

Wan 3.0 est sorti : est-ce que 2.7 compte encore ?

Alibaba a sorti Wan 3.0 en août. Il produit des clips allant jusqu'à 30 secondes et accepte tout un tas de nouvelles entrées, y compris des documents. Il figure aussi près du sommet des classements à l'aveugle. Dans la mise à jour du 21 septembre 2026 du classement texte-vers-vidéo d'arena.ai, wan3.0 est 6e avec 1476 points, tandis que wan2.7-t2v est 20e avec 1337.

Je n'ai pas encore testé 3.0 sérieusement, donc je m'en tiens à ce que je sais. 2.7 reste un bon choix pour des plans produit avec du texte dessus, et au tarif public il revient un peu moins cher à la seconde que 3.0 en 1080p. Je referai sans doute ce comparatif une fois que j'aurai mis les deux côte à côte sur les mêmes produits.

Comment je répartis le travail entre Wan et les autres

Pour garder les idées claires, voici à peu près comment je répartis le travail :

  • texte, logos et emballage dans le champ : Wan 2.7 ;
  • un produit qui fait son travail, avec une physique crédible : Wan 2.7 ;
  • une belle lumière et un rendu cinéma : Veo 3.1 ;
  • l'émotion en gros plan : Hailuo ;
  • le mouvement rapide et les tours de caméra : Kling 3.0.

Demander si Wan ou Veo est « meilleur » en général ne mène pas loin. Tout dépend de ce qui cloche sur votre plan : une lumière terne ou une étiquette floue.

Faut-il choisir Wan 2.7 ?

Je prends 2.7 dès que le carton porte un vrai texte ou un logo, quand la scène a besoin de visages distincts plutôt que de clones IA, ou quand le produit doit vraiment fonctionner à l'écran. Le passage unique de 15 secondes aide aussi.

Je l'écarte quand quelqu'un veut faire tourner le modèle sur son propre serveur, puisque les poids de 2.7 n'ont jamais été publiés, ou quand tout l'enjeu est la lumière et l'ambiance cinématographique. Ça, c'est pour Veo.

La suite

Seedance 2.0 est le prochain sur ma liste, puis HappyHorse 1.0 et Grok Imagine. J'aimerais aussi montrer une combinaison que j'utilise depuis un moment : un clip de base dans Wan, puis la finition dans Runway. Si vous n'avez jamais utilisé Runway comme outil de montage, l'avis Runway Aleph explique le principe.

Chargez un carton avec du texte dans Wan 2.7 sur Flami et zoomez sur les lettres pour voir si elles tiennent la route.

Questions sur Wan 2.7

  • Qu'est-ce que Wan 2.7 ? La famille de modèles vidéo d'Alibaba annoncée en avril 2026. Elle produit des clips de 2 à 15 secondes avec du son natif, et se distingue par un texte lisible à l'image et des visages bien différenciés.
  • Wan 2.7 a-t-il un mode de réflexion pour la vidéo ? Alibaba documente le commutateur thinking_mode pour les modèles image de Wan 2.7. L'API vidéo propose plutôt prompt_extend. Elle développe le prompt avant le rendu et prend plus de temps.
  • Quelle durée et quelle résolution ? De 2 à 15 secondes. La résolution est en 720p ou 1080p, avec son natif et synchronisation labiale.
  • Peut-on faire tourner Wan 2.7 en local ? Non. Ses poids ne sont pas publiés, et 2.2 reste la version la plus récente de Wan à poids ouverts.
  • Combien ça coûte via l'API d'Alibaba ? 0,10 $ par seconde en 720p et 0,15 $ en 1080p sur la zone internationale. Sur Flami, vous payez en crédits.
  • En quoi diffère-t-il de Veo et Kling ? Wan ne cherche à rivaliser avec aucun des deux sur la lumière ou le mouvement haut de gamme, son atout, c'est un texte qui reste lisible et des objets qui se comportent correctement. Et contrairement aux anciennes versions de Wan, les poids de 2.7 ne sont pas publics, donc l'auto-hébergement est exclu.

Dernière vérification le 30 septembre 2026, sur la base de la documentation d'Alibaba Cloud et du classement vidéo d'arena.ai.

Sources

  1. Alibaba Cloud, Alibaba Unveils Wan2.7-Video
  2. Alibaba Cloud, Alibaba Unveils Wan2.7 image generation
  3. Alibaba Cloud Model Studio, Wan 2.7 image-to-video API reference
  4. Alibaba Cloud Model Studio, Wan 2.7 image generation and editing API reference
  5. Alibaba Cloud Model Studio, model pricing
  6. Alibaba Cloud, Wan3.0 launch
  7. Hugging Face, Wan-AI models
  8. arena.ai, Text-to-Video Leaderboard
  9. Flami, Wan 2.7 launch notes
  10. Flami, Wan 2.7 page

L’auteur

Hugo Lefèvre

Testeur chez Flami

À lire aussi

Recevez 15 crédits gratuits

Utilisez-les pour générer des images et des vidéos :

≈ 11 × Nano Banana 2, ≈ 12 × GPT Image 2, ≈ 1 × Seedance 2

Obtenir des crédits gratuits