Avis Veo 3.1 : ce que le modèle vidéo de Google réussit en 2026, et où il patine encore

Avis Veo 3.1 testé en conditions réelles : son natif, Extend, personnage récurrent, points faibles, prix API Google, à qui il convient.
Un modèle vidéo vaut-il encore le coup une fois sorti du top 10 ? C'est la question que je me suis posée tout du long de cet avis sur Veo 3.1. Je teste les modèles vidéo pour Flami avant qu'ils n'arrivent aux utilisateurs, ce qui revient surtout à les manipuler à la main puis à repérer où ils trichent. Veo 3.1 a eu droit à deux semaines pleines de ce traitement, d'abord sur mes propres petits projets, puis sur un lot de vidéos produits. Voici ce qu'il sait vraiment faire, où il se plante encore, et pourquoi s'y intéresser si vous avez déjà Kling ou Runway sous la main.
Veo 3.1, en clair
C'est le modèle vidéo de Google DeepMind. La version 3.1 est sortie le 15 octobre 2025, annoncée sur le Google Developers Blog et reprise le jour même par TechCrunch. Depuis, Google continue de la corriger plutôt que de la remplacer. Une mise à jour de janvier a amélioré la cohérence des personnages et ajouté la vidéo verticale native ainsi que l'upscaling 1080p et 4K, et en mars un palier Veo 3.1 Lite moins cher est apparu pour les développeurs. À ce jour, la page modèle de DeepMind présente toujours la 3.1 comme le Veo actuel. Il n'existe pas de Veo 4, quoi qu'en disent certains blogs.
Où se situe-t-il face à la concurrence ? Plus bas que l'automne dernier. Sur le classement vidéo d'arena.ai (mise à jour du 21 septembre 2026), la meilleure entrée Veo 3.1, la version audio, est 12e avec 1364 points. Des modèles plus récents la devancent, dont un de Google lui-même.
Les caractéristiques techniques, d'après la documentation de l'API Gemini :
- durée du clip : 4, 6 ou 8 secondes ;
- résolution : 720p par défaut ; 1080p ou 4K seulement pour les clips de 8 secondes ;
- fréquence d'image : 24 i/s fixes ;
- formats d'image : 16:9 et 9:16 ;
- images de référence : jusqu'à trois.
Pour la plupart des besoins, 8 secondes suffisent largement. Quand ce n'est pas le cas, il y a Extend.
Google met en avant quatre fonctionnalités phares pour cette version. Je les prends une par une et je dis ce qui a tenu la route dans mes tests.
Le son natif, la vraie nouveauté
Vidéo d'abord, puis un son écrit ou généré à part, puis un mixage pour recoller les deux. C'était le circuit classique. Veo 3.1 fait tout ça en une seule génération.
Et le son est calé sur la scène, c'est tout l'intérêt. De l'eau qui coule dans le cadre, on l'entend couler. Quelqu'un qui parle a un lip sync qui suit. J'ai surtout testé la parole en anglais, où la synchronisation labiale était bonne. La documentation de Google indique que l'anglais est la seule langue entièrement évaluée. Le texte exact dit que les autres langues « peuvent fonctionner mais les résultats varient », ce qui correspond à ce à quoi je m'attendais pour tout ce qui sort de l'anglais. Pour un dialogue important dans une autre langue, j'écrirais plutôt le texte en anglais, ou je me contenterais du son d'ambiance sans réplique parlée.
Le son d'ambiance frôle la perfection. Brouhaha de café, pas sur le trottoir, chuintement d'une machine à espresso, froissement de tissu : le modèle ajoute tout ça de lui-même à partir du contexte. Pour des clips simples de moins de 8 secondes, un sound designer n'est plus vraiment nécessaire.
Ce qui n'a pas tenu ses promesses, c'est la stéréo. Je m'attendais à un vrai mixage spatial. J'ai eu du mono ou de la fausse stéréo. Le mode Quality corrige peut-être ça : j'ai surtout tourné en Fast, donc je peux me tromper sur ce point.
Extend : dépasser les 8 secondes sans que ça se voie
Une publicité de 20 ou 30 secondes obligeait à générer plusieurs morceaux puis à les recoller au montage, et les raccords se voyaient toujours. La lumière change, la pose du personnage saute, parfois même le teint change, et l'œil du spectateur s'arrête pile sur ces moments-là.
Extend prolonge un clip terminé de sorte que le segment suivant démarre exactement sur l'image où s'est arrêté le précédent. La lumière suit, l'angle de caméra aussi, et la couleur. L'API ajoute 7 secondes par extension, jusqu'à 20 fois, pour un plafond de 148 secondes, mais seulement en 720p.
En pratique, j'ai pu enchaîner 3 ou 4 morceaux avant que ça se dérègle. Au-delà, le modèle perd peu à peu le visage du personnage et les détails de la tenue se mettent à changer. Donc 16 à 24 secondes, c'est la fourchette à laquelle je ferais vraiment confiance, même si la fiche technique autorise bien plus. Sur Flami, Extend est une étape séparée qu'on lance après le clip de base, directement depuis la page Veo 3.1.
Un même personnage sur plusieurs scènes
C'est un vrai progrès par rapport à Veo 3, qui se limitait à une seule image de référence. Veo 3.1 en accepte jusqu'à trois, de quoi verrouiller une personne, une tenue, un look entier, et le garder tout au long du clip. La mise à jour de janvier de Google pousse encore le curseur et parle de cohérence d'identité.
Le modèle garde le visage et les vêtements cohérents pendant toute la scène. Même la façon de bouger reste stable. Pour une campagne avec un personnage récurrent, ou pour tout ce qui est épisodique, c'est décisif.
Les gros plans ont très bien fonctionné chez moi. Sur les plans larges, le personnage dérive parfois sur de petits détails, surtout quand mes images de référence venaient d'angles différents. Mon conseil : uploadez des références d'un seul type. Soit tout en portrait, soit tout en pied, mais ne mélangez pas les deux.
Le « contrôle narratif », concrètement, ça change quoi par rapport à un prompt classique ?
Nuance fine, mais qui compte. Dans l'annonce Flow, Google parle d'un contrôle narratif renforcé, et en pratique ça veut dire qu'on peut caler des événements précis à des moments précis à l'intérieur des 8 secondes.
Un prompt classique décrit l'idée générale : ce qui se passe, le style, l'ambiance. Avec Veo 3.1, on peut être littéral : dire que le personnage principal tourne la tête à la deuxième seconde, qu'un autre entre dans le champ un instant plus tard, et qu'à la fin du clip ils se regardent. Le modèle respecte ce découpage.
Je n'ai pas compris ça tout de suite. Mes premiers essais étaient de longs prompts en prose, et ça ne marchait pas. Il faut détailler le minutage, et là le modèle écoute. Un exemple simple : plutôt que « un barista prépare un café et sourit au client », j'écrirais « les deux premières secondes, les grains tombent dans le moulin. Puis un temps plus long sur le lait qui coule. Juste avant la coupe, elle sourit ».
Les limites du modèle
Je ne vais pas prétendre qu'il est parfait.
Les mains qui font des gestes compliqués restent un point faible. Quand quelqu'un range des objets ou tape sur un clavier, les doigts se brouillent parfois. Kling 3.0 s'en sort mieux sur ce point, il faut le reconnaître.
Le texte lisible dans l'image est un autre souci. Vous voulez une étiquette lisible avec le nom de la marque sur une bouteille ? Ça ne marche pas. Veo écrit des pseudo-lettres. Je ferais plutôt ce plan-là dans un modèle image comme Ideogram ou GPT Image, puis je l'injecterais en référence.
Vient ensuite le coût. La grille tarifaire de l'API Gemini de Google place Veo 3.1 standard à 0,40 $ la seconde de vidéo en 720p ou 1080p et 0,60 $ en 4K, tandis que Fast tourne entre 0,10 $ et 0,12 $ la seconde à ces mêmes résolutions basses. Un seul clip de 8 secondes en 1080p, en mode Quality, revient donc à 3,20 $ au tarif API. Si j'avais une série de 200 références à traiter, je passerais par Kling et je garderais Veo pour les produits phares, là où un rendu premium se justifie vraiment.
La vitesse aussi. Fast prend 1 à 2 minutes, Quality 3 à 5. En moyenne sur notre tableau de bord, on tourne autour de 2 à 4 minutes par clip. Cinquante clips d'affilée, ça fait environ deux heures d'attente.
Pour quels projets je l'utiliserais
Après deux semaines, voici comment je répartis les usages.
Les pages produit phares. Quand on a 5 ou 10 produits en tête de gondole avec un vrai budget derrière, c'est là que Veo excelle. L'image a un rendu cinématographique, la lumière reste naturelle, et les matières paraissent vraies plutôt que rendues par ordinateur.
Les catégories portées par l'ambiance et l'émotion : parfums, cosmétique haut de gamme, mode premium. Ici l'émotion et le décor comptent plus que l'action, et Veo gère ça très bien.
Les vidéos explicatives et le contenu de marque. Pour des tutoriels ou du contenu de marque sur YouTube, Veo donne cette sensation de « tourné avec une vraie caméra », sans ce mouvement flottant typique de l'IA.
Ce que je ne ferais pas sur Veo, ce sont des clips produits en masse pour une marketplace. Trop cher pour ça, et trop lent. Kling ou Hailuo font le travail pour bien moins cher.
L'utiliser via Flami
Sur Flami, Veo 3.1 fait partie de l'abonnement général : pas de compte Google séparé à créer, pas de projet Google Cloud à configurer. Ça compte plus qu'il n'y paraît. Passer en direct signifie une clé API, plus un compte de facturation, plus du code à écrire. L'autre option, c'est l'appli Flow de Google avec son propre forfait.
Deux modes sont proposés. Je les ai beaucoup utilisés tous les deux. Fast sert aux brouillons et aux tests de prompt. Quality, c'est quand on sait déjà ce qu'on veut et qu'on a besoin de la version finale.
Les prompts dans d'autres langues sont en général bien compris. Pour des scènes complexes avec du dialogue, l'anglais reste plus sûr, comme évoqué plus haut.
Le prix sur Flami
On n'affiche pas encore de prix en dollars pour les comptes internationaux, donc je resterai simple. Le paiement se fait en crédits. Le coût dépend du mode, de la durée, et aussi de la résolution. Un Extend coûte à peu près comme une nouvelle génération. Les chiffres actuels sont sur la page Veo 3.1.
Veo 3.1 est-il fait pour vous ?
Bon choix si vous cherchez :
- un rendu premium et cinématographique ;
- un son calé sur l'image ;
- des publicités pour du luxe ou de la beauté ;
- des clips plus longs, 15 à 30 secondes, avec un personnage récurrent.
Probablement pas le bon outil si :
- vous préparez une série de 50 références ou plus, la facture grimpe vite : essayez Kling ;
- vous avez besoin de texte lisible dans l'image, un autre modèle fera mieux ce plan-là ;
- tout le clip tourne autour de mains qui manipulent des objets, là où Kling s'en sort mieux.
Pour aller plus loin
Si vous hésitez entre plusieurs modèles, j'ai opposé Veo à Kling et à Runway sur les mêmes prises produit dans une comparaison à trois. Kling a aussi droit à son propre dossier si c'est celui vers lequel vous penchez.
Ou testez-le vous-même. Inscrivez-vous sur Flami et grillez quelques brouillons en Fast avec les crédits gratuits avant de passer en Quality.
FAQ
*Qu'est-ce que Veo 3.1 ?* Le modèle de génération vidéo de Google DeepMind, sorti le 15 octobre 2025. Il produit des clips réalistes avec du son, garde un personnage cohérent d'une scène à l'autre et peut prolonger un clip via Extend.
*En quoi Veo 3.1 diffère de Veo 3 ?* Trois ajouts se démarquent : le contrôle de la première et de la dernière image, plusieurs images sources par requête, et Extend pour des clips de plus de 8 secondes.
*Veo 3.1 face à Sora 2, lequel est le meilleur ?* Sur le classement vidéo d'arena.ai, ils sont quasiment à égalité. Sora 2 Pro est 11e avec 1368 points et la version audio de Veo 3.1 est 12e avec 1364, ce qui reste bien dans la marge d'erreur. Mon impression, c'est que Veo suit le prompt de façon plus littérale.
*Est-ce que ça marche dans d'autres langues que l'anglais ?* Les prompts sont en général bien compris. Mais Google n'a entièrement évalué que l'anglais, donc le dialogue dans d'autres langues peut être aléatoire.
*Combien de secondes par génération ?* Jusqu'à 8. Via Extend, l'API autorise jusqu'à 148, mais dans mes tests ça restait cohérent jusqu'à environ 24 ou 32 secondes.
*Peut-on uploader ses propres photos ?* Oui, jusqu'à trois images de référence par requête, c'est ce qui permet de garder un personnage ou un style cohérent.
*Quelle résolution est prise en charge ?* 720p par défaut. 1080p ou 4K seulement pour les clips de 8 secondes.
Dernière vérification par rapport à la documentation de Google le 30 septembre 2026.
Sources
- Google DeepMind, Veo
- Google Developers Blog, Introducing Veo 3.1 and new creative capabilities in the Gemini API
- Google, Introducing Veo 3.1 and advanced capabilities in Flow
- Google, Veo 3.1 Ingredients to Video update
- Google AI for Developers, Veo 3.1 documentation
- Google AI for Developers, Gemini API pricing
- TechCrunch, Google releases Veo 3.1, adds it to Flow video editor
- arena.ai, Text-to-Video Arena
- Flami, Veo 3.1 page
L’auteur
Hugo Lefèvre
Testeur chez Flami
À lire aussi
Avis Runway Aleph : un éditeur vidéo IA, pas un générateur texte-vers-vidéo de plus
Avis Grok Imagine : le modèle vidéo que j'utilise quand je n'ai pas encore tranché
Avis Kling 3.0 : deux semaines de plans produit, de scènes multi-plans et quelques ratés
Classement LMArena text-to-image : 80 modèles, 6,5 millions de votes