Veo 3.1 Test: Was Googles Videomodell 2026 gut kann, und wo es noch strauchelt

Veo 3.1 im Test: nativer Ton, Extend für längere Clips, ein Charakter über mehrere Szenen, Schwächen, Googles API-Preise und wann es sich lohnt.
Lohnt sich ein Videomodell noch, sobald es aus den Top Ten gerutscht ist? Diese Frage hat mich durch den ganzen Veo 3.1 Test hier verfolgt. Ich teste Videomodelle für Flami, bevor sie bei den Nutzern landen, und das heißt meistens: von Hand durchprobieren und zählen, wo das Modell schummelt. Veo 3.1 bekam von mir zwei volle Wochen davon, erst an eigenen kleinen Projekten, dann an einem Stapel Produktvideos. Unten steht, was es wirklich kann, wo es noch patzt, und warum sich der Umweg lohnt, selbst wenn du schon Kling oder Runway nutzt.
Was Veo 3.1 in einfachen Worten ist
Das ist das Videomodell von Google DeepMind. Version 3.1 kam am 15. Oktober 2025 heraus, angekündigt im Google Developers Blog und noch am selben Tag von TechCrunch aufgegriffen. Seitdem flickt Google eher daran herum, statt es zu ersetzen. Ein Update im Januar verbesserte die Charakterkonsistenz und brachte natives Hochformat-Video plus Upscaling auf 1080p und 4K, im März kam dann eine günstigere Veo-3.1-Lite-Stufe für Entwickler dazu. Bis heute führt DeepMinds Modellseite 3.1 als aktuelles Veo. Ein Veo 4 gibt es nicht, was auch immer manche Blogs behaupten.
Wo steht es gegen die Konkurrenz? Niedriger als noch im letzten Herbst. Auf arena.ais Video-Ranking (Stand 21. September 2026) liegt der beste Veo-3.1-Eintrag, die Audio-Version, auf Platz 12 mit 1.364 Punkten. Neuere Modelle stehen darüber, darunter eines von Google selbst.
Die technischen Daten laut der Gemini-API-Dokumentation:
- Cliplänge: 4, 6, 8 Sekunden;
- Auflösung: 720p als Standard, 1080p oder 4K nur bei 8-Sekunden-Clips;
- Bildrate: fest bei 24 fps;
- Seitenverhältnisse: 16:9 und 9:16;
- Referenzbilder: bis zu drei.
Für die meisten Aufträge reichen 8 Sekunden locker. Wenn nicht, gibt es Extend.
Google nennt vier Hauptfeatures für diese Version. Ich gehe sie eins nach dem anderen durch und sage, was sich im Test bewährt hat.
Nativer Ton ist die große Neuerung
Erst das Video, dann der Ton separat geschrieben oder generiert, danach ein Mix-Durchgang, der beides zusammenbringt. Das war der alte Workflow. Veo 3.1 erledigt das alles in einem einzigen Durchgang.
Und der Ton sitzt exakt auf der Szene, darum geht es ja. Läuft im Bild Wasser, hörst du es auch plätschern. Spricht jemand, bekommst du Lippensynchronisation. Ich habe Sprache vor allem auf Englisch getestet, dort war die Synchronisation gut. Googles Doku sagt, Englisch ist die einzige Sprache, die vollständig geprüft wurde. Andere Sprachen „können funktionieren, die Ergebnisse schwanken aber“, so der genaue Wortlaut, und das deckt sich mit meiner Erwartung für alles außerhalb von Englisch. Wäre mir eine Sprachzeile wirklich wichtig, würde ich den Dialog entweder auf Englisch schreiben oder ganz auf Sprache verzichten und nur den Umgebungston behalten.
Umgebungsgeräusche sind fast makellos. Stimmengewirr im Café, Schritte auf Pflaster, das Zischen einer Espressomaschine, das Rascheln von Stoff. Das Modell setzt das alles selbstständig aus dem Kontext dazu. Bei einfachen Clips unter 8 Sekunden brauchst du wirklich keinen Sounddesigner mehr.
Was die Erwartungen nicht erfüllt hat, war Stereo. Ich hatte einen richtigen Raumklang erwartet. Bekommen habe ich Mono oder simuliertes Stereo. Vielleicht behebt der Quality-Modus das, ich bin größtenteils mit Fast gelaufen, kann also gut sein, dass ich hier danebenliege.
Extend, oder wie du über 8 Sekunden hinauskommst, ohne dass du die Nähte siehst
Ein 20- oder 30-Sekunden-Spot bedeutete früher, mehrere Teile zu generieren und sie im Schnittprogramm zusammenzusetzen, und die Übergänge waren immer zu sehen. Das Licht verschiebt sich, die Pose des Charakters springt, manchmal ändert sich sogar der Hautton, und genau an diesen Stellen bleibt der Blick der Zuschauer hängen.
Extend führt einen fertigen Clip fort, sodass das nächste Segment exakt auf dem Frame beginnt, an dem das vorherige geendet hat. Licht bleibt erhalten, ebenso der Kamerawinkel und die Farbgebung. Die API hängt pro Verlängerung 7 Sekunden an, bis zu 20 Mal, macht ein Limit von 148 Sekunden, allerdings nur in 720p.
In der Praxis konnte ich 3 oder 4 Teile aneinanderreihen, bevor es schiefging. Danach verliert das Modell nach und nach das Gesicht des Charakters, und Details am Outfit fangen an sich zu verändern. 16 bis 24 Sekunden ist also der Bereich, dem ich wirklich vertrauen würde, auch wenn das Datenblatt deutlich mehr erlaubt. Bei Flami ist Extend ein eigener Schritt, den du nach dem Basisclip ausführst, direkt auf der Veo-3.1-Seite.
Ein Charakter über mehrere Szenen hinweg
Das ist ein großer Sprung gegenüber Veo 3. Früher war bei einem Referenzbild Schluss. Veo 3.1 nimmt bis zu drei, damit legst du eine Person, ein Outfit, einen ganzen Look fest und trägst ihn durch den Clip. Googles Januar-Update hat das weiter ausgebaut und nennt es Identitätskonsistenz.
Das Modell hält Gesicht und Kleidung während der ganzen Szene konstant. Sogar die Art, wie sich jemand bewegt. Baust du eine Kampagne mit einem wiederkehrenden Charakter, oder überhaupt etwas Episodisches, ist das entscheidend.
Nahaufnahmen haben bei mir sehr gut funktioniert. Bei weiten Einstellungen driftet der Charakter manchmal in kleinen Details ab, vor allem wenn meine Referenzbilder aus unterschiedlichen Blickwinkeln stammten. Mein Rat: Lade Referenzen von einem Typ hoch. Entweder alles Porträts oder alles Ganzkörperaufnahmen, nur nicht mischen.
Was unterscheidet „narrative Kontrolle“ von einem normalen Prompt?
Feiner Punkt, aber er zählt. In der Flow-Ankündigung spricht Google von mehr narrativer Kontrolle, und in der Praxis heißt das: Du kannst bestimmte Ereignisse an bestimmte Momente innerhalb der 8 Sekunden pinnen.
Ein normaler Prompt beschreibt die Gesamtidee. Was passiert, welcher Stil, welche Stimmung. Bei Veo 3.1 kannst du wörtlich werden: Sag, dass der Held nach zwei Sekunden den Kopf dreht, jemand anderes einen Takt später ins Bild tritt, und am Ende des Clips sehen sie sich an. Das Modell hält sich an diese Beats.
Ich habe das nicht sofort hinbekommen. Meine ersten Versuche waren lange Fließtext-Prompts, und die haben nicht funktioniert. Du musst die Zeitpunkte ausbuchstabieren, dann hört das Modell zu. Ein grobes Beispiel: Statt „ein Barista macht Kaffee und lächelt den Kunden an“ würde ich schreiben: „Die ersten paar Sekunden, Bohnen fallen ins Mahlwerk. Dann eine längere Passage, in der Milch aufgegossen wird. Kurz vor dem Schnitt lächelt sie."
Wo es schwächelt
Ich tue nicht so, als wäre es perfekt.
Hände, die komplizierte Dinge tun, sind eine Schwachstelle. Ordnet jemand etwas oder tippt, verschmieren die Finger manchmal. Kling 3.0 kann das fairerweise besser.
Lesbarer Text im Bild ist ein weiterer Punkt. Willst du ein gut lesbares Etikett mit Markennamen auf einer Flasche? Fehlanzeige. Veo schreibt Pseudo-Buchstaben. Ich würde diese Einstellung in einem Bildmodell wie Ideogram oder GPT Image erzeugen und dann als Referenz einspeisen.
Dann die Kosten. Googles Gemini-API-Preisliste setzt Standard-Veo-3.1 bei 0,40 US-Dollar pro Sekunde Video in 720p oder 1080p an, 0,60 US-Dollar bei 4K, während Fast bei diesen niedrigeren Auflösungen 0,10 bis 0,12 US-Dollar pro Sekunde kostet. Ein einzelner 8-Sekunden-Clip in 1080p im Top-Modus kommt zu API-Preisen damit auf 3,20 US-Dollar. Hätte ich eine Serie von 200 Artikeln vor mir, würde ich sie über Kling laufen lassen und Veo für die Hero-Produkte aufheben, bei denen sich der Premium-Look wirklich auszahlt.
Auch das Tempo. Fast braucht 1 bis 2 Minuten, Quality 3 bis 5. Über unser Dashboard gemittelt sind es etwa 2 bis 4 Minuten pro Clip. 50 Clips am Stück bedeuten rund zwei Stunden Wartezeit.
Wofür ich es einsetzen würde
Nach zwei Wochen teile ich die Aufgaben für mich so ein.
Hero-Produktseiten. Hast du 5 oder 10 Topprodukte, für die wirklich Budget da ist, macht Veo das am besten. Das Bild wirkt filmisch, das Licht bleibt natürlich, und Texturen sehen echt aus statt gerendert.
Lifestyle- und stimmungsgetriebene Kategorien wie Parfum, hochwertige Hautpflege, gehobene Mode. Hier zählen Emotion und Setting mehr als Handlung, und das liegt Veo.
Erklärvideos und Markeninhalte. Für Tutorials und Markeninhalte auf YouTube gibt Veo dir das Gefühl „mit einer echten Kamera gedreht“, ohne dieses schwebende, KI-typische Bewegungsbild.
Wofür ich es nicht nehmen würde: Massenproduktclips für einen Marktplatz. Dafür zu teuer und zu langsam. Kling oder Hailuo erledigen das für deutlich weniger Geld.
Veo 3.1 über Flami nutzen
Bei Flami gehört Veo 3.1 zum allgemeinen Abo, du musst also kein separates Google-Konto und kein Google-Cloud-Projekt einrichten. Das zählt mehr, als es klingt. Der direkte Weg bedeutet API-Key plus Abrechnungskonto plus Arbeit über Code. Die Alternative ist Googles Flow-App mit eigenem Tarif.
Es gibt zwei Modi zur Wahl. Ich habe beide viel genutzt. Fast ist für Entwürfe und Prompt-Tests. Quality ist für den Moment, in dem du schon weißt, was du willst, und die finale Version brauchst.
Prompts in anderen Sprachen werden meistens verstanden. Bei komplexen Szenen mit Dialog ist Englisch sicherer, wie oben erwähnt.
Was es bei Flami kostet
Für internationale Konten listen wir noch keinen Dollarpreis, deshalb halte ich es hier einfach: Du zahlst in Credits. Die Kosten hängen vom Modus und von der Länge ab, auch von der Auflösung. Ein Extend kostet ungefähr so viel wie eine weitere Generierung. Aktuelle Zahlen findest du auf der Veo-3.1-Seite.
Kurzcheck: Passt Veo 3.1 zu dir?
Gut geeignet, wenn du brauchst:
- einen edlen, filmischen Look;
- Ton, der exakt zum Bild passt;
- Werbung für Luxus- oder Beautyprodukte;
- längere Clips, 15 bis 30 Sekunden, mit einem wiederkehrenden Charakter.
Vermutlich nicht das richtige Werkzeug, wenn:
- du eine Serie mit 50 oder mehr Artikeln machst, dann wird es schnell teuer, probier Kling;
- du lesbaren Text im Bild brauchst, nimm für diese Einstellung ein anderes Modell;
- sich der ganze Clip um Hände dreht, die Objekte handhaben, dort ist Kling besser.
Wie es weitergeht
Wenn du zwischen Modellen entscheidest: Ich habe Veo gegen Kling und Runway an denselben Produktaufnahmen antreten lassen, in einem Dreiervergleich. Auch zu Kling gibt es einen eigenen Test, falls du eher dahin tendierst.
Oder probier es selbst aus. Meld dich bei Flami an und verbrenne ein paar Fast-Entwürfe mit den Gratis-Credits, bevor du dich auf Quality festlegst.
FAQ
*Was ist Veo 3.1?* Das Videomodell von Google DeepMind, veröffentlicht am 15. Oktober 2025. Es erzeugt realistische Clips mit Ton, hält einen Charakter über mehrere Szenen konsistent und kann einen Clip per Extend fortsetzen.
*Wie unterscheidet sich Veo 3.1 von Veo 3?* Drei Ergänzungen stechen heraus: Kontrolle über ersten und letzten Frame, mehrere Ausgangsbilder pro Anfrage und Extend für Clips über 8 Sekunden.
*Veo 3.1 gegen Sora 2, was ist besser?* Auf arena.ais Video-Ranking liegen beide praktisch gleichauf. Sora 2 Pro steht mit 1.368 Punkten auf Platz 11, die Veo-3.1-Audio-Version mit 1.364 auf Platz 12, das liegt klar innerhalb der Fehlermarge. Mein Eindruck ist eher, dass Veo sich wörtlicher an den Prompt hält.
*Funktioniert es auch in anderen Sprachen als Englisch?* Prompts werden meistens verstanden. Google hat aber nur Englisch vollständig geprüft, Dialog in anderen Sprachen kann also mal klappen und mal nicht.
*Wie viele Sekunden pro Generierung?* Bis zu 8. Über Extend erlaubt die API bis zu 148, in meinen Tests blieb es aber nur bis etwa 24 oder 32 Sekunden stimmig.
*Kann ich eigene Fotos hochladen?* Ja, bis zu drei Referenzbilder pro Anfrage, so hältst du einen Charakter oder einen Stil konsistent.
*Welche Auflösung unterstützt es?* 720p als Standard. 1080p oder 4K nur bei 8-Sekunden-Clips.
Zuletzt geprüft anhand von Googles Dokumentation am 30. September 2026.
Quellen
- Google DeepMind, Veo
- Google Developers Blog, Veo 3.1 und neue kreative Fähigkeiten in der Gemini-API
- Google, Veo 3.1 und erweiterte Fähigkeiten in Flow
- Google, Veo 3.1 Ingredients-to-Video-Update
- Google AI for Developers, Veo-3.1-Dokumentation
- Google AI for Developers, Gemini-API-Preise
- TechCrunch, Google veröffentlicht Veo 3.1 und bringt es in den Flow-Videoeditor
- arena.ai, Text-to-Video-Rangliste
- Flami, Veo-3.1-Seite
Über den Autor
Jonas Becker
Tester bei Flami
Auch interessant
Runway Aleph Test: ein KI-Video-Editor, kein weiteres Text-to-Video-Modell
Kling 3.0 im Test: zwei Wochen Produktclips, Multi-Shot-Szenen und ein paar Ausrutscher
LMArena-Rangliste für Text-zu-Bild: 80 Modelle, 6,5 Millionen Stimmen
GPT Image 2 Rangliste im Check: zwei Arenen gewonnen, dann von OpenAI selbst überholt