KI-Foto- und Video-Generator: Wenn du beides gleichzeitig brauchst

Ein KI-Foto- und Video-Generator aus einer Hand hält Produktfoto und Clip im gleichen Look, ohne Bruch beim Wechsel zwischen Tools.
Ein Händler hat eine Flasche Olivenöl vor grauem Hintergrund fotografiert, Seitenlicht, ein Tropfen genau am Flaschenhals. Das Foto ist perfekt gelungen. Eine Woche später brauchte er ein Video von genau dieser Flasche, mit genau diesem Tropfen, nur dass sich jetzt etwas bewegen sollte. Und da fing das Problem an: Das Foto kam aus einem Tool, das Video musste in einem anderen komplett neu aufgebaut werden, und die Flasche aus dem zweiten Tool hatte plötzlich eine leicht andere Form. Genau das soll ein kombinierter KI-Foto- und Video-Generator verhindern.
Warum Foto und Clip eigentlich ein Job sind
Video-Modelle arbeiten in zwei Modi. Text-to-Video, bei dem du die Szene in Worten beschreibst. Image-to-Video, bei dem du ein Bild einspeist und das Modell es zum Leben erweckt.
Für Produktaufnahmen gewinnt Image-to-Video fast immer. Der Grund ist simpel: Eine Szene, die nur aus einer Textbeschreibung entsteht, liefert dir etwas, das wie dein Produkt aussieht, nicht dein Produkt. Das Etikett sitzt schief, Proportionen verschieben sich minimal, der Deckel hat plötzlich einen anderen Farbton. Käufer merken das sofort, und das Ergebnis sind Retouren und eine schlechtere Bewertung im Listing.
Deshalb zählt die Reihenfolge: erst ein solides Foto vom echten Produkt, dann wandert dieses Foto als Ausgangsbild in ein Video-Modell. Über genau diesen Schritt habe ich in einem eigenen Artikel geschrieben, aber der Punkt hier ist ein anderer: Zwischen beiden Schritten liegt eine Nahtstelle, und dein Ergebnis hängt komplett davon ab, wie sauber diese Naht ist.
Wo die Kette tatsächlich reißt
Diese Nahtstelle bricht meist an vier Stellen, und keine davon hat mit Kreativität zu tun.
Auflösung ist die erste. Das Bildmodell liefert dir 4K, das Video-Modell kommt nur bis zu einer niedrigeren Auflösung und schrumpft die Datei still und leise. Jedes feine Detail, für das du im Bildmodell bezahlt hast, ist verschwunden, bevor der Clip überhaupt losläuft.
Seitenverhältnis ist die nächste Stelle, an der es schiefgeht. Ein quadratisches Foto geht rein, ein vertikales Video soll rauskommen. Das Modell füllt die fehlenden Ränder selbst auf, und genau dort tauchen Dinge auf, die dein echtes Produkt nie hatte.
Dateiformat ist ein weiterer Knackpunkt. Ein PNG mit transparentem Hintergrund trifft auf ein Video-Modell, das ein durchgehend deckendes Bild erwartet. Die Transparenz wird mit Schwarz oder Weiß aufgefüllt, und plötzlich hat dein Produkt einen Rand.
Farbe ist der letzte der vier Punkte. Farbprofile gehen beim Wechsel zwischen Diensten verloren, der Farbton verschiebt sich. Bei Kosmetik und Kleidung fällt das sofort auf.
Liegen beide Schritte in einem Dienst, schließen sich diese vier Nahtstellen von selbst, weil das Bild direkt in die Video-Stufe übergeht, ohne exportiert und neu hochgeladen zu werden. Sind die Schritte auf zwei Dienste verteilt, flickst du alle vier von Hand, jedes Mal aufs Neue.
Wie ein funktionierender Ablauf aussieht
Hier die Reihenfolge, die ich bei einem Produktclip durchgehe, in Kurzform.
Ich starte mit einem einfachen Produktfoto, eine Handykamera reicht völlig. Das läuft durch ein Bildmodell, um eine saubere Szene zu bekommen: Nano Banana, wenn mir ehrliche Textur wichtig ist, Seedream 5.0, wenn das feine Detail stärker zählt.
Dieses Frame schaue ich mir genau an, denn jeder Fehler darin wandert direkt ins Video und wird dort auffälliger, nicht unauffälliger. Ein leicht schiefes Etikett im Standbild wird zu einem schiefen Etikett, das sich jetzt auch noch bewegt.
Dieses Frame geht als Nächstes in ein Video-Modell. Kling 3.0 hält die Form eines Objekts in der Bewegung stabiler als die meisten Alternativen, Veo 3.1 ist meine Wahl, wenn Ton eine Rolle spielt.
Ich halte die Bewegung klein. Genau hier stolpern Einsteiger meistens: Jeder will einen dramatischen Kameraschwenk, und genau der zerlegt das Produkt auf dem Bildschirm. Ein langsamer Zoom nach vorn wirkt besser als jeder Versuch eines Parfüm-Werbeschwenks.
Ich geb's zu, der vierte Schritt erwischt mich manchmal immer noch. Ich fordere mehr Bewegung an, als das Produkt verträgt, baue alles neu auf und ärgere mich dabei über mich selbst.
Ein KI-Foto- und Video-Generator für den ganzen Katalog
Anders wird's, wenn nicht ein Produkt dran ist, sondern vierzig.
Mit getrennten Tools wird jedes Produkt zu einem eigenen Kreislauf: Frame erzeugen, herunterladen, umbenennen, in den anderen Dienst hochladen, warten, wieder herunterladen. Rechne fünf Minuten manuelle Arbeit pro Artikel, und das, bevor die Versuche mitgezählt sind, die nicht klappen. Bei vierzig Produkten kommen so über drei Stunden reine Klickarbeit zusammen.
Auf einer Plattform bleibt von diesem Kreislauf nur übrig: Frame auswählen und Animieren klicken. Genau deshalb haben wir die Stapelverarbeitung in Flami eingebaut. Ein ganzer Katalog ist in einem Durchgang fertig, statt sich über eine Woche zu ziehen.
Ein zweiter Vorteil zeigt sich erst später: Konsistenz. Vierzig Clips aus einem Prozess mit denselben Einstellungen wirken wie eine zusammengehörige Serie. Vierzig Clips, über verschiedene Tools an verschiedenen Tagen zusammengestückelt, wirken nicht so, und der Unterschied ist sichtbar.
Wer wirklich nur ein Format braucht
Nicht jeder Händler braucht beides.
Verkaufst du auf einer Plattform, die kein Video unterstützt oder wo Clips kaum angeschaut werden, lass die Videos weg und steck die Arbeit in starke Standbilder.
Läuft dein ganzer Auftritt über Social Media mit echtem Footage, lohnt sich das Erzeugen von Bildern von Grund auf vielleicht nicht, etwas KI-Videoschliff auf das, was du schon gedreht hast, aber schon.
Falls du ein Video-Tool für sich allein auswählen willst, gibt es dazu eine eigene Checkliste.
Und ist dein Volumen klein, zwei Produkte im Monat, fällt der Unterschied zwischen einer und zwei Plattformen kaum ins Gewicht. Relevant wird das erst, wenn aus den zwei Produkten ein regelmäßiger Strom wird.
Häufig gestellte Fragen
Wozu überhaupt ein kombinierter KI-Foto- und Video-Generator? Weil es bei Produktaufnahmen eigentlich ein zusammenhängender Job ist: erst ein sauberes Foto vom echten Artikel, dann wird aus diesem Foto ein Clip animiert. Auf zwei Dienste verteilt, gehen Auflösung, Proportionen und Farbe irgendwo dazwischen verloren, und am Ende fixt du das selbst von Hand.
Kann man das Video nicht einfach direkt erzeugen, ohne den Umweg über das Foto? Geht, das ist der Text-to-Video-Modus. Für abstrakte Szenen funktioniert das gut, für ein konkretes Produkt nicht: Das Modell zeichnet etwas, das deinem Artikel ähnelt, nicht deinen tatsächlichen Artikel. Für ein Listing ist das ein Ausschlusskriterium, weil das Produkt, das ankommt, nicht zu dem passt, was der Käufer im Clip gesehen hat.
Welches Modell animiert ein Produktfoto am besten? Kommt aufs Produkt an. Kling hält die Form eines Objekts in der Bewegung meist stabiler, Veo bringt Ton und eine stimmigere Szene mit, Hailuo trifft Mimik besser, wenn eine Person im Bild ist. Die ehrliche Antwort kommt meistens erst, wenn man ein Frame durch zwei oder drei Modelle laufen lässt und vergleicht.
Wie lange dauert die Kombination aus Foto und Video? Der Bildschritt braucht meist Sekunden bis eine Minute, der Videoschritt eine Minute bis mehrere. Die meiste Zeit geht nicht in die Generierung selbst, sondern in die Auswahl des richtigen Ergebnisses, denn hinter jedem brauchbaren Frame stehen meist ein paar verworfene.
Quellen
- Flami: Image-to-Video, wie man ein Produktfoto animiert
- Flami: Kling 3.0 im Test
- Flami: Bild- und Video-KI-Tools im Zusammenspiel
Über den Autor
Jonas Becker
Tester bei Flami
Auch interessant