← Alle ArtikelKI-Modelle im Test

Wan 2.7 Test: Alibabas Videomodell für lesbare Etiketten und echt wirkende Produkte

Jonas Becker30. September 20269 Min. Lesezeit
Wan 2.7 Test: Alibabas Videomodell für lesbare Etiketten und echt wirkende Produkte

Wan 2.7 im Test: lesbare Verpackungstexte, unterschiedliche Gesichter, Produktphysik, 15 Sekunden mit Ton und die Frage der offenen Gewichte.

Welches Modell schreibt eine lesbare Beschriftung auf einen Karton und gibt nicht jedem Gesicht dieselbe glatte KI-Optik? Fragst du mich das morgen, sage ich Wan 2.7, noch bevor du den Satz zu Ende gesprochen hast. Das ist die Kurzfassung dieses Tests zu Wan 2.7. Davor hatte ich eine Weile mit Hailuo und emotionalen Nahaufnahmen verbracht, und Wan hat sich als völlig andere Kategorie erwiesen.

Mein Testset waren Produktaufnahmen, bei denen der Text auf der Verpackung die Generierung überstehen musste: ein Markenname auf dem Deckel, ein Logo an der Seite, eine Zeile Fließtext darunter. Die meisten Modelle blamieren sich hier und kritzeln Pseudo-Buchstaben hin. Wan trifft es meistens richtig.

Wer macht Wan, und was hat es mit dem „Thinking“ auf sich?

Wan kommt von Alibaba, genauer von dessen Tongyi Lab. Die Videoseite von Version 2.7 wurde am 7. April 2026 angekündigt, als Paket aus vier Modellen: Text-zu-Video, Bild-zu-Video, Referenz-zu-Video und ein separates Editing-Modell. Alibabas Botschaft drehte sich ganz ums Regieführen:

„Ein einziger Prompt kann ein vollständig ausgearbeitetes Storyboard liefern und Nutzer so vom Ausführenden zum Regisseur machen.“

Ein großer Teil des Hypes rund um den Launch, auch unsere eigenen Notizen dazu, drehte sich um einen Thinking Mode, der die Einstellung plant, bevor gerendert wird. Beim Nachlesen der Doku für diesen Beitrag ist mir etwas aufgefallen, das ich vorher übersehen hatte. Der thinking_mode-Schalter steckt tatsächlich in den Wan 2.7 Bildmodellen. Auf der Videoseite hat die Bild-zu-Video-API stattdessen eine Option namens prompt_extend. Sie schreibt deinen Prompt vor dem Rendern in eine ausführlichere Fassung um, und laut Doku kostet das zusätzliche Zeit.

Wie auch immer man es nennt, die Idee bleibt gleich. Zuerst arbeitet das Modell die Komposition aus und legt fest, wo jedes Objekt landet. Auch die Kamerabewegung wird geplant, erst danach beginnt die eigentliche Generierung. In meinen Durchläufen hat sich dieser Planungsschritt bei unübersichtlichen Szenen mit mehreren Objekten ausgezahlt, dort ging weniger schief. Bezahlt wird das mit Zeit. Ich bin mir nicht sicher, ob sich das Warten bei einer einfachen rotierenden Produktaufnahme lohnt.

Drei Gründe, warum es bei mir im Einsatz bleibt

An erster Stelle steht die Schrift. Schilder, Bildunterschriften, Etiketten auf Verpackungen: Wan rendert sie deutlich öfter lesbar als die meisten Videomodelle, die ich ausprobiert habe. Für Werbung und E-Commerce, wo der Markenname klar zu erkennen sein muss, ist das der entscheidende Punkt. Eine Einschränkung: Alibabas offizielle Angabe von „12 Sprachen“ gehört zum Wan 2.7 Bildmodell, und für die Videomodelle habe ich keine Sprachenzahl gefunden.

Gesichter sind der zweite Grund. Kennst du den Effekt, bei dem in KI-Aufnahmen alle wie derselbe gemittelte, hübsche Fremde aussehen? Bei Wan hatte ich Leute, die tatsächlich unterschiedlich aussahen, mit verschiedenen Gesichtsformen und Augen. Läuft bei dir eine Kampagne mit mehreren Charakteren oder eine wiederkehrende Serie, zählt das mehr, als man zunächst denkt.

Dann die Physik. Wan zeigt gut, wie ein Objekt im Bild tatsächlich funktioniert. Der Mixer dreht sich so, wie ein Mixer sich drehen sollte, das Bügeleisen gleitet über das Hemd, statt darüber zu schweben, und in einem meiner Testclips beißt sich eine Bohrmaschine ins Brett und wirft echte Späne. Für „Produkt in Aktion“ ist es meistens meine erste Wahl.

Die Specs, die du wirklich vergleichst

Clips laufen zwischen 2 und 15 Sekunden. Die Ausgabe liegt laut Alibabas API-Doku bei 720p oder 1080p. Nativer Ton kommt aus demselben Durchlauf, inklusive Lippensynchronisation. Du kannst auch deine eigene Sprachspur einspeisen, damit Mund und Bewegungen des Charakters ihr folgen. Das ist gegenüber den frühen Wan-Versionen ein großer Sprung bei der Länge.

Ein paar weitere Details aus der Doku:

  • ab einem ersten Frame starten oder Start- und Endframe gemeinsam festlegen;
  • einen bestehenden Clip fortsetzen;
  • Referenz-zu-Video, laut Alibabas Ankündigung mit bis zu fünf unterschiedlichen Charakteren in einer Szene;
  • ein eigenes Editing-Modell, das ein bestehendes Video anhand einer Textanweisung verändert.

Seitenverhältnisse sind bei Flami die üblichen 16:9, 9:16 und 1:1, dazu ein paar weitere. Die HEX-Farbsteuerung, von der du vielleicht gelesen hast, bei der du den exakten Code deiner Markenfarbe eingibst, gehört wieder zum Bildmodell. Falls du das brauchst, findest du sie auf der Wan 2.7 Image-Seite, ich bin im Wan 2.7 Image-Test genauer darauf eingegangen.

Was es kostet

An der Quelle listet Alibaba Clouds Model-Studio-Preisliste Wan 2.7 Text-zu-Video und Bild-zu-Video mit 0,10 US-Dollar pro Sekunde bei 720p und 0,15 US-Dollar pro Sekunde bei 1080p in der internationalen Region. Ein 10 Sekunden langer Clip in 1080p kommt über die API damit auf 1,50 US-Dollar.

Bei Flami ist Wan 2.7 Teil des normalen Abos und wird in Credits bezahlt. Neben dem Flaggschiff bekommst du auch Wan 2.6, 2.5, 2.2 Fast und 2.2. Meine Logik dahinter ist simpel: 2.7 liefert die besten Ergebnisse, braucht aber länger und kostet mehr, während die älteren Versionen für Aufträge in großer Zahl schneller und günstiger sind.

Die Falle mit den offenen Gewichten

Wan hat sich seinen Ruf als offenes Modell aufgebaut. Leute haben sich die Gewichte heruntergeladen und auf eigener Hardware laufen lassen. Für die neueren Versionen stimmt das nicht mehr. Alibabas Wan-AI-Seite auf Hugging Face hört weiterhin bei der 2.2-Familie vom letzten Sommer auf, und 2.5, 2.6, 2.7 sowie das neue 3.0 gibt es nur über die API.

Nutzt du Wan über einen Dienst, ändert das für dich nichts. Wolltest du 2.7 auf eigener Hardware hosten, hast du ehrlich gesagt Pech, 2.2 bleibt die neueste Version, die sich noch lokal betreiben lässt.

Wan 3.0 ist da, zählt 2.7 noch?

Im August hat Alibaba Wan 3.0 veröffentlicht. Es erzeugt Clips bis zu 30 Sekunden und nimmt einen Haufen neuer Eingaben entgegen, sogar Dokumente. Es steht auch nahe an der Spitze der blinden Ranglisten. Im Update vom 21. September 2026 der Text-zu-Video-Rangliste von arena.ai liegt wan3.0 mit 1.476 Punkten auf Platz 6, während wan2.7-t2v mit 1.337 Punkten auf Platz 20 liegt.

Ich habe 3.0 noch nicht richtig getestet, deshalb bleibe ich bei dem, was ich weiß: 2.7 ist weiterhin eine solide Wahl für Produktaufnahmen mit Text darauf, und zu Listenpreisen ist es pro Sekunde in 1080p etwas günstiger als 3.0. Ich würde das vermutlich noch mal aufgreifen, sobald ich beide an denselben Produkten nebeneinander getestet habe.

Wie ich Aufträge zwischen Wan und dem Rest aufteile

Damit ich den Überblick behalte, teile ich Arbeit ungefähr so auf:

  • Text, Logos und Verpackung im Bild: Wan 2.7;
  • ein Produkt, das seinen Job macht, mit glaubwürdiger Physik: Wan 2.7;
  • edles Licht und Filmlook: Veo 3.1;
  • Emotion in der Nahaufnahme: Hailuo;
  • schnelle Bewegung und Kamerafahrten drumherum: Kling 3.0.

Ob Wan oder Veo insgesamt „besser“ ist, das bringt dich nicht weiter. Es kommt darauf an, was bei deiner Aufnahme schiefgeht: mattes Licht oder ein verschwommenes Etikett.

Solltest du dich für Wan 2.7 entscheiden?

Ich greife zu 2.7, sobald auf der Verpackung echter Text oder ein Logo steht, wenn die Szene unterschiedliche Gesichter statt KI-Klone braucht, oder wenn das Produkt im Bild tatsächlich funktionieren muss. Der einzelne 15-Sekunden-Durchgang hilft zusätzlich.

Ich lasse es links liegen, wenn jemand das Modell auf einem eigenen Server betreiben will, denn die 2.7-Gewichte wurden nie veröffentlicht, oder wenn es eigentlich nur um kinoreifes Licht und Stimmung geht. Dafür ist Veo die bessere Adresse.

Was als Nächstes ansteht

Als Nächstes stehen bei mir Seedance 2.0, dann HappyHorse 1.0 und Grok Imagine an. Außerdem will ich eine Kombi zeigen, die ich gerade nutze: einen Basisclip in Wan und den Feinschliff in Runway. Falls du Runway noch nie als Editor genutzt hast, erklärt der Runway-Aleph-Test die Idee dahinter.

Lad einen beschrifteten Karton bei Wan 2.7 auf Flami hoch und zoom in den Text hinein, um zu sehen, wie gut er sich hält.

Häufige Fragen zu Wan 2.7

  • Was ist Wan 2.7? Alibabas Familie von Videomodellen, angekündigt im April 2026. Sie erzeugt Clips von 2 bis 15 Sekunden mit nativem Ton und ist besonders stark bei Text im Bild und bei unterschiedlichen Gesichtern.
  • Hat Wan 2.7 einen Thinking Mode für Video? Alibaba dokumentiert den thinking_mode-Schalter für die Wan 2.7 Bildmodelle. Die Video-API hat stattdessen prompt_extend. Das erweitert den Prompt vor dem Rendern und dauert länger.
  • Welche Länge und Auflösung sind möglich? Zwischen 2 und 15 Sekunden. Die Auflösung liegt bei 720p oder 1080p, mit nativem Ton und Lippensynchronisation.
  • Kann ich Wan 2.7 lokal betreiben? Nein. Die Gewichte sind nicht veröffentlicht, 2.2 ist die neueste Wan-Version mit offenen Gewichten.
  • Was kostet es über Alibabas API? 0,10 US-Dollar pro Sekunde bei 720p und 0,15 US-Dollar bei 1080p in der internationalen Region. Bei Flami zahlst du in Credits.
  • Wie unterscheidet es sich von Veo und Kling? Wan konkurriert bei keinem der beiden mit Licht oder Spitzenbewegung, seine Stärke ist lesbarer Text und Objekte, die sich richtig verhalten, und anders als bei älteren Wan-Versionen sind die Gewichte von 2.7 nicht öffentlich, Self-Hosting fällt also weg.

Zuletzt geprüft am 30. September 2026, anhand von Alibaba Clouds Doku und der Videorangliste von arena.ai.

Quellen

  1. Alibaba Cloud, Alibaba Unveils Wan2.7-Video
  2. Alibaba Cloud, Alibaba Unveils Wan2.7 image generation
  3. Alibaba Cloud Model Studio, Wan 2.7 Image-to-Video API-Referenz
  4. Alibaba Cloud Model Studio, Wan 2.7 Image Generation and Editing API-Referenz
  5. Alibaba Cloud Model Studio, Preisliste
  6. Alibaba Cloud, Wan3.0-Launch
  7. Hugging Face, Wan-AI-Modelle
  8. arena.ai, Text-to-Video-Rangliste
  9. Flami, Wan 2.7 Launch-Notizen
  10. Flami, Wan 2.7 Seite

Über den Autor

Jonas Becker

Tester bei Flami

Auch interessant

Hol dir 15 Credits kostenlos

Damit kannst du Bilder und Videos generieren:

≈ 11 × Nano Banana 2, ≈ 12 × GPT Image 2, ≈ 1 × Seedance 2

Kostenlose Credits holen