HappyHorse 1.0 Test: Wo das Video-Modell bei Produktshoots überzeugt, wo nicht

HappyHorse 1.0 im Praxistest: Physik, Spiegelungen und feine Details in Bewegung bei Produktvideos. Wo das Modell überzeugt, wo es noch schwächelt.
Ich bin Jonas, Product Engineer bei Flami. Ein Teil meiner Arbeit besteht darin, Video-Modelle in Produktshoot-Tests laufen zu lassen und zu notieren, wo sie halten und wo sie zerfallen. Anfang April tauchte ein Modell mit dem merkwürdigen Namen HappyHorse in der Artificial-Analysis-Arena auf, ganz ohne Branding, und setzte sich direkt an die Spitze. Zunächst wusste niemand, wer dahintersteckt. Ein paar Tage später bestätigte Alibaba, dass es ihr Projekt ist. Meine erste Reaktion war Skepsis: Anonyme Modelle tauchen ständig in Ranglisten auf und verschwinden eine Woche später wieder. Dieses hier verschwand nicht. Als ich es gegen echtes Produktmaterial laufen ließ, verstand ich, worum der Wirbel ging.
Kurz gesagt: Wenn die Aufnahme ein Produkt zeigt und die Details bei Bewegung nicht verschwimmen dürfen, gehört HappyHorse jetzt zu meinen drei Favoriten.
Woher dieses Pferd kommt
Am 7. April 2026 erschien HappyHorse-1.0 in der Artificial-Analysis-Video-Arena ohne genannten Hersteller und überholte sofort den bisherigen Spitzenreiter, Seedance 2.0. Am 10. April bestätigte Alibaba gegenüber CNBC, dass HappyHorse ihr Projekt ist, entwickelt vom ATH-Team innerhalb der Taotian Group, und dass das Modell noch aktiv weiterentwickelt wird. Geleitet wird das Team von Zhang Di, ehemaliger VP bei Kuaishou und der Kopf hinter Kling. Das ist also kein Nebenprojekt von ein paar Studierenden, sondern ein Team, das bereits ein führendes Video-Modell ausgeliefert hat. Die Ankündigung und die Benchmark-Platzierungen habe ich in einem eigenen Beitrag aufgearbeitet, hier geht es nur um die Praxis bei Produktaufnahmen.
Unter der Haube ist es, nach dem, was das Team veröffentlicht hat, ein einzelner Transformer mit 15 Milliarden Parametern, der Video und Audio in einem Durchgang erzeugt, ohne separate Nachbearbeitungsstufe. Die meisten Konkurrenten setzen das Ergebnis immer noch aus mehreren Pipeline-Schritten zusammen. Hier läuft alles über eine einzige Engine. Das Team gibt Unterstützung für sieben Sprachen mit Lippensynchronisation an sowie eine Generierungszeit von rund 38 Sekunden pro 1080p-Clip auf einer H100.
Warum ich es durch einen Produktshoot-Test geschickt habe
Benchmarks sind das eine. Was mich wirklich interessiert, ist simpler: ein Produkt im Bild, das echt aussieht und bei Bewegung nicht auseinanderfällt.
Bewegungsstabilität. Ich habe den Prompt „eine Person dreht einen Hula-Hoop-Reifen und geht in die Hocke“ getestet. Bei den meisten Modellen fliegt der Reifen entweder aus dem Bild oder wird zu einem Schlieren-Fleck. HappyHorse hat die Geometrie des Reifens und die Proportionen des Körpers über die gesamte Bewegung hinweg sauber gehalten. Auch kein Drift, also kein langsames Verschieben, bei dem ein Objekt unmerklich aus seiner Position wandert.
Spiegelungen. Das hat mich überrascht. Ein Becher auf einem glänzenden Tisch, die Spiegelung auf der Oberfläche bewegt sich synchron zum Objekt und behält Proportionen und Lichtverhältnisse bei. Spiegel, Chrom, Wasser: Bei HappyHorse folgt die Spiegelung tatsächlich der Geometrie, statt nur einen unscharfen Fleck zu verschmieren. Für Fashion-Shots oder Premiumprodukte, bei denen die halbe Aufnahme aus reflektierender Oberfläche besteht, ist das ein echter Vorteil.
Flüssigkeiten und Texturen. Kaffeeschaum, Latte Art, Tropfen, Rauch. Flüssigkeit folgt der Oberflächenphysik, statt von Bild zu Bild zu ruckeln. Ich habe einen Clip mit einem eingeschenkten Getränk getestet, die Ausbreitung sah überzeugend aus, ohne Stottern.
Was die Ranglisten-Zahlen wirklich sagen
Hier kommt der Teil, den Marketingtexte gerne weglassen.
Bei Text-zu-Video ohne Audio führt HappyHorse-1.0 die Artificial-Analysis-Rangliste an mit einem Elo-Wert von etwa 1.357, deutlich vor Seedance 2.0. Bild-zu-Video ohne Audio zeigt dasselbe Bild, ein klarer Vorsprung. Schaltet man Audio dazu, schrumpft der Abstand: Bei Text-zu-Video mit Audio liegen HappyHorse und Seedance 2.0 von ByteDance fast gleichauf, ein bis zwei Elo-Punkte Unterschied, praktisch Rauschen. Bei Bild-zu-Video mit Audio liegt Seedance in manchen Durchläufen sogar vorn.
„HappyHorse-1.0 führt derzeit die Artificial-Analysis-Text-zu-Video-Arena (ohne Audio) mit einem Elo-Wert von 1.357 an.“
Quelle: Artificial Analysis, Text-to-Video-Leaderboard
„Ranglisten-Spitzenreiter“ stimmt also, mit einer Einschränkung: Bei reiner Bildqualität ohne Audio liegt es eindeutig vorn. Mit Audio ist es ein Unentschieden gegen Seedance, kein klarer Vorsprung. Für Produktarbeit ist das kein Problem, die meisten Produktvideos durchlaufen ohnehin eine Schnittphase mit separater Vertonung oder Musik. Bildqualität ohne Audio ist genau das, worauf ich zuerst achte.
HappyHorse gegen den Rest, grobe Einordnung
So wähle ich ungefähr ein Modell je nach Aufgabe:
- feine Produktdetails, Bewegungsstabilität: HappyHorse 1.0
- Spiegelungen in Spiegeln, Chrom, Wasser: HappyHorse 1.0
- Nahaufnahmen mit Emotion, Mimik: Hailuo
- Premium-Look, filmisches Licht: Veo 3.1
- dynamische Kamerafahrten: Kling 3.0
- Objektphysik in der Hand: Wan 2.7
- Handyaufnahme-UGC-Look, Audio direkt im Bild: Seedance 2.0
Das heißt nicht, dass HappyHorse insgesamt schwächer ist. Jedes Modell hat seine Stärke. Die von HappyHorse liegt darin, dass Geometrie und Oberflächen unter Bewegung zusammenhalten.
Bis zu neun Figuren in einer Szene
Ein Feature, das ich anfangs unterschätzt habe. HappyHorse bietet einen referenzbasierten Modus: Du gibst bis zu neun Referenzbilder ein und weist sie über Tags wie „character1“, „character2“ als eigenständige Figuren zu. Jede behält ihr Aussehen über die ganze Szene hinweg konsistent.
Für Produktarbeit ist das kein Spielzeug. Eine Gruppenaufnahme mit mehreren interagierenden Produkten oder eine Szene mit zwei Models, die ein Produkt untereinander weitergeben, bedeutete bisher, einzelne Generierungen im Schnitt zusammenzufügen. Hier lässt sich das in einem Durchgang probieren. Ich habe bisher nur bis zu drei Referenzen getestet, nicht die vollen neun, deshalb kann ich für die Stabilität bei der maximalen Anzahl nichts garantieren. Aber schon bei drei blieb die Konsistenz erhalten.
Länge, Formate, Audio
Zu den technischen Eckdaten: Clips laufen 3 bis 15 Sekunden, Standard sind 5. Auflösung ist 720p oder 1080p. Die Seitenverhältnisse decken so ziemlich alles ab, was man braucht, 16:9 für horizontal, 9:16 für Reels und TikTok, 1:1 für Instagram, dazu 4:3 und 3:4.
Audiogenerierung ist optional, du entscheidest pro Projekt. Bei Produktvideos lasse ich sie meist weg und füge Musik und Vertonung selbst im Schnitt hinzu, das gibt mehr Kontrolle. Als Eingabe dienen Text, bis zu neun Referenzbilder und optional ein bestehendes Video zum Bearbeiten.
Apropos Bearbeiten: Es gibt einen Modus, bei dem du einem fertigen Clip eine Textanweisung gibst, ein Objekt austauschst, den Stil änderst, eine lokale Änderung vornimmst, ohne alles von vorn zu generieren. Akzeptiert werden Videos von 3 bis 60 Sekunden. Ich habe das bisher nur oberflächlich getestet, wirkt praktisch, aber wie es sich bei einem echten Produktclip mit feinen Details schlägt, muss ich noch gründlicher testen.
Jetzt der ehrliche Teil, wo es schwächelt
Ich hatte keine reine Lobeshymne versprochen, also hier die Schwachstellen.
Erstens, und das wiegt am schwersten: Bei der Vorstellung wurde das Modell als offen beschrieben, aber die Gewichte waren noch nicht veröffentlicht, GitHub- und Model-Hub-Links standen noch auf „demnächst“. Alibaba selbst sagt, das Projekt sei noch in Entwicklung. Ich würde es noch nicht als fertiges, stabiles Produkt behandeln, dafür ist es noch zu neu.
Zweitens: Unabhängige Tests zeigen, dass die Szenenkontinuität bei längeren Clips nachlässt, je weiter die Generierung fortschreitet, desto höher die Chance, dass irgendeine Bewegungslogik aussetzt. Das habe ich bei Acht-Sekunden-Clips ebenfalls beobachtet, gegen Ende wackelt es gelegentlich. Für einen 5-6-Sekunden-Produktshot spielt das kaum eine Rolle, wenn du aber eine längere durchgehende Sequenz planst, solltest du es im Hinterkopf behalten.
Drittens, etwas subtiler: Rezensenten weisen darauf hin, dass HappyHorse einen komprimierten Farbraum hat, was die Flexibilität beim Color Grading einschränkt, weniger Spielraum in den Lichtern, gesättigte Rot- und Cyantöne clippen früher. Wer danach ernsthaft in Resolve weiterarbeitet, hat weniger Puffer als bei echtem Kameramaterial. Unser Motion-Designer hat mich direkt darauf hingewiesen, ich selbst arbeite nicht tief im Color Grading, gebe das also aus zweiter Hand weiter, möglich, dass eine spätere Version das behebt.
Und beim Audio, wie gesagt, ist es nicht der klare Sieg, den es bei Visuals gibt. Der Ton ist brauchbar, liegt aber nicht vor Seedance.
Preise und wo man es bekommt
Über Drittanbieter-Plattformen wird pro Sekunde abgerechnet: 0,14 $ pro Sekunde bei 720p, 0,28 $ pro Sekunde bei 1080p, ohne Mindestmenge, ohne Abo. Ein zehnsekündiger 1080p-Clip kostet rund 2,80 $.
Bei Flami ist HappyHorse 1.0 Teil der gemeinsamen Subscription, abgerechnet über Credits. Du musst dich nicht extra auf einer separaten Plattform anmelden oder dich mit Sekundenpreisen herumschlagen, nur um ein Modell zu testen. Es liegt im selben Arbeitsbereich wie Veo, Kling, Hailuo und der Rest, du wechselst also je nach Aufgabe das Modell, statt zwischen Accounts hin und her zu springen.
Checkliste: Lohnt sich HappyHorse 1.0 für dich
- ✓ Produktshoots, bei denen Detail und Bewegungsstabilität zählen
- ✓ Du brauchst überzeugende Spiegelungen in Spiegeln, Chrom, Glas oder Wasser
- ✓ Komplexe Physik: Sport, Akrobatik, Interaktion mit Objekten
- ✓ Mehrere eigenständige Figuren in einer Szene aus Referenzbildern
- ✗ Die Aufnahme lebt von Nahaufnahme-Mimik, da ist Hailuo stärker
- ✗ Du brauchst maximale Flexibilität beim Color Grading, der Farbraum ist komprimiert
- ✗ Eine lange durchgehende Szene in einem Durchgang, die Kontinuität kann gegen Ende aussetzen
Was als Nächstes kommt
Ich will HappyHorse direkt gegen Seedance 2.0 mit denselben Produkt-Prompts und Audio an testen, da beide in der Rangliste gleichauf liegen, der Unterschied im direkten Vergleich aber deutlicher ausfallen könnte. Außerdem in der Warteschlange: ein Blick auf Wan 2.7 und eine Notiz zu Grok Imagine. Das sind dann aber eigene Artikel.
HappyHorse 1.0 kannst du bei Flami ausprobieren, inklusive kostenloser Start-Credits.
Häufig gestellte Fragen
Was ist HappyHorse 1.0? Ein Video-Generierungsmodell vom ATH-Team bei Alibaba, angekündigt im April 2026. Es erzeugt Clips von 3 bis 15 Sekunden in 720p oder 1080p, generiert Video und Audio in einem Durchgang und unterstützt vier Modi (Text, Bild, referenzbasiert und Bearbeitung eines bestehenden Videos) in sieben Sprachen.
Ist HappyHorse wirklich Ranglisten-Spitzenreiter? Ja, mit einer Einschränkung: HappyHorse führt bei Artificial Analysis die Rangliste für Text-zu-Video und Bild-zu-Video ohne Audio an, mit Audio liegt es gleichauf mit Seedance 2.0, bei Bild-zu-Video mit Audio liegt Seedance teilweise sogar vorn.
Wie schneidet HappyHorse im Vergleich zu Seedance, Kling und Veo ab? Seine Stärken sind stabile Physik bei komplexer Bewegung, präzise Spiegelungen in Spiegeln und Chrom, korrekte Flüssigkeitssimulation und starke Produktdetails. Bei reiner Bildqualität ohne Audio liegt es derzeit vor Seedance 2.0, Kling 3.0 und Veo 3.1.
Wie viele Figuren können in einer Szene auftauchen? Bis zu neun. Im Referenzmodus gibst du zwischen einem und neun Referenzbildern an und weist sie Figuren über Tags wie „character1“, „character2“ usw. zu. Das Modell hält das Aussehen jeder Figur über die Szene hinweg konsistent.
Wo liegen die Schwachstellen? Die Modellgewichte sind noch nicht öffentlich verfügbar, das Modell ist neu und noch in Entwicklung. Längere Clips verlieren gegen Ende an Szenenkontinuität. Der Farbraum ist komprimiert, was weniger Spielraum beim Grading lässt. Audio ist brauchbar, aber nicht vor Seedance.
Unterstützt es mehrere Sprachen? Ja, du schreibst Szene und Stil direkt im Prompt. Das Team gibt Mehrsprachen-Unterstützung mit Lippensynchronisation für sieben Sprachen an.
Wie bekomme ich Zugriff auf HappyHorse 1.0? Direkt über Drittanbieter-Plattformen zahlst du pro Sekunde, ohne gebündelten Zugriff auf andere Modelle. Bei Flami ist es Teil der gemeinsamen Subscription mit Abrechnung über Credits, zusammen mit den anderen Modellen, und neue Accounts starten mit kostenlosen Credits.
Quellen
- CNBC: Alibaba als Entwickler des KI-Video-Generierungsmodells HappyHorse-1.0 bestätigt
- Artificial Analysis: Text-to-Video-Leaderboard
- Artificial Analysis: Image-to-Video-Leaderboard
- South China Morning Post: Alibabas HappyHorse überholt Seedance
- Flami: HappyHorse 1.0 Produktseite
Über den Autor
Jonas Becker
Tester bei Flami