Reseña de HappyHorse 1.0: cómo rinde en video de producto

HappyHorse 1.0 en video de producto: cómo maneja la física, los reflejos y el detalle en movimiento, qué hace bien y dónde falla todavía.
Soy Javier, ingeniero de producto en Flami. Parte de mi trabajo consiste en probar modelos de video con grabaciones de producto reales y ver dónde aguantan y dónde se rompen. A principios de abril apareció en el ranking de Artificial Analysis un modelo con un nombre raro, HappyHorse, sin marca ni firma, y se llevó el primer puesto sin más. Al principio nadie sabía de quién era. Un par de días después, Alibaba reconoció que el modelo era suyo. Mi primera reacción fue de desconfianza: en los rankings aparecen modelos anónimos todo el tiempo y desaparecen calladitos a la semana siguiente. Este no desapareció. En cuanto empecé a probarlo con grabaciones reales de producto entendí a qué venía tanto revuelo. A partir de ahí me puse a probarlo a fondo en trabajo de producto, viendo qué funciona y qué todavía falla.
La versión corta: cuando el plano gira en torno a un producto y necesitas que el detalle no se deforme ni se emborrone con el movimiento, HappyHorse ya es una de mis tres opciones favoritas.
De dónde salió este caballo
El 7 de abril, HappyHorse-1.0 apareció en el arena de video de Artificial Analysis sin creador declarado y de inmediato superó al líder anterior, Seedance 2.0. El 10 de abril, Alibaba confirmó a CNBC que HappyHorse es un proyecto suyo, construido por el equipo ATH dentro de Taotian Group, y que el modelo sigue en desarrollo activo. Lo lidera Zhang Di, exvicepresidente de Kuaishou y la persona detrás de Kling. O sea que no es un proyecto paralelo armado por un par de estudiantes, es un equipo que ya sacó adelante un modelo de video líder. Ya conté el anuncio y la posición en el ranking en otro artículo; acá solo me importa qué tal rinde en trabajo de producto.
Por dentro, según lo que publicó el equipo, es un único transformer de 15.000 millones de parámetros que genera video y audio en una sola pasada, sin una etapa aparte de posproducción. La mayoría de la competencia todavía arma el resultado por partes en un pipeline. Este corre con un solo motor. El equipo dice que soporta siete idiomas con sincronización de labios, y una velocidad de generación de unos 38 segundos por clip de 1080p en un H100.
Por qué lo puse a prueba en una sesión de producto
Los benchmarks son una cosa. Lo que de verdad necesito es más simple: que el producto en pantalla se vea real y no se desarme apenas se mueve.
Estabilidad de movimiento. Probé la instrucción "una persona gira un hula hoop y hace sentadillas". En la mayoría de los modelos, el aro sale volando del cuadro o se convierte en una mancha borrosa. HappyHorse mantuvo la geometría del aro y las proporciones del cuerpo intactas durante toda la sentadilla. Tampoco hubo deriva: nada de esa deformación lenta donde un objeto se va corriendo de lugar sin que uno lo note.
Reflejos. Esto sí me sorprendió. Una taza sobre una mesa brillante: el reflejo en la superficie se mueve en sincronía con el objeto y mantiene proporciones e iluminación correctas. Espejos, cromo, agua, el manejo de reflejos de HappyHorse de verdad sigue la geometría en vez de emborronar una mancha difusa. Para fotos de moda o productos premium, donde media toma es superficie reflectante, eso es una ventaja real.
Líquidos y textura. Espuma de café, latte art, gotas, humo. El líquido sigue la física de la superficie en vez de temblar de cuadro en cuadro. Probé un clip de una bebida sirviéndose y la expansión se veía convincente, sin tirones.
Lo que dicen de verdad los números del ranking
Aquí va la parte que el marketing suele pasar por alto.
En texto a video sin audio, HappyHorse-1.0 lidera el ranking de Artificial Analysis con un Elo cercano a 1357, bastante por delante de Seedance 2.0. En imagen a video sin audio pasa lo mismo, ventaja clara. Pero apenas se activa el audio, la diferencia se achica: en texto a video con audio, HappyHorse y Seedance 2.0 de ByteDance quedan casi empatados, uno o dos puntos de Elo, prácticamente ruido. En imagen a video con audio, Seedance se adelanta en algunas corridas.
"HappyHorse-1.0 actualmente lidera el Text to Video Arena de Artificial Analysis (sin audio) con un puntaje Elo de 1357."
Fuente: Artificial Analysis, Text to Video Leaderboard
Entonces eso de "líder del ranking" es cierto, con un matiz: va claramente adelante en lo visual sin audio. Con el audio activado, es un empate con Seedance, no una diferencia aplastante. Para trabajo de producto esto no es un problema, la mayoría de los videos de producto se terminan editando con voz en off o música aparte de todas formas, así que la calidad visual sin audio es justo lo primero que me importa.
HappyHorse frente al resto, resumen rápido
Así es más o menos cómo elijo un modelo según el trabajo:
- detalle fino de producto, estabilidad de movimiento: HappyHorse 1.0
- reflejos en espejos, cromo, agua: HappyHorse 1.0
- emoción en primer plano, expresión facial: Hailuo
- look premium, iluminación cinematográfica: Veo 3.1
- movimiento de cámara dinámico: Kling 3.0
- física de objetos en la mano: Wan 2.7
- estética UGC grabada con el teléfono, audio integrado en la imagen: Seedance 2.0
Nada de esto significa que HappyHorse sea más débil en general. Cada modelo tiene su fuerte. El de HappyHorse es que la geometría y las superficies se sostienen durante el movimiento.
Hasta nueve personajes en una sola escena
Hay una función que al principio subestimé. HappyHorse tiene un modo basado en referencias: le das hasta nueve imágenes de referencia y las usas como personajes distintos con etiquetas tipo "character1", "character2". Cada uno mantiene su apariencia consistente durante la escena.
Para trabajo de producto, eso no es un capricho. Una foto grupal con varios productos interactuando, o una escena con dos modelos y un producto que pasa de mano en mano, antes significaba armar varias generaciones por separado en edición. Acá se puede intentar en una sola pasada. Yo hasta ahora solo probé con tres referencias, no las nueve completas, así que no puedo responder por la estabilidad con el máximo. Pero incluso con tres, la consistencia se mantuvo.
Duración, formatos, audio
Ficha técnica: los clips van de 3 a 15 segundos, 5 por defecto. La resolución es 720p o 1080p. Las proporciones cubren casi todo lo que hace falta: 16:9 para horizontal, 9:16 para Reels y TikTok, 1:1 para Instagram, más 4:3 y 3:4.
La generación de audio es opcional, se elige por proyecto. Para videos de producto normalmente lo salto y agrego mi propia música y voz en off en edición, da más control. Las entradas disponibles son texto, hasta nueve imágenes de referencia, y opcionalmente un video existente para editar.
Hablando de edición, hay un modo donde le das a un clip terminado una instrucción de texto: cambias un objeto, cambias el estilo, haces una edición puntual sin regenerar todo desde cero. Acepta video de 3 a 60 segundos. Hasta ahora lo probé poco, se ve práctico, pero cómo se comporta en un clip real de producto con detalle fino todavía me falta probarlo más a fondo.
Ahora la parte honesta, dónde se queda corto
Prometí nada de porras, así que acá van los puntos débiles.
Primero, y esto es lo que más pesa: al lanzamiento, el modelo se describía como abierto pero los pesos no se habían publicado de verdad, los enlaces de GitHub y Model Hub todavía decían "próximamente". La propia Alibaba dice que el proyecto sigue en desarrollo. Yo esperaría antes de tratarlo como un producto terminado y estable, porque es recién salido.
Segundo, pruebas independientes señalan que la continuidad de escena se degrada en clips más largos: cuanto más avanza la generación, más probabilidades hay de que alguna lógica de movimiento se rompa. Yo mismo lo noté en clips de ocho segundos, a veces tiembla un poco cerca del final. Para una toma de producto de 5 o 6 segundos eso casi no importa, pero si estás planeando una secuencia continua más larga, ten eso en cuenta.
Tercero, uno más sutil. Quienes lo revisaron señalan que HappyHorse tiene un espacio de color comprimido, lo que limita el margen para corrección de color después: menos rango en las luces altas, los rojos y cianes saturados se recortan antes. Si vas a hacer trabajo de gradación serio después en Resolve, el material te da menos margen que una grabación real de cámara. Nuestro motion designer me lo señaló directamente; yo no trabajo a fondo en gradación de color, así que lo paso de segunda mano, y es posible que una versión posterior lo corrija.
Y en audio, como dije, no es la ventaja clara que sí tiene en lo visual. El audio es utilizable, simplemente no está por delante de Seedance.
Precio y dónde conseguirlo
A través de plataformas externas, se cobra por segundo: 0,14 USD por segundo en 720p, 0,28 USD por segundo en 1080p, sin mínimos, sin necesidad de suscripción. Un clip de diez segundos en 1080p sale cerca de 2,80 USD.
En Flami, HappyHorse 1.0 está incluido en la suscripción compartida, con cobro por créditos. No hace falta registrarte en otra plataforma ni lidiar con cobro por segundo solo para probar un modelo. Está en el mismo espacio de trabajo que Veo, Kling, Hailuo y el resto, así que cambias de modelo según el trabajo en vez de manejar varias cuentas.
Checklist: ¿te conviene usar HappyHorse 1.0?
- ✓ Sesiones de producto donde el detalle y la estabilidad de movimiento importan
- ✓ Necesitas reflejos convincentes en espejos, cromo, vidrio o agua
- ✓ Física compleja: deporte, acrobacias, interacción con objetos
- ✓ Varios personajes distintos en una escena a partir de imágenes de referencia
- ✗ El plano depende de la emoción en primer plano, ahí Hailuo rinde mejor
- ✗ Necesitas máxima flexibilidad para gradación de color, el espacio de color está comprimido
- ✗ Una escena continua larga en una sola pasada, la continuidad puede romperse cerca del final
Qué sigue
Quiero hacer una comparación directa entre HappyHorse y Seedance 2.0 con los mismos prompts de producto y audio activado, ya que van empatados en el ranking pero la diferencia podría verse más clara lado a lado. También en la lista: una mirada a Wan 2.7 y una nota sobre Grok Imagine. Son artículos distintos, eso sí.
Puedes probar HappyHorse 1.0 en Flami, con créditos iniciales gratis incluidos.
Preguntas frecuentes
¿Qué es HappyHorse 1.0? Un modelo de generación de video del equipo ATH de Alibaba, anunciado en abril de 2026. Produce clips de 3 a 15 segundos en 720p o 1080p, genera video y audio en una sola pasada, y soporta cuatro modos (texto, imagen, basado en referencias, y edición de un video existente) en siete idiomas.
¿De verdad HappyHorse lidera el ranking? Sí, con un matiz: HappyHorse ocupa el primer puesto en Artificial Analysis para texto a video e imagen a video sin audio, mientras que con audio activado queda empatado con Seedance 2.0, y en imagen a video con audio Seedance a veces se adelanta.
¿Cómo se compara con Seedance, Kling y Veo? Sus puntos fuertes son la física estable en movimiento complejo, reflejos precisos en espejos y cromo, simulación correcta de líquidos y buen detalle de producto. En calidad visual sin audio, hoy va por delante de Seedance 2.0, Kling 3.0 y Veo 3.1.
¿Cuántos personajes pueden aparecer en una escena? Hasta nueve. En el modo de referencia, subes entre una y nueve imágenes y las etiquetas a cada personaje con etiquetas como "character1", "character2", etcétera. El modelo mantiene la apariencia de cada uno consistente durante la escena.
¿Cuáles son los puntos débiles? Los pesos todavía no están publicados, el modelo es nuevo y sigue en desarrollo. Los clips más largos pierden continuidad de escena hacia el final. El espacio de color está comprimido, con menos margen para gradación. El audio es utilizable pero no supera a Seedance.
¿Soporta varios idiomas? Sí, escribes la escena y el estilo directamente en el prompt. El equipo dice que soporta varios idiomas con sincronización de labios en siete idiomas.
¿Cómo accedo a HappyHorse 1.0? Directo en plataformas externas, pagarías por segundo sin acceso conjunto a otros modelos. En Flami está incluido en la suscripción compartida con cobro por créditos junto al resto de los modelos, y las cuentas nuevas arrancan con créditos gratis.
Fuentes
- CNBC: Alibaba revelado como creador del modelo de generación de video HappyHorse-1.0
- Artificial Analysis: Text to Video Leaderboard
- Artificial Analysis: Image to Video Leaderboard
- South China Morning Post: HappyHorse de Alibaba supera a Seedance
- Flami: página de producto de HappyHorse 1.0
Sobre el autor
Diego Morales
Redactor de reseñas en Flami
Sigue leyendo
Ideogram 3.0: la IA que deja editar el texto de una imagen como una capa de diseño
Imagen 4: cuando tu foto de producto necesita un estudio limpio, no una estética
Video con IA o grabación real: cuándo tu negocio pequeño sigue necesitando una cámara
Video con IA vs estudio: cuánto cuesta realmente un video de producto