← Todos los artículosReseñas de modelos de IA

Reseña de Wan 2.7: el modelo de video de Alibaba para etiquetas legibles y productos creíbles

Diego Morales30 de septiembre de 2026Lectura de 9 min
Reseña de Wan 2.7: el modelo de video de Alibaba para etiquetas legibles y productos creíbles

Reseña de Wan 2.7: etiquetas legibles, rostros distintos, física creíble, sonido nativo, precios de Alibaba y el problema de los pesos abiertos.

¿Qué modelo dibuja una etiqueta legible en una caja y no le pone a cada personaje la misma cara brillante de IA? Si me preguntas eso mañana, te digo Wan 2.7 antes de que termines la frase. Esa es la versión corta de esta reseña de Wan 2.7. Venía de pasar un buen rato con Hailuo y sus primeros planos cargados de emoción, y Wan resultó ser un animal completamente distinto.

Mi tanda de pruebas fueron videos de producto donde el texto del empaque tenía que sobrevivir: el nombre de la marca en la tapa, un logo al costado, una línea de texto debajo. La mayoría de los modelos quedan en ridículo aquí y garabatean pseudoletras. Wan, en general, lo resuelve bien.

¿Quién hace Wan, y qué es eso del "modo de pensamiento"?

Wan viene de Alibaba, en concreto de su Tongyi Lab. El lado de video de la versión 2.7 se anunció el 7 de abril de 2026 como un conjunto de cuatro modelos: texto a video, imagen a video, referencia a video y un modelo aparte para edición. Alibaba presentó todo esto en torno a la idea de dirigir:

«Un solo prompt puede dar como resultado un storyboard completamente realizado, lo que permite a los usuarios crear obras con nivel de director»

Buena parte del ruido del lanzamiento, incluidas nuestras propias notas sobre el tema, se centró en un Modo de Pensamiento que planifica la toma antes de renderizar. Esto lo noté apenas revisé la documentación para escribir esta nota: el interruptor thinking_mode en realidad vive en los modelos de imagen de Wan 2.7. Del lado de video, la API de imagen a video tiene en su lugar una opción llamada prompt_extend. Reescribe tu prompt y lo hace más completo antes de arrancar el render, y la documentación advierte que eso suma tiempo de proceso.

Le pongas el nombre que le pongas, la idea es la misma. Primero el modelo resuelve la composición y dónde va cada objeto. También planea el movimiento de cámara, y recién después arranca la generación. En mis pruebas ese paso de planificación se notó en escenas cargadas con varios objetos, donde menos cosas salieron raras. Lo pagas en tiempo. Para una toma simple de producto girando, no estoy tan seguro de que valga la espera.

Tres razones por las que sigue en mi rotación

El texto va primero. Carteles, subtítulos, etiquetas de empaque: Wan los renderiza legibles con mucha más frecuencia que la mayoría de los modelos de video que probé. Para publicidad y ecommerce, donde el producto tiene que mostrar su marca con claridad, eso termina siendo lo que decide. Una salvedad: el "12 idiomas" que promociona Alibaba corresponde al modelo de imagen de Wan 2.7, y no encontré un número de idiomas documentado para los modelos de video.

Los rostros son la segunda razón. Ya conoces ese efecto en el que todos en un video de IA terminan pareciendo el mismo desconocido bonito y promediado Wan me dio personas que de verdad se veían distintas entre sí, con formas de cara y ojos diferentes. Si estás armando una campaña con varios personajes, o una serie recurrente, eso pesa más de lo que uno esperaría.

Después está la física. Wan es bueno mostrando cómo funciona un objeto dentro del cuadro. La licuadora gira como debería girar una licuadora, la plancha se desliza sobre la camisa sin flotar por encima, y en uno de mis clips de prueba un taladro muerde la madera y suelta virutas de verdad. Para videos de "producto en acción" suele ser mi primera opción.

Las especificaciones que de verdad vas a comparar

Los clips van de 2 a 15 segundos. La salida es en 720p o 1080p, según la documentación de la API de Alibaba. El audio nativo sale en el mismo proceso, con sincronía de labios. También puedes darle tu propia pista de voz para que la boca y los movimientos del personaje la sigan. Es un salto grande en duración respecto a las primeras versiones de Wan.

Otros detalles de la documentación:

  • arrancar desde un primer fotograma, o fijar tanto el primero como el último;
  • continuar un clip ya existente;
  • referencia a video, con hasta cinco personajes distintos en una misma escena según el anuncio de Alibaba;
  • un modelo de edición aparte que modifica un video existente a partir de una instrucción de texto.

Las proporciones son las habituales, 16:9, 9:16 y 1:1 en Flami, más algunas otras. Ese control de color por código HEX del que tal vez hayas leído, donde escribes el código exacto del color de tu marca, es otra vez algo del modelo de imagen. Si es lo que necesitas, está en la página de Wan 2.7 Image, y lo revisé con más detalle en la reseña de Wan 2.7 Image.

Cuánto cuesta

En la fuente, la lista de precios de Model Studio de Alibaba Cloud pone a Wan 2.7 texto a video e imagen a video en 0,10 USD por segundo en 720p y 0,15 USD por segundo en 1080p, en la región internacional. Entonces un clip de 10 segundos en 1080p sale en 1,50 USD por la API.

En Flami, Wan 2.7 viene incluido en la suscripción general y se paga con créditos. Junto al modelo insignia también tienes Wan 2.6, 2.5, 2.2 Fast y 2.2. Mi lógica es bastante simple: mejores resultados con la 2.7, a cambio de más tiempo y más costo, mientras que las versiones anteriores resuelven más rápido y más barato los trabajos en volumen.

El problema de los pesos abiertos

Wan se ganó su reputación como modelo abierto. La gente se bajaba los pesos y lo corría en su propia GPU. Eso ya no pasa con los lanzamientos más nuevos. La página de Wan-AI de Alibaba en Hugging Face se queda en la familia 2.2 de hace unos meses, y la 2.5, la 2.6, la 2.7 y la nueva 3.0 solo están disponibles por API.

Si usas Wan a través de un servicio, esto no te cambia nada. Si tu plan era correr la 2.7 en tu propio hardware, no hay suerte: la 2.2 sigue siendo la versión más nueva que puedes correr en local.

Salió Wan 3.0, ¿todavía importa la 2.7?

Alibaba lanzó Wan 3.0 en agosto. Genera clips de hasta 30 segundos y acepta un montón de entradas nuevas, hasta documentos. Además, está cerca del top en los rankings a ciegas. En la actualización del 21 de septiembre de 2026 del ranking de texto a video de arena.ai, wan3.0 aparece 6.º con 1476 puntos, mientras que wan2.7-t2v está 20.º con 1337.

Todavía no probé la 3.0 a fondo, así que me quedo con lo que sé. Creo que la 2.7 sigue siendo una buena opción para tomas de producto con texto, y a precio de lista sale un poco más barata por segundo que la 3.0 en 1080p. Probablemente vuelva sobre esto cuando pueda poner las dos lado a lado con los mismos productos.

Cómo reparto el trabajo entre Wan y el resto

A grandes rasgos, así reparto el trabajo:

  • texto, logos y empaque en cuadro: Wan 2.7;
  • un producto haciendo su trabajo, con física creíble: Wan 2.7;
  • luz premium y look de película: Veo 3.1;
  • emoción en primer plano: Hailuo;
  • movimiento rápido y vueltas de cámara: Kling 3.0.

Preguntar en general si Wan o Veo es «mejor» no lleva a ningún lado. Depende de qué esté fallando en tu toma: una luz sin gracia o una etiqueta borrosa.

¿Deberías elegir Wan 2.7?

Recurro a la 2.7 cada vez que la caja tiene texto real o un logo, cuando la escena necesita rostros distintos en lugar de clones de IA, o cuando el producto tiene que funcionar de verdad en pantalla. Que se pueda hacer todo en una sola pasada de 15 segundos también ayuda.

Cuando alguien quiere correr el modelo en su propio servidor la dejo de lado, porque los pesos de la 2.7 nunca se publicaron, o cuando lo que importa es la luz cinematográfica y el clima de la escena. Eso se lo llevo a Veo.

Qué sigue

Lo siguiente en mi lista es Seedance 2.0, después HappyHorse 1.0 y Grok Imagine. También quiero mostrar una combinación que vengo usando: el clip base en Wan y el acabado en Runway. Si nunca usaste Runway como editor, la reseña de Runway Aleph explica la idea.

Carga una caja con etiqueta en Wan 2.7 en Flami y haz zoom al texto para ver cómo aguanta.

Preguntas frecuentes sobre Wan 2.7

*¿Qué es Wan 2.7?* Es la familia de modelos de video de Alibaba, anunciada en abril de 2026. Genera clips de 2 a 15 segundos con sonido nativo, y es especialmente bueno con el texto en cuadro y con rostros distintos entre sí.

*¿Wan 2.7 tiene un modo de pensamiento para video?* Alibaba documenta el interruptor thinking_mode para los modelos de imagen de Wan 2.7. La API de video tiene en cambio prompt_extend, que expande el prompt antes de renderizar y tarda más.

*¿Qué duración y resolución maneja?* De 2 a 15 segundos, en 720p o 1080p; trae audio nativo y sincronía de labios.

*¿Puedo correr Wan 2.7 en local?* No. Sus pesos no están publicados, y la 2.2 es la Wan más nueva con pesos abiertos.

*¿Cuánto cuesta por la API de Alibaba?* 0,10 USD por segundo en 720p y 0,15 USD en 1080p, en la región internacional. En Flami se paga con créditos.

*¿En qué se diferencia de Veo y Kling?* Wan no compite con ninguno de los dos en luz ni en movimiento de alto nivel: su fuerte es que el texto se mantiene legible y los objetos se comportan bien, y a diferencia de versiones anteriores de Wan, los pesos de la 2.7 no son públicos, así que correrlo en tu propio servidor no es una opción.

Última revisión el 30 de septiembre de 2026, contra la documentación de Alibaba Cloud y el ranking de video de arena.ai.

Fuentes

  1. Alibaba Cloud, Alibaba presenta Wan2.7-Video
  2. Alibaba Cloud, Alibaba presenta la generación de imágenes Wan2.7
  3. Alibaba Cloud Model Studio, referencia de la API de imagen a video de Wan 2.7
  4. Alibaba Cloud Model Studio, referencia de la API de generación y edición de imágenes de Wan 2.7
  5. Alibaba Cloud Model Studio, precios de los modelos
  6. Alibaba Cloud, lanzamiento de Wan3.0
  7. Hugging Face, modelos Wan-AI
  8. arena.ai, Text-to-Video Leaderboard
  9. Flami, notas de lanzamiento de Wan 2.7
  10. Flami, página de Wan 2.7

Sobre el autor

Diego Morales

Redactor de reseñas en Flami

Sigue leyendo

Obtén 15 créditos gratis

Úsalos para generar imágenes y videos:

≈ 11 × Nano Banana 2, ≈ 12 × GPT Image 2, ≈ 1 × Seedance 2

Obtener créditos gratis