Imagen a video: cómo animar una foto de producto sin que quede hecha papilla

Qué modelos de IA funcionan mejor para pasar de imagen a video, cómo preparar la foto, prompts de movimiento y los errores que arruinan el producto.
"Tengo una foto de producto bastante buena, ¿cómo la convierto en video?" Es la pregunta que más me hacen. Tiene sentido: nadie quiere montar otra sesión y la foto ya está retocada, así que por qué no hacerla moverse. Eso es imagen a video, o I2V: el modelo toma tu foto como primer cuadro y construye el movimiento encima.
Suena a magia. En la práctica, la mitad de las veces terminas con un producto que parece respirar, derretirse o flotar bajo el agua. Te cuento cómo evitarlo, porque yo cometí cada uno de estos errores.
En qué se diferencia de generar un video desde cero
Cuando escribes un prompt sin foto de referencia, el modelo inventa cómo se ve el producto. Y muchas veces inventa mal: un tono ligeramente distinto, un botón de más, un logo que no coincide. Para un producto real eso es un problema, porque el comprador espera exactamente lo que vio en la publicación.
La imagen a video resuelve esto. Le das una foto exacta de tu producto y el modelo no adivina su apariencia, solo le agrega movimiento. El color, la forma y la etiqueta siguen siendo tuyos; el modelo únicamente toca el movimiento. Por eso el I2V suele ser más fiel que generar video de producto desde texto puro.
Tiene un costo, eso sí. Cuanto más complejo el movimiento que pides, mayor la probabilidad de que el modelo empiece a deformar el producto. Es un equilibrio constante entre "que se vea vivo" y "que se reconozca".
Qué fotos funcionan y cuáles no
Media batalla se gana antes de tocar la IA, en el momento de elegir la imagen. Algunas reglas que me han funcionado.
La foto necesita estar nítida y con buena resolución. Si el original es borroso, el modelo rellena detalles por su cuenta y el producto empieza a desviarse de lo real. Usa la misma toma que pusiste como imagen principal en tu publicación, suele ser la más limpia que tienes.
Un fondo liso o levemente desenfocado funciona mejor. Cuando hay ruido visual alrededor del producto, el modelo no distingue dónde termina el objeto y empieza el entorno, así que anima todo junto. El fondo termina arrastrando al producto con él.
Deja espacio alrededor del producto. Si los bordes del objeto tocan el marco de la foto, el modelo no tiene adónde moverlo, entonces empieza a apretarlo y deformarlo. Deja márgenes.
Algo que no es obvio al principio: una foto que ya captura el "inicio" de un movimiento suele animarse mejor. Café a punto de servirse. Una persona a medio giro, como si fuera a mirar a cámara. Una toma estática y perfectamente simétrica cobra vida de forma más apagada.
Qué modelos uso yo
No todos los modelos animan fotos igual de bien. Según mis propias pruebas, así los divido.
Kling 3.0 es mi caballo de batalla para I2V. Respeta la imagen de origen con cuidado y a la vez entrega movimiento natural, sobre todo en telas, cabello, cualquier cosa que se mueva por sí sola. Además mantiene legible el texto del empaque en lugar de dejarlo borroso. Reseña completa de Kling aquí.
Hailuo es mi elección cuando hay un rostro en la toma. Si animas un cuadro con una persona, entrega las mejores expresiones que he visto entre las herramientas disponibles: una sonrisa sutil, un giro de cabeza, una mirada. Para el estilo "testimonio de cliente" o contenido de belleza, es lo primero que uso. Hablé de Hailuo por separado acá.
Wan 2.7 sirve cuando el producto necesita funcionar de forma convincente. Mecanismos, física, algo que gira o se vierte. Entiende mejor que la mayoría cómo se comportan los objetos y es menos propenso a romper la forma. Reseña de Wan aquí.
Seedance 2.0 es para movimiento estilo UGC, cuando quieres que parezca filmado con el teléfono. Un toque más vivo y casual. Más sobre Seedance.
Y Runway sirve para limpiar: si tu resultado de I2V quedó casi bien pero algo del fondo distrae o la luz no convence, Aleph puede corregir un clip ya generado con un prompt de texto. Qué puede hacer Aleph.
Casi nunca acierto a la primera. Paso la misma foto por dos o tres modelos y veo cuál entendió mejor mi producto. La ventaja de hacerlo en Flami es que todos están bajo una sola suscripción, sin saltar entre herramientas y cuentas distintas.
Cómo escribir el prompt de movimiento
Acá la lógica cambia respecto al texto a video. El producto ya quedó definido por la imagen, así que no hace falta describir cómo se ve. Solo hay que describir el movimiento.
Bien: "la cámara se acerca lentamente, el producto gira apenas, una luz suave recorre la superficie." Corto, enfocado en el movimiento.
Mal: volver a describir el producto, por ejemplo aclarar que es una tetera roja de acero inoxidable. El modelo ya ve eso en la foto. Si redescribes la apariencia, corres el riesgo de que el modelo decida "rehacer" el producto para que coincida con tus palabras, y eso lo aleja de la imagen original.
El truco principal: pide el movimiento más pequeño que todavía se note intencional. No una "órbita salvaje de 720 grados", sino un "acercamiento calmo con un vaivén leve". Cuanto más contenido el movimiento, mejor la chance de que el producto siga siendo él mismo. Un movimiento vistoso y dramático casi siempre sale caro en distorsión.
Eso sí, "pocas palabras" no significa "vago". Desglosa el movimiento segundo a segundo, con el mismo nivel de detalle que un prompt de texto a video, solo que acá todo gira en torno al movimiento, no a la apariencia. Un ejemplo de prompt para la foto de un frasco de perfume:
"Anima esta foto: un frasco de perfume sobre una mesa. 0-2 seg: la cámara se acerca lentamente de plano medio a primer plano, el frasco permanece quieto. 2-4 seg: un haz de luz se desliza suavemente sobre el vidrio de izquierda a derecha, un destello cruza las facetas. 4-6 seg: el reflejo cambia casi imperceptiblemente, una neblina tenue aparece detrás del frasco y se disuelve. La cámara se mantiene casi estática, el movimiento es mínimo y suave. El producto conserva su forma, color y etiqueta sin cambios."
Fíjate que el detalle sigue ahí, pero está puesto en la luz, la cámara y el micromovimiento, no en cómo se ve el frasco, eso ya lo definió la foto.
Si el modelo admite prompt negativo, yo agrego "deformación, forma distorsionada, derretido, texto distorsionado." No siempre ayuda, pero tampoco molesta.
Y vale el mismo consejo que di en mi guía de prompts: conviene escribir la descripción del movimiento en inglés antes de correrla. Con I2V se nota más todavía, un prompt en inglés reduce la chance de que el modelo "corrija" el producto por su cuenta.
Los errores que dejan el producto hecho papilla
Movimiento demasiado rápido. El problema más común, con diferencia. Buscas un efecto wow, pides una órbita veloz, y el modelo no logra sostener la forma. Las proporciones del producto cambian delante de tus ojos. La solución es simple: bajarle intensidad al movimiento.
Un fondo cargado. Ya lo mencioné, pero merece repetirse. Un fondo con ruido arrastra al producto cuando se anima. Si puedes, filma sobre fondo limpio o límpialo antes de pasar la foto por I2V.
Texto pequeño en la etiqueta. Muchos modelos tienen problemas para sostener texto diminuto durante el movimiento, empieza a temblar y deshacerse. Si te importa que se lea la lista de ingredientes o el nombre de la marca, elige un modelo que sostenga bien el texto (Kling, Wan) o evita poner movimiento activo sobre esa zona del cuadro.
Primeros planos de rostros en el modelo equivocado. Si animas un retrato en un modelo que no está pensado para caras, aparece ese efecto raro donde la expresión se ve apenas fuera de lugar. Para eso, usa Hailuo.
Otra cosa que noté, aunque no estoy del todo seguro de que sea real: las fotos verticales parecen animarse de forma un poco más confiable que las horizontales cuando se trata de producto. Puede ser que los modelos entrenen más con contenido vertical de redes sociales. O puede ser pura coincidencia en mis propias pruebas.
Cuándo usar imagen a video y cuándo repetir la sesión de fotos
El I2V no es magia ni reemplaza todo. Así lo pienso yo.
Animar una foto funciona de maravilla cuando ya tienes una toma estática sólida y solo necesitas movimiento para una segunda imagen de la galería o una portada. Rápido, barato, y el producto sigue siendo reconocible.
Pero si necesitas un video narrativo completo con varias escenas, una persona, una demostración paso a paso, una sola foto no alcanza. Ahí entra generar video desde cero con texto o directamente filmar. No se puede sacar una historia completa de una sola imagen, por más que lo intentes.
Entonces el I2V sirve para darle vida a una foto. Cuando necesitas una historia con cambios de escena, ese es otro trabajo: generar desde cero o filmar.
Cómo probarlo
En Flami subes tu foto, eliges el modelo que se ajusta a tu tarea y escribes un prompt corto sobre el movimiento. O, si tienes muchos productos, el modo "Video desde Producto" te permite pegar el link de tu publicación: el servicio toma tus fotos de ahí y las anima con una plantilla que eliges. La segunda opción es para lotes, la primera es para trabajo puntual.
Un último consejo: arranca con tu foto más limpia y el movimiento más calmo que puedas escribir. Si funciona, de ahí sumas más dinamismo. Sale más barato que apostar fuerte desde el inicio y después preguntarte por qué el producto terminó hecho papilla.
Anima tu propia foto → flami.pro
Preguntas frecuentes
¿Qué es imagen a video? Es un modo donde un modelo de IA toma tu fotografía como primer cuadro y construye el movimiento encima, convirtiendo una foto fija en un video corto. El producto sigue siendo reconocible, solo cambia el movimiento.
¿Qué modelo conviene para animar una foto de producto? Depende de la tarea. Kling 3.0 es versátil y respeta bien la imagen de origen, Wan 2.7 es mejor para mecanismos y física, Hailuo para rostros y expresiones, Seedance para movimiento estilo UGC. Yo suelo pasar la misma foto por dos o tres y me quedo con el que ganó.
¿Por qué el producto se deforma al animarlo? Generalmente es un movimiento demasiado agresivo, un fondo cargado o el objeto tocando los bordes del cuadro. Bájale intensidad al movimiento y usa una foto con fondo limpio y margen alrededor del producto.
¿Puedo animar una foto borrosa o de baja calidad? Mejor evitarlo. Si el original no está nítido, el modelo rellena detalles por su cuenta y el producto se desvía. Usa tu toma más limpia, normalmente la imagen principal de tu publicación.
¿Hace falta describir el producto en el prompt para I2V? No. La apariencia ya la define la foto. Describe solo el movimiento: el acercamiento de cámara, un giro leve, cómo se mueve la luz. Redescribir la apariencia puede alejar al producto de la imagen original.
Fuentes
- Flami: reseña de Kling 3.0
- Flami: reseña de Hailuo de MiniMax
- Flami: reseña de Wan 2.7
- Flami: reseña de Runway Aleph
Sobre el autor
Carlos Herrera
Responsable de contenido en Flami
Sigue leyendo
Reseña de Wan 2.7: el modelo de video de Alibaba para etiquetas legibles y productos creíbles
Reseña de Grok Imagine: el modelo de video que abro cuando todavía no sé qué va a funcionar
Veo 3.1 vs Kling 3.0 vs Runway: probé los tres con los mismos videos de producto
Reseña de Runway Aleph: un editor de video con IA, no otro modelo de texto a video