← Todos los artículosReseñas de modelos de IA

Reseña de Veo 3.1: qué hace bien el modelo de video de Google en 2026 y en qué todavía falla

Diego Morales30 de septiembre de 2026Lectura de 10 min
Reseña de Veo 3.1: qué hace bien el modelo de video de Google en 2026 y en qué todavía falla

Reseña práctica de Veo 3.1: sonido nativo, Extend para clips largos, un mismo personaje en varias escenas, puntos débiles y precios de la API de Google.

¿Todavía vale la pena pagar por un modelo de video cuando ya salió del top diez? Esa pregunta me acompañó mientras escribía esta reseña de Veo 3.1. En Flami pruebo los modelos de video antes de que lleguen a los usuarios, lo que en la práctica significa usarlos a mano y después anotar dónde mienten. A Veo 3.1 le dediqué dos semanas seguidas: primero en un par de proyectos propios y después en un lote de videos de producto. Abajo cuento qué hace de verdad, dónde todavía se equivoca y por qué te interesaría si ya tienes Kling o Runway.

Qué es Veo 3.1, en términos simples

Es el modelo de video de Google DeepMind. La versión 3.1 salió el 15 de octubre de 2025, se anunció en el Google Developers Blog y ese mismo día lo cubrió TechCrunch. Desde entonces Google lo ha ido parchando en vez de reemplazarlo. Una actualización de enero mejoró la consistencia del personaje y sumó video vertical nativo más upscaling a 1080p y 4K, y en marzo apareció un nivel Veo 3.1 Lite más barato para desarrolladores. Hoy la página del modelo de DeepMind sigue listando 3.1 como el Veo vigente. No existe un Veo 4, digan lo que digan algunos blogs.

¿Dónde queda frente a la competencia? Está más abajo que antes. En el ranking de video de arena.ai (actualización del 21 de septiembre de 2026), la mejor entrada de Veo 3.1, la versión con audio, ocupa el puesto 12 con 1364 puntos. Por encima hay modelos más nuevos, incluido uno del propio Google.

Las especificaciones, según la documentación de la API de Gemini:

  • duración del clip: 4, 6 u 8 segundos;
  • resolución: 720p por defecto; 1080p o 4K solo para clips de 8 segundos;
  • fotogramas: 24 fps fijos;
  • proporciones: 16:9 y 9:16;
  • imágenes de referencia: hasta tres.

Para la mayoría de los trabajos, 8 segundos alcanza. Cuando no alcanza, está Extend.

Google destaca cuatro funciones estrella para esta versión, así que las voy a repasar una por una y contar qué se sostuvo en mis pruebas.

El sonido nativo es la gran novedad

Primero el video, después el audio escrito o generado aparte, y luego una mezcla para unir todo. Así funcionaba antes. Veo 3.1 hace todo eso en una sola generación.

Y va sincronizado con la escena, que es lo que importa. Si en la imagen se sirve agua, se escucha cómo cae. Si alguien habla, el movimiento de labios cuadra. Yo probé el habla sobre todo en inglés, y ahí la sincronización labial funcionó bien. La documentación de Google dice que el inglés es el único idioma que evaluaron a fondo. La frase exacta es que otros idiomas «pueden funcionar, pero los resultados varían», y eso coincidió con lo que esperaba para cualquier cosa fuera del inglés. Si algo importante va en otro idioma, prefiero escribir el diálogo en inglés o directamente prescindir del habla y quedarme solo con el sonido ambiente.

El sonido ambiente está cerca de la perfección. El murmullo de un café, pasos sobre el pavimento, el silbido de una máquina de espresso, el roce de la tela. El modelo agrega todo eso solo, a partir del contexto. Para clips sencillos de menos de 8 segundos, ya casi no hace falta un diseñador de sonido.

Lo que no estuvo a la altura fue el estéreo. Esperaba una mezcla espacial de verdad. Lo que obtuve fue mono o un estéreo falso. Tal vez el modo Quality lo resuelve: yo usé sobre todo Fast, así que puedo estar equivocado en esto.

Extend, o cómo pasar de los 8 segundos sin que se note la costura

Un anuncio de 20 o 30 segundos significaba generar varias piezas y coserlas en un editor, y las uniones siempre se notaban. La luz cambia, la pose del personaje salta, a veces el tono de piel se corre, y el ojo del espectador se queda justo en esos momentos.

Extend continúa un clip terminado, de modo que el siguiente segmento arranca justo en el fotograma donde acabó el anterior. La luz se mantiene, y también el ángulo de cámara y el color. La API suma 7 segundos por cada extensión, hasta 20 veces, con un techo de 148 segundos, aunque solo a 720p.

En la práctica pude encadenar 3 o 4 piezas antes de que algo fallara. Después de eso el modelo va perdiendo poco a poco la cara del personaje, y los detalles de la ropa empiezan a cambiar. Así que 16 a 24 segundos es el rango en el que confiaría de verdad, aunque la ficha técnica permita mucho más. En Flami, Extend es un paso aparte que corres después del clip base, directo desde la página de Veo 3.1.

Un mismo personaje en varias escenas

Esto es un salto grande respecto a Veo 3. Antes el límite era una sola imagen de referencia. Veo 3.1 acepta hasta tres, así que puedes fijar una persona, un vestuario, un look completo, y mantenerlo a lo largo del clip. La actualización de enero de Google llevó esto más lejos y lo llama consistencia de identidad.

El modelo mantiene la cara y la ropa consistentes durante toda la escena. Hasta la forma de moverse. Si estás armando una campaña con un mismo personaje recurrente, o algo episódico, esto es clave.

Los primeros planos me funcionaron muy bien. En planos abiertos el personaje a veces se desvía en detalles pequeños, sobre todo cuando mis imágenes de referencia venían de ángulos distintos. Mi consejo es subir referencias de un solo tipo: todas en retrato o todas de cuerpo entero, sin mezclar.

¿En qué se diferencia el «control narrativo» de un prompt normal?

Es un detalle sutil, pero importa. En el anuncio de Flow, Google habla de más control narrativo, y en la práctica eso significa que puedes fijar eventos concretos en momentos concretos dentro de los 8 segundos.

Un prompt normal describe la idea general. Qué pasa, el estilo, el tono. Con Veo 3.1 puedes ser literal, decir que el protagonista gira la cabeza a los dos segundos, que otra persona entra en cuadro un momento después, y que al final del clip ambos se están mirando. El modelo respeta esos tiempos.

No me salió a la primera. Mis primeros intentos eran prompts largos y en prosa, y no funcionaban. Hay que detallar los tiempos, y ahí sí obedece. Un ejemplo rápido. En lugar de «una barista prepara un café y le sonríe al cliente», yo escribiría: «Los primeros segundos, los granos entran en el molino. Después, un tramo más largo sirviendo la leche. Justo antes del corte, ella sonríe».

Dónde se queda corto

No voy a fingir que es perfecto.

Las manos haciendo cosas complicadas son un punto débil. Cuando alguien está ordenando objetos o escribiendo en un teclado, los dedos a veces se emborronan. Para ser justos, Kling 3.0 lo resuelve mejor.

El texto legible dentro del cuadro es otro punto flojo. ¿Quieres una etiqueta legible con el nombre de la marca en una botella? No va a pasar. Veo escribe pseudoletras. Ese plano lo haría en un modelo de imagen como Ideogram o GPT Image, y después lo metería como referencia.

Después está el costo. La lista de precios de la API de Gemini pone al Veo 3.1 estándar en 0,40 USD por segundo de video a 720p o 1080p y 0,60 USD a 4K, mientras que Fast corre entre 0,10 y 0,12 USD por segundo en esas resoluciones más bajas. Así que un solo clip de 8 segundos a 1080p en el modo de mayor calidad cuesta 3,20 USD según las tarifas de la API. Si tuviera que hacer una serie de 200 SKU, la correría en Kling y guardaría Veo para los productos estrella, donde un look premium sí se paga solo.

La velocidad también. Fast tarda de 1 a 2 minutos, Quality de 3 a 5. En nuestro panel, el promedio ronda los 2 a 4 minutos por clip. Cincuenta clips de una sola vez son cerca de dos horas de espera.

Para qué lo usaría

Así terminé dividiendo las cosas después de dos semanas.

Páginas de producto estrella. Cuando tienes 5 o 10 productos top y cada uno tiene presupuesto de verdad, Veo rinde mejor que nada. La imagen se ve cinematográfica, la luz se mantiene natural y las texturas parecen reales en vez de renderizadas.

Categorías de estilo de vida y ambiente, como perfumería, skincare premium, ropa de gama alta. Aquí la emoción y el entorno pesan más que la acción, y Veo lo resuelve bien.

Videos explicativos y contenido de marca. Para tutoriales y contenido de marca en YouTube, Veo da esa sensación de «grabado con cámara real», sin ese movimiento flotante tan de IA.

Lo que no haría en Veo son clips de producto en volumen para un marketplace. Demasiado caro para eso, y demasiado lento. Kling o Hailuo lo resuelven por bastante menos dinero.

Cómo usarlo en Flami

En Flami, Veo 3.1 viene incluido en la suscripción general, así que no hay que configurar una cuenta de Google aparte ni un proyecto de Google Cloud. Eso pesa más de lo que parece. Hacerlo directamente con Google significa conseguir una API key, más una cuenta de facturación, más trabajar con código. La otra vía es la app Flow de Google, con su propio plan.

Hay dos modos para elegir. Usé los dos bastante. Fast es para borradores y pruebas de prompt. Quality es para cuando ya sabes lo que quieres y necesitas la versión final.

Los prompts en otros idiomas normalmente se entienden bien. Para escenas complejas con diálogo, el inglés es más seguro, como mencioné antes.

Cuánto cuesta en Flami

Todavía no publicamos un precio en dólares para cuentas internacionales, así que lo dejo simple: se paga con créditos. El costo depende del modo, de la duración y también de la resolución. Un Extend cuesta más o menos lo mismo que otra generación. Los números actuales están en la página de Veo 3.1.

Chequeo rápido: ¿Veo 3.1 es para ti?

Encaja bien si necesitas:

  • un look premium y cinematográfico;
  • sonido sincronizado con la imagen;
  • anuncios para productos de lujo o belleza;
  • clips más largos, de 15 a 30 segundos, con un mismo personaje recurrente.

Probablemente no es la herramienta si:

  • estás haciendo una serie de más de 50 SKU, el costo se dispara rápido, prueba con Kling;
  • necesitas texto legible en el cuadro, usa otro modelo para ese plano;
  • todo el clip es de manos manipulando objetos, ahí Kling rinde mejor.

Y ahora, ¿qué sigue?

Si estás eligiendo entre modelos, puse a Veo frente a Kling y Runway con las mismas tomas de producto en una comparación a tres bandas. Kling también tiene su propia reseña si es el que más te llama la atención.

O simplemente pruébalo tú mismo. Regístrate en Flami y gasta tus créditos gratis en algunos borradores con Fast antes de comprometerte con Quality.

Preguntas frecuentes

*¿Qué es Veo 3.1?* El modelo de generación de video de Google DeepMind, lanzado el 15 de octubre de 2025. Genera clips realistas con sonido, mantiene un personaje consistente entre escenas y puede continuar un clip mediante Extend.

*¿En qué se diferencia Veo 3.1 de Veo 3?* Destacan tres novedades: control del primer y último fotograma, varias imágenes de origen por solicitud, y Extend para clips de más de 8 segundos.

*¿Veo 3.1 o Sora 2, cuál es mejor?* En el ranking de video de arena.ai están prácticamente empatados. Sora 2 Pro es el 11.º con 1368 puntos y la versión con audio de Veo 3.1 es la 12.ª con 1364, una diferencia dentro del margen de error. Creo que Veo sigue el prompt de forma más literal, aunque es solo mi impresión.

*¿Funciona en otros idiomas además del inglés?* Los prompts casi siempre se entienden. Pero Google solo evaluó a fondo el inglés, así que el diálogo en otros idiomas puede salir bien o mal.

*¿Cuántos segundos por generación?* Hasta 8. Con Extend, la API permite hasta 148, pero en mis pruebas se mantuvo coherente hasta unos 24 o 32 segundos.

*¿Puedo subir mis propias fotos?* Sí, hasta tres imágenes de referencia por solicitud, que es como mantienes un personaje o un estilo consistente.

*¿Qué resolución soporta?* 720p por defecto. 1080p o 4K solo para clips de 8 segundos.

Última revisión contra la documentación de Google: 30 de septiembre de 2026.

Fuentes

  1. Google DeepMind, Veo
  2. Google Developers Blog, presentamos Veo 3.1 y nuevas funciones creativas en la API de Gemini
  3. Google, Veo 3.1 y funciones avanzadas en Flow
  4. Google, actualización Veo 3.1 Ingredients to Video
  5. Google AI for Developers, documentación de Veo 3.1
  6. Google AI for Developers, precios de la API de Gemini
  7. TechCrunch, Google lanza Veo 3.1 y lo suma al editor de video Flow
  8. arena.ai, Text-to-Video Arena
  9. Flami, página de Veo 3.1

Sobre el autor

Diego Morales

Redactor de reseñas en Flami

Sigue leyendo

Obtén 15 créditos gratis

Úsalos para generar imágenes y videos:

≈ 11 × Nano Banana 2, ≈ 12 × GPT Image 2, ≈ 1 × Seedance 2

Obtener créditos gratis