← Todos os artigosAnálises de modelos de IA

Análise do Veo 3.1: o que o modelo de vídeo do Google faz bem em 2026, e onde ainda escorrega

Lucas Oliveira30 de setembro de 2026Leitura de 10 min
Análise do Veo 3.1: o que o modelo de vídeo do Google faz bem em 2026, e onde ainda escorrega

Análise prática do Veo 3.1: som nativo, Extend para vídeos mais longos, um personagem em várias cenas, pontos fracos, preço da API e quando vale a pena.

Vale a pena pagar por um modelo de vídeo depois que ele sai do top dez? Essa pergunta não saiu da minha cabeça enquanto eu escrevia esta análise do Veo 3.1. Testo modelos de vídeo para a Flami antes de eles chegarem aos usuários, o que na prática significa rodar tudo na mão e depois contar onde o modelo mente. O Veo 3.1 passou duas semanas inteiras sob esse teste aqui, primeiro em projetos pessoais meus e depois num lote de vídeos de produto. Abaixo está o que ele realmente faz, onde ainda erra, e por que vale a pena considerá-lo se você já usa Kling ou Runway.

O que é o Veo 3.1, em termos simples

É o modelo de vídeo do Google DeepMind. A versão 3.1 saiu em 15 de outubro de 2025, anunciada no Google Developers Blog e coberta no mesmo dia pelo TechCrunch. Desde então o Google só fez atualizar o modelo, não substituí-lo. Uma atualização de janeiro melhorou a consistência de personagem e trouxe vídeo vertical nativo, além de upscale para 1080p e 4K, e em março surgiu uma versão Veo 3.1 Lite mais barata para desenvolvedores. Até hoje, a página de modelos da DeepMind ainda lista a 3.1 como o Veo atual. Não existe Veo 4, apesar do que alguns blogs andam dizendo por aí.

Como ele se posiciona frente à concorrência? Mais baixo do que estava há um tempo. No ranking de vídeo da arena.ai (atualização de 21 de setembro de 2026), a melhor entrada do Veo 3.1, a versão com áudio, está em 12º lugar com 1364 pontos. Modelos mais novos estão à frente dele, incluindo um do próprio Google.

As especificações, segundo a documentação da API do Gemini:

  • duração do clipe: 4, 6, 8 segundos;
  • resolução: 720p por padrão; 1080p ou 4K só para clipes de 8 segundos;
  • taxa de quadros: fixa em 24 fps;
  • proporção de tela: 16:9 e 9:16;
  • imagens de referência: até três.

Para a maioria dos trabalhos, 8 segundos bastam. Quando não bastam, existe o Extend.

O Google destaca quatro recursos principais nesta versão, então vou passar por cada um e contar o que se confirmou nos meus testes.

O áudio nativo é o grande destaque

Vídeo primeiro, depois o áudio escrito ou gerado à parte, depois uma mixagem pra juntar tudo. Esse é o fluxo antigo. Tudo isso o Veo 3.1 resolve numa única geração.

E o áudio fica sincronizado com a cena, que é o ponto principal. Água caindo no quadro significa que você ouve a água caindo. Uma pessoa falando tem sincronia labial. Testei fala majoritariamente em inglês, e a sincronia labial ficou boa. A documentação do Google diz que o inglês é o único idioma totalmente avaliado por eles. A frase exata é que outros idiomas "podem funcionar, mas os resultados variam", e isso bateu com o que eu esperava pra qualquer coisa fora do inglês. Pra algo importante em outro idioma, eu escreveria o diálogo em inglês ou abriria mão da fala e manteria só o som ambiente.

Já o som ambiente está quase perfeito. Conversa de café, passos na calçada, uma máquina de espresso assobiando, o farfalhar de um tecido. Tudo isso o modelo adiciona sozinho, a partir do contexto. Pra clipes simples de até 8 segundos, você realmente não precisa mais de um sound designer.

O que não bateu com a promessa foi o estéreo. Eu esperava uma mixagem espacial de verdade. O que recebi foi mono ou um estéreo falso. Talvez o modo Quality resolva isso, eu rodei principalmente no Fast, então posso estar errado aqui.

Extend, ou como passar dos 8 segundos sem costura visível

Um anúncio de 20 ou 30 segundos significava gerar várias partes e costurá-las num editor, e dava pra ver a emenda sempre. A luz muda, a pose do personagem pula, às vezes o tom de pele muda, e o olho do espectador trava bem nesses pontos.

O Extend continua um clipe pronto, de forma que o trecho seguinte começa exatamente no quadro em que o anterior terminou. A iluminação se mantém, o ângulo de câmera e a cor também. A API adiciona 7 segundos por extensão, até 20 vezes, com um teto de 148 segundos, embora só em 720p.

Na prática consegui encadear 3 ou 4 partes antes de as coisas começarem a dar errado. Depois disso, o modelo vai perdendo aos poucos o rosto do personagem, e detalhes da roupa começam a mudar. Então de 16 a 24 segundos é a faixa em que eu realmente confio, mesmo que a ficha técnica permita bem mais. Na Flami, o Extend é uma etapa separada, que você roda depois do clipe base, direto na página do Veo 3.1.

Um personagem em várias cenas

Esse é um salto e tanto em relação ao Veo 3. Antes o limite era uma imagem de referência. O Veo 3.1 aceita até três, então dá pra fixar uma pessoa, uma roupa, um visual inteiro, e manter isso ao longo do clipe. A atualização de janeiro do Google foi além disso e batizou o recurso de consistência de identidade.

O modelo mantém o rosto e a roupa consistentes durante a cena inteira. Até o jeito de a pessoa se mover. Se você está montando uma campanha com um personagem recorrente, ou qualquer coisa episódica, isso é essencial.

Close-ups funcionaram muito bem pra mim. Em planos abertos o personagem às vezes escorrega em detalhes pequenos, principalmente quando minhas imagens de referência foram tiradas de ângulos diferentes. Meu conselho é subir referências de um tipo só. Ou tudo retrato, ou tudo corpo inteiro, só não misture os dois.

Em que o "controle narrativo" é diferente de um prompt comum?

Ponto sutil, mas que importa. No anúncio do Flow o Google fala em mais controle narrativo, e na prática isso significa que dá pra fixar eventos específicos em momentos específicos dentro dos 8 segundos.

Um prompt normal descreve a ideia geral: o que acontece, o estilo, o clima. Com o Veo 3.1 você pode ser literal, dizendo que o protagonista vira a cabeça aos dois segundos, que outra pessoa entra em quadro um instante depois, e que no final do clipe os dois estão se olhando. Esses marcos o modelo cumpre à risca.

Não acertei isso de primeira. Minhas primeiras tentativas eram só prompts longos e corridos, e não funcionaram. É preciso detalhar os tempos, aí sim o modelo escuta. Um exemplo simples: em vez de "um barista prepara café e sorri pro cliente", eu escreveria "nos primeiros segundos, os grãos caem no moedor. Depois, um trecho mais longo despejando o leite. Bem antes do corte, ela sorri."

Onde ele deixa a desejar

Não vou fingir que é perfeito.

Mãos fazendo coisas complicadas são um ponto fraco. Quando alguém está organizando objetos ou digitando, os dedos às vezes embaçam. Nesse ponto, pra ser justo, o Kling 3.0 lida melhor.

Texto legível no quadro é outro problema. Quer um rótulo legível com o nome da marca numa garrafa? Não vai rolar. Ele escreve pseudo-letras. Nesse caso eu faria essa peça num modelo de imagem como Ideogram ou GPT Image e depois usaria isso como referência.

Depois tem o custo. A tabela de preços da API do Gemini do Google coloca o Veo 3.1 padrão em US$ 0,40 por segundo de vídeo em 720p ou 1080p e US$ 0,60 em 4K, enquanto o modo Fast fica entre US$ 0,10 e US$ 0,12 por segundo nessas resoluções mais baixas. Ou seja, um único clipe de 8 segundos em 1080p no modo top sai por US$ 3,20 nos preços da API. Numa série de 200 SKUs pra fazer, minha aposta seria o Kling, guardando o Veo pros produtos-carro-chefe, onde um visual premium realmente compensa.

Velocidade também. O Fast leva de 1 a 2 minutos, o Quality de 3 a 5. Em média, no nosso painel fica entre 2 e 4 minutos por clipe. Cinquenta clipes de uma vez são cerca de duas horas de espera.

Pra que eu usaria

Depois de duas semanas, foi assim que dividi as coisas pra mim mesmo.

Páginas de produtos-carro-chefe. Quando você tem 5 ou 10 produtos no topo e cada um carrega orçamento de verdade, o Veo entrega o melhor resultado. A imagem sai com cara de cinema, a luz fica natural, e as texturas parecem reais em vez de renderizadas.

Categorias voltadas a estilo de vida e clima, como perfumaria, skincare premium, roupas de ponta. Aqui emoção e ambientação importam mais que ação, e o Veo lida bem com isso.

Explicativos e conteúdo de marca. Pra tutoriais e conteúdo de marca no YouTube, o Veo dá aquela sensação de "filmado com câmera de verdade", sem aquele movimento flutuante típico de IA.

O que eu não faria no Veo é clipe de produto em massa pra marketplace. Caro demais pra isso, e lento demais. Kling ou Hailuo resolvem por bem menos dinheiro.

Usando pela Flami

Na Flami, o Veo 3.1 faz parte da assinatura geral, então não tem conta separada do Google pra configurar nem projeto no Google Cloud pra montar. Isso importa mais do que parece. Ir direto no Google significa chave de API, conta de cobrança e trabalhar via código. A outra via é o app Flow do Google, com plano próprio.

Tem dois modos pra escolher, e usei os dois bastante. O Fast é pra rascunho e teste de prompt. O Quality é pra quando você já sabe o que quer e precisa da versão final.

Prompts em outros idiomas costumam ser entendidos. Pra cenas complexas com diálogo, o inglês é mais seguro, como já falei antes.

Quanto custa na Flami

Ainda não temos um preço em dólar pra contas internacionais, então vou manter isso simples. Você paga em créditos. O custo depende do modo e da duração, e também da resolução. Um Extend custa mais ou menos o mesmo que outra geração. Os números atuais estão na página do Veo 3.1.

Checagem rápida: o Veo 3.1 é pra você?

Bom encaixe se você precisa de:

  • um visual premium e cinematográfico;
  • som sincronizado com a imagem;
  • anúncios pra produtos de luxo ou beleza;
  • clipes mais longos, de 15 a 30 segundos, com um personagem recorrente.

Provavelmente não é a ferramenta certa se:

  • você está montando uma série de 50 ou mais SKUs, vai ficar caro rápido, tenta o Kling;
  • você precisa de texto legível no quadro, usa outro modelo pra essa parte;
  • o clipe inteiro é sobre mãos manipulando objetos, aí o Kling se sai melhor.

Pra onde ir a partir daqui

Se você está escolhendo entre modelos, coloquei o Veo cara a cara com Kling e Runway nas mesmas peças de produto, numa comparação a três. Se for o Kling o seu favorito, ele também tem uma análise própria.

Ou testa você mesmo. Cadastre-se na Flami e gaste uns rascunhos no Fast com os créditos grátis antes de partir pro Quality.

Perguntas frequentes

*O que é o Veo 3.1?* O modelo de geração de vídeo do Google DeepMind, lançado em 15 de outubro de 2025. Ele cria clipes realistas com som, mantém um personagem consistente entre cenas e pode continuar um clipe através do Extend.

*Qual a diferença entre o Veo 3.1 e o Veo 3?* Três novidades se destacam: controle de primeiro e último quadro, várias imagens de origem por pedido, e o Extend pra clipes com mais de 8 segundos.

*Veo 3.1 vs Sora 2, qual é melhor?* No ranking de vídeo da arena.ai, estão praticamente empatados. O Sora 2 Pro está em 11º com 1368 pontos e a versão com áudio do Veo 3.1 está em 12º com 1364, o que fica bem dentro da margem de erro. Minha impressão pessoal é que o Veo segue o prompt de um jeito mais literal.

*Funciona em outros idiomas além do inglês?* Os prompts geralmente são entendidos. Mas o Google só avaliou o inglês por completo, então o diálogo em outros idiomas pode funcionar bem ou não.

*Quantos segundos por geração?* Até 8. Pelo Extend, a API permite até 148, mas nos meus testes ele se manteve coerente até uns 24 ou 32.

*Posso subir minhas próprias fotos?* Sim, até três imagens de referência por pedido, e é assim que você mantém um personagem ou um estilo consistente.

*Que resolução ele suporta?* 720p por padrão. 1080p ou 4K só pra clipes de 8 segundos.

Última checagem na documentação do Google em 30 de setembro de 2026.

Fontes

  1. Google DeepMind, Veo
  2. Google Developers Blog, Introducing Veo 3.1 and new creative capabilities in the Gemini API
  3. Google, Introducing Veo 3.1 and advanced capabilities in Flow
  4. Google, Veo 3.1 Ingredients to Video update
  5. Google AI for Developers, Veo 3.1 documentation
  6. Google AI for Developers, Gemini API pricing
  7. TechCrunch, Google releases Veo 3.1, adds it to Flow video editor
  8. arena.ai, Text-to-Video Arena
  9. Flami, Veo 3.1 page

Sobre o autor

Lucas Oliveira

Redator de análises na Flami

Leia também

Ganhe 15 créditos grátis

Use-os para gerar imagens e vídeos:

≈ 11 × Nano Banana 2, ≈ 12 × GPT Image 2, ≈ 1 × Seedance 2

Ganhar créditos grátis