← Todos os artigosAnálises de modelos de IA

Análise do Wan 2.7: o modelo de vídeo da Alibaba pra rótulo legível e produto que parece de verdade

Lucas Oliveira30 de setembro de 2026Leitura de 9 min
Análise do Wan 2.7: o modelo de vídeo da Alibaba pra rótulo legível e produto que parece de verdade

Análise do Wan 2.7: rótulos legíveis, rostos distintos, física de produto, clipes de 15 segundos com som, preço da API e a pegadinha dos pesos abertos.

Qual modelo desenha um rótulo legível numa caixa e não entrega pra cada personagem aquele rosto de IA liso e brilhante de sempre? Se você me perguntasse isso amanhã, eu responderia Wan 2.7 antes de você terminar a frase. Essa é a versão resumida desta análise do Wan 2.7. Eu vinha de uma temporada testando o Hailuo e close-ups emocionais, e o Wan se mostrou um bicho completamente diferente.

Testei sobretudo vídeo de produto, onde o texto na embalagem precisava sobreviver ao processo. Nome da marca na tampa, logo na lateral, uma linha de texto embaixo. A maioria dos modelos se atrapalha aqui e rabisca pseudoletras sem sentido. Na maior parte das vezes, o Wan acerta.

Quem faz o Wan, e o que é essa história de "pensar"?

Quem faz o Wan é a Alibaba, mais especificamente o laboratório Tongyi Lab da empresa. O lado de vídeo da versão 2.7 foi anunciado em 7 de abril de 2026 como um conjunto de quatro modelos: texto para vídeo, imagem para vídeo, referência para vídeo e um modelo de edição separado. A Alibaba resumiu tudo em torno da ideia de dirigir cenas:

"A single prompt can yield a fully realized storyboard enabling users to create director-grade works"

Boa parte do burburinho do lançamento, incluindo as nossas próprias notas sobre isso, girou em torno de um Thinking Mode que planeja a cena antes de renderizar. Tem uma coisa que só percebi enquanto checava a documentação pra escrever este texto. Essa chave thinking_mode, na prática, mora nos modelos de imagem do Wan 2.7. Do lado de vídeo, a API de imagem para vídeo tem uma opção prompt_extend no lugar. Ela reescreve seu prompt numa versão mais completa antes de a renderização começar, e a documentação avisa que isso aumenta o tempo de processamento.

Seja qual for o nome, a ideia é a mesma. Primeiro o modelo resolve a composição e define onde cada objeto vai ficar. O movimento de câmera também entra no planejamento, e só depois disso a geração começa de fato. Nos meus testes, essa etapa de planejamento compensou em cenas cheias, com vários objetos, onde menos coisas saíram estranhas. Isso custa tempo. Pra um plano simples de produto girando, não tenho certeza se vale a espera.

Três motivos pra ele ficar na minha rotina

Texto em cena vem primeiro. Placas, legendas, rótulos de embalagem, o Wan renderiza tudo isso de forma legível com muito mais frequência do que a maioria dos modelos de vídeo que já testei. Pra anúncio e e-commerce, onde o produto precisa mostrar o nome da marca com clareza, isso é o que decide. Aqui vai uma ressalva. A alegação oficial da Alibaba de "12 idiomas" pertence ao modelo de imagem do Wan 2.7, e eu não encontrei uma contagem de idiomas pros modelos de vídeo.

Rostos são o segundo motivo. Você conhece aquele efeito em que todo mundo em vídeo de IA parece a mesma pessoa bonita e genérica, uma espécie de média de rosto? Nos meus testes, o Wan me entregou gente que realmente parecia diferente entre si, com formatos de rosto e olhos distintos. Se você roda uma campanha com vários personagens, ou uma série recorrente, isso importa mais do que parece à primeira vista.

Depois vem a física. Aqui o Wan mostra bem como um objeto realmente funciona dentro do quadro. Um liquidificador gira do jeito que deveria girar, o ferro de passar desliza sobre a camisa sem flutuar acima dela, e em um dos meus clipes de teste uma furadeira morde a tábua e joga serragem de verdade pro lado. Pra vídeo de "produto em ação", costuma ser minha primeira escolha.

As especificações que você realmente vai comparar

Os clipes vão de 2 a 15 segundos. A saída é em 720p ou 1080p, segundo a documentação da API da Alibaba. O áudio nativo sai na mesma passada, com sincronia labial. Dá pra alimentar o modelo com sua própria trilha de voz também, e a boca e os movimentos do personagem seguem esse áudio. É um salto e tanto em duração, comparado com as primeiras versões do Wan.

Mais alguns detalhes que saem da documentação:

  • começar de um primeiro quadro, ou fixar tanto o primeiro quanto o último quadro;
  • continuar um clipe já existente;
  • referência para vídeo, com até cinco personagens distintos numa mesma cena, segundo o anúncio da Alibaba;
  • um modelo de edição dedicado, que altera um vídeo existente a partir de uma instrução em texto.

As proporções de tela são as de sempre na Flami: 16:9, 9:16 e 1:1, além de mais algumas opções. Aquele controle de cor por código HEX que talvez você já tenha visto por aí, onde você digita o código exato da cor da sua marca, é de novo um recurso do modelo de imagem. Se é isso que você precisa, está na página do Wan 2.7 Image, e eu entrei em mais detalhe na análise do Wan 2.7 Image.

Quanto custa

Na fonte, a tabela de preços do Model Studio da Alibaba Cloud lista o Wan 2.7 texto para vídeo e imagem para vídeo a US$ 0,10 por segundo em 720p e US$ 0,15 por segundo em 1080p, na região internacional. Um clipe de 10 segundos em 1080p, então, sai por US$ 1,50 via API.

Na Flami, o Wan 2.7 já vem incluído na assinatura normal e é pago em créditos. Junto com o carro-chefe, você também tem acesso ao Wan 2.6, 2.5, 2.2 Fast e 2.2. Minha lógica aqui é simples: o 2.7 entrega o melhor resultado, mas demora mais e custa mais caro, enquanto as versões mais antigas são mais rápidas e mais baratas pra lotes grandes.

A pegadinha dos pesos abertos

A reputação do Wan sempre foi a de modelo aberto. Gente baixava os pesos e rodava tudo na própria GPU. Isso deixou de valer pras versões mais novas. A página Wan-AI da Alibaba no Hugging Face ainda para na família 2.2, que já tem alguns meses, e o 2.5, o 2.6, o 2.7 e o novo 3.0 só estão disponíveis via API.

Se você usa o Wan por meio de um serviço, nada disso muda pra você. Mas e se a ideia era hospedar o 2.7 no seu próprio hardware? Aí já era. O 2.2 é a versão mais nova que ainda dá pra rodar localmente.

O Wan 3.0 já saiu, então o 2.7 ainda importa?

A Alibaba lançou o Wan 3.0 em agosto. Ele faz clipes de até 30 segundos e aceita um monte de entradas novas, até documento. Também está perto do topo dos rankings às cegas. Na atualização de 21 de setembro de 2026 do ranking de texto para vídeo da arena.ai, o wan3.0 aparece em 6º lugar com 1.476 pontos, enquanto o wan2.7-t2v fica em 20º, com 1.337.

Ainda não testei o 3.0 direito, então vou ficar com o que já sei. O 2.7 continua sendo uma escolha sólida pra vídeo de produto com texto na tela, e no preço de tabela ele sai um pouco mais barato por segundo do que o 3.0 em 1080p. Provavelmente eu volto a esse assunto assim que colocar os dois lado a lado, nos mesmos produtos.

Como eu divido o trabalho entre o Wan e o resto

Pra não me perder, é mais ou menos assim que eu divido as tarefas:

  • texto, logo, embalagem em cena: Wan 2.7;
  • produto fazendo o que promete, com física convincente: Wan 2.7;
  • luz premium e cara de cinema: Veo 3.1;
  • emoção em close: Hailuo;
  • movimento rápido e câmera contornando o objeto: Kling 3.0.

Perguntar se o Wan ou o Veo é "melhor" no geral não leva a lugar nenhum. Depende do que está falhando no seu plano: luz sem graça ou rótulo borrado.

Vale escolher o Wan 2.7?

Eu recorro ao 2.7 sempre que a caixa tem texto de verdade ou um logo, quando a cena precisa de rostos distintos em vez de clones de IA, ou quando o produto precisa realmente funcionar na tela. O passe único de 15 segundos também ajuda.

Eu deixo ele de lado quando alguém quer rodar o modelo no próprio servidor, já que os pesos do 2.7 nunca foram publicados, ou quando o objetivo é puramente luz e clima de cinema. Nesse caso, vai pro Veo.

O que vem a seguir

O Seedance 2.0 é o próximo da minha lista, seguido pelo HappyHorse 1.0 e pelo Grok Imagine. Também quero mostrar uma combinação que venho usando, com clipe base no Wan e acabamento no Runway. Se você nunca usou o Runway como editor, a análise do Runway Aleph explica a ideia.

Suba uma caixa com rótulo no Wan 2.7 na Flami e dê um zoom no texto pra ver como ele se sai.

Perguntas sobre o Wan 2.7

  • O que é o Wan 2.7? A família de modelos de vídeo da Alibaba, anunciada em abril de 2026. Faz clipes de 2 a 15 segundos com som nativo, e é especialmente boa com texto em cena e rostos distintos.
  • O Wan 2.7 tem modo de pensamento pra vídeo? A Alibaba documenta a chave thinking_mode pros modelos de imagem do Wan 2.7. A API de vídeo tem o prompt_extend no lugar. Ele expande o prompt antes da renderização e demora mais.
  • Que duração e resolução? De 2 a 15 segundos. A resolução é 720p ou 1080p, com áudio nativo e sincronia labial.
  • Dá pra rodar o Wan 2.7 localmente? Não, não dá. Os pesos não são publicados, e o 2.2 é o Wan mais novo com pesos abertos.
  • Quanto custa pela API da Alibaba? US$ 0,10 por segundo em 720p e US$ 0,15 em 1080p, na região internacional. Na Flami, você paga em créditos.
  • Qual a diferença pro Veo e pro Kling? Ele não compete com nenhum dos dois em luz ou movimento de ponta, o forte dele é manter o texto legível e os objetos se comportando direito, e diferente das versões antigas do Wan, os pesos do 2.7 não são públicos, então hospedar por conta própria está fora de cogitação.

Verificado em 30 de setembro de 2026, com base na documentação da Alibaba Cloud e no ranking de vídeo da arena.ai.

Fontes

  1. Alibaba Cloud, Alibaba anuncia o Wan2.7-Video
  2. Alibaba Cloud, Alibaba anuncia a geração de imagem Wan2.7
  3. Alibaba Cloud Model Studio, referência da API de imagem para vídeo do Wan 2.7
  4. Alibaba Cloud Model Studio, referência da API de geração e edição de imagem do Wan 2.7
  5. Alibaba Cloud Model Studio, tabela de preços dos modelos
  6. Alibaba Cloud, lançamento do Wan3.0
  7. Hugging Face, modelos Wan-AI
  8. arena.ai, ranking de texto para vídeo
  9. Flami, notas de lançamento do Wan 2.7
  10. Flami, página do Wan 2.7

Sobre o autor

Lucas Oliveira

Redator de análises na Flami

Leia também

Ganhe 15 créditos grátis

Use-os para gerar imagens e vídeos:

≈ 11 × Nano Banana 2, ≈ 12 × GPT Image 2, ≈ 1 × Seedance 2

Ganhar créditos grátis