NEWO seu próximo anúncio UGC viral está a apenas um clique. Conheça o Studio.Criar anúncio
PopcraftPopcraft
Novo modelo de vídeo

Alibaba · Tongyi Lab

Wan 3.0: vídeos de IA de 30 segundos em uma etapa, com som próprio

O Wan 3.0 é o gerador de vídeo de IA tudo-em-um da Alibaba. Ele transforma um prompt, uma imagem ou um conjunto de referências em vídeos de qualquer duração entre 2 e 30 segundos em um único pedido, até 1080p e 30 fps, e renderiza diálogos, música e efeitos sonoros no mesmo processo. Na Popcraft, começa em 11 créditos por segundo.

No estúdio de vídeo, quadros Canvas e no conector MCP

2–30 s
qualquer segundo inteiro, etapa única
1080p 30 fps
níveis de 480p e 720p também
4 · 5 · 5 refs
imagens, clipes, áudio
11 cr / s
em 480p — 330 por 30 s
00segundos, um take
um take · áudio gerado · sem edição

Duração nativa de 30s

O primeiro grande destaque da Alibaba: "narrativa mais completa e liberdade criativa" a partir de uma etapa nativa de 30 segundos. O filme principal acima em seis pontos de sua linha do tempo, e o que o relógio e o arquivo registraram sobre os clipes que geramos para esta página.

1 segundo: close-up extremo do rosto pintado da artista no espelho do camarim1s
6 segundos: ela se levanta do espelho com o traje carmesim e dourado6s
12 segundos: o corredor dos bastidores, com assistentes se encostando nas paredes enquanto ela passa12s
18 segundos: sua mão na cortina de veludo vermelho18s
24 segundos: através da cortina para a luz do palco, a plateia iluminada por lanternas se abrindo ao fundo24s
29 segundos: a manga d'água erguida para um teatro lotado sob lanternas vermelhas29s
Uma artista, um traje, uma gradação do espelho ao palco — camarim, corredor, cortina, plateia cheia, em um único pedido sem cortes.
Entregue vs. Solicitado
PedidoEntregueTempo real
30 s · 1080p · apenas texto30,02 s · 1920×1080 · estéreo5 min 38 s
5 s · 720p · apenas texto5,04 s · 1280×720 · estéreo1 min 37 s
3 s e 10 s · a partir de um clipe de referência de 6 s3,02 s e 10,03 s · o clipe definiu o movimento, não a duração≈ 1 min 25 s cada

O tempo real reflete do envio ao arquivo na Popcraft, setembro de 2026. Cada clipe chegou com precisão de centésimos de segundo em relação ao pedido, então os créditos que você vê antes de gerar são exatamente os créditos que você gasta.

Experiência imersiva: realismo, textura e design de som

Palavras da Alibaba: "realismo elevado, textura e design de som". Três filmes, três estilos — live action, CG estilo cinema, fantasia de marca — cada um com um pedido, um take contínuo, 30 segundos, com a trilha sonora gerada no mesmo processo. Apenas o prompt foi alterado.

Live action30.0s1 takelive action

Cortina

O filme principal acima: uma artista de ópera de Pequim do espelho do camarim, pelo corredor, através da cortina de veludo até um teatro lotado. Tambores crescem, um gongo soa, a plateia vai ao delírio.

CG Cinema30.0s1 take3D-CG look

Espírito de raposa

Uma raposa de nove caudas corre sobre telhados iluminados por lanternas, salta um vão enquanto lanternas se espalham, paira contra a lua cheia e pousa na torre do sino enquanto as lanternas da cidade sobem. Estilo 3D pictórico apenas por prompt de texto.

Fantasia de marca30.0s1 takebrand fantasy

Máquina de venda

Uma garota com capa de chuva amarela aperta um botão em um beco chuvoso e é puxada através do vidro para um mundo de cores pop, onde um mascote lhe entrega uma lata. O gás vira fogos de artifício, e a câmera recua de volta para o beco.

Cada filme aqui é exibido exatamente como foi entregue: sem edição, sem música adicionada. Rascunhos em 480p custam 330 créditos cada; 1080p custa 1.200.

O que é o Wan 3.0?

O Wan 3.0 (万相 3.0) é o modelo de vídeo do Tongyi Lab da Alibaba, em beta público desde agosto de 2026. A Alibaba o define como um modelo de vídeo de referência tudo-em-um: um único modelo para texto-para-vídeo, imagem-para-vídeo, controle de primeiro e último quadro e geração por referências mistas, em vez de modelos separados. Ele é acessível apenas via API — não há pesos abertos — e a Popcraft utiliza a edição prime, a versão mais veloz da Alibaba.

Guia do Alibaba Cloud Model Studio e referência de API para wan3.0-video; README oficial do repositório Wan 3.0; resumo de lançamento da comunidade Alibaba. As afirmações acima são da Alibaba; as medições nesta página são nossas.

Nas palavras da Alibaba
  1. Gera de forma estável até 30 segundos de vídeo por pedido, a 30 quadros por segundo.

    Duração

  2. Gera nativamente diálogos, música de fundo e efeitos sonoros — sem necessidade de dublagem em pós-produção.

    Som

  3. Consistência de aparência de personagens, roupas, adereços, ambiente e estilo visual; movimentos de câmera de aproximação, afastamento, panorâmica e acompanhamento.

    Consistência e câmera

Os cinco destaques da Alibaba
  1. Duração Nativa de 30sNarrativas mais completas e maior liberdade criativa.Na Popcraft: qualquer duração de 2 a 30 segundos, em uma etapa.
  2. Omni-CreationAté 20 ativos de referência, com análise de documentos e páginas web.Na Popcraft: 4 imagens, 5 clipes, 5 áudios. Documentos e páginas web em breve.
  3. Consistência Pixel-PerfectAumente a certeza na entrega de fluxos de produção.Na Popcraft: sim — veja os quadros estáticos abaixo.
  4. Experiência ImersivaRealismo, textura e design de som elevados.Na Popcraft: sim — diálogos, música e efeitos gerados com a imagem.
  5. Edição de Vídeo de PrecisãoEdição mais controlável para aumentar a eficiência criativa.Ainda não disponível na Popcraft — use Seedance 2.5 ou Gemini Omni para editar ou estender.

Omni-Creation: imagens, clipes e áudio em um único prompt

O segundo grande destaque da Alibaba — gere a partir de entradas multimodais. Na Popcraft, isso significa até 4 imagens, 5 clipes de vídeo e 5 clipes de áudio em um único pedido, cada um nomeado no prompt como Imagem 1, Vídeo 1 ou Áudio 1 na ordem em que foram anexados. A plataforma da Alibaba também analisa documentos; essa parte ainda não está na Popcraft.

Imagem 1 … Imagem 4

Assuntos, produtos e cenários

Uma folha de personagem fixa o rosto e o guarda-roupa; uma foto de produto fixa o objeto; uma foto de local fixa o cenário. O modelo preserva o que está na imagem, portanto, descreva as mudanças explicitamente. Duas imagens com "primeiro quadro" e "último quadro" no prompt tornam-se quadros-chave (keyframes).

JPEG, PNG, WEBP ou BMP · 240 a 8.000 px por lado · 20 MB cada

A mulher da Imagem 1 caminha pela rua da Imagem 2 ao entardecer, com a câmera acompanhando ao lado. Mantenha o cabelo, casaco e bolsa exatamente como na Imagem 1.
Vídeo 1 … Vídeo 5

Movimento, câmera e atuação

Um clipe transporta seu caminho de câmera, posicionamento e atuação para a nova cena. Combine-o com uma imagem e o assunto da imagem executará o movimento do clipe no cenário do clipe. O clipe define o movimento, não a duração — o seletor cuida disso.

MP4 ou MOV · 1 a 15 s cada e 15 s no total · 100 MB cada

O homem da Imagem 1 está entre os pilares. Siga o movimento de câmera do Vídeo 1 exatamente: um ângulo baixo e aberto orbitando à direita para um close-up de três quartos.
Áudio 1 … Áudio 5

O timbre de uma voz ou a batida de uma trilha

A técnica da Alibaba: o áudio fornece a voz ou o ritmo, e a fala vai no prompt; o modelo gera a fala e o movimento da boca simultaneamente. Não é uma ferramenta de sincronização labial sobre gravação — para isso, use um modelo de avatar como o OmniHuman.

WAV ou MP3 · 1 a 15 s cada e 15 s no total · 15 MB cada

Use o timbre do Áudio 1 e faça o personagem dizer: "Sério? Isso parece ótimo — quando você volta?" A fala gerada comanda o movimento natural da boca.

Quadros-chave e referências não se misturam. Duas imagens marcadas como primeiro e último quadro criam um clipe de keyframe sozinhas; todo o resto — imagens de assunto, clipes, áudio — combina-se livremente até os limites acima.

Consistência pixel-perfect

O terceiro destaque da Alibaba: "melhorar a certeza de entrega para fluxos de produção" — a documentação do modelo destaca a preservação de detalhes do personagem e referências entre os quadros. A mesma artista do filme principal em três pontos, com 28 segundos de diferença.

O rosto pintado da artista no espelho do camarim em 1 segundo1 s
A mesma artista no corredor dos bastidores aos 12 segundos12 s
A mesma artista no palco diante da plateia aos 29 segundos29 s
Mesmo rosto, mesmo adereço de cabeça, mesmo traje do espelho ao palco. Anexe uma folha de personagem ou foto de produto como Imagem 1 e o modelo manterá o que você forneceu; em nossos testes, um produto estático quadrado foi reproduzido fielmente em um quadro 16:9.

Como criar prompts para o Wan 3.0

O modelo planeja todo o clipe a partir do prompt, então o prompt deve dizer que tipo de clipe ele é. Nossas renderizações funcionaram sempre que nomeamos a continuidade — um take sem cortes ou uma lista numerada de cenas.

Para um take único

Diga "sem cortes" e cronometre os ritmos

Comece com "um take contínuo, sem cortes, sem transições", dê a cada intervalo de segundos uma ação e um verbo de câmera, mantenha um único assunto principal no quadro e escreva o som como sua própria frase.

UM TAKE CONTÍNUO, SEM CORTES, SEM TRANSIÇÕES, 30 s. Fotorealismo cinematográfico, alto contraste. Uma artista de ópera de Pequim com maquiagem de rosto pintado e traje carmesim e dourado.
0–6 s: close-up extremo em um espelho de camarim cercado de lâmpadas; ela abre os olhos.
6–16 s: ela caminha por um corredor estreito nos bastidores, assistentes se encostam nas paredes, a câmera recua à frente dela enquanto os tambores crescem.
16–24 s: ela atravessa pesadas cortinas de veludo vermelho para a luz ofuscante do palco; a câmera gira para trás do seu ombro.
24–30 s: a revelação — um teatro lotado sob lanternas vermelhas; ela ergue uma manga d'água enquanto um gongo soa.
Som: tambores crescendo, passos, o ruído da cortina, um gongo, aplausos. Sem diálogos, sem texto na tela.
Nomeie as referências
Imagem 1, Vídeo 1, Áudio 1 — numerados por tipo na ordem de anexo — e diga para que servem: "Imagem 1 é o personagem; Vídeo 1 é o movimento de câmera".
Direcione o som
Por padrão, o modelo escreve diálogos, música e efeitos. Peça o que deseja — "chuva e um bonde distante, sem diálogo" — ou desligue a chave de Áudio para um arquivo silencioso.
Fidelidade acima de tudo
Ao receber uma imagem, o modelo mantém o que está nela. Para uma grande mudança — clima, vestuário, um cenário diferente — descreva a alteração explicitamente em vez de esperar que o prompt anule a imagem.
Foque em um protagonista
Uma única figura, um caminho de câmera definido e as palavras "sem cortes" nos deram um take limpo todas as vezes. Multidões, mãos e pequenos objetos são onde qualquer modelo de vídeo pode apresentar falhas.
Rascunhe barato, entregue caro
480p é o mesmo modelo por um quarto do preço de 1080p. Valide a história em 480p e depois renderize a versão final em 1080p com o mesmo prompt e referências.

Wan 3.0 vs Seedance 2.5 vs Gemini Omni 1.1 Flash

Três modelos na Popcraft que geram som com a imagem. A vantagem do Wan é o take de 30 segundos mais barato e a fidelidade às referências; a do Seedance é o número de referências e edição; a do Omni é o 4K e 40 segundos via extensão. Escolha conforme o trabalho.

CapacidadeWan 3.0Seedance 2.5Gemini Omni 1.1 Flash
Clipe mais longo por pedido30 s em uma etapa30 s40 s por extensão de cena (30 s em 4K)
Resoluções480p / 720p / 1080p a 30 fpsAté 1080pRascunho 360p até 4K
Áudio nativoDiálogo, música, efeitos; desativávelSimFala, música, efeitos sonoros
Imagens de referênciaAté 4Até 30Até 10
Vídeos de referênciaAté 5, 15 s no totalAté 10Até 3
Áudio de referênciaAté 5, 15 s no totalAté 10
Editar ou estender clipe— (use Seedance ou Omni)Editar; estender antes ou depoisEditar; estender em blocos de 10 s
Um rascunho de 30 segundos330 créditos em 480pPor segundo, por resolução150 créditos em 360p

Os dados do Wan são do guia oficial da Alibaba; os limites da Popcraft são os disponíveis no seletor hoje. Os tetos dos provedores mudam; o seletor sempre mostra o que está disponível. Comparações completas: Seedance 2.5 · Gemini Omni 1.1 Flash.

Preços do Wan 3.0 na Popcraft

Cobrado por segundo entregue, por resolução. Referências são gratuitas para anexar. Como a duração entregue corresponde ao pedido, o preço exibido antes de gerar é o preço que você paga.

480p
11 créditos / s
Rascunhos
30 s = 330 créditos
720p
20 créditos / s
Social
15 s = 300 créditos
1080p
40 créditos / s
Destaques principais
30 s = 1.200 créditos

Todo plano inclui créditos; a página de preços lista as taxas atuais para todos os modelos. Downloads no nível gratuito levam uma marca d'água da Popcraft, que os planos pagos removem.

Para que a Alibaba recomenda o Wan 3.0

Os três cenários do material de lançamento da Alibaba e como executá-los na Popcraft.

  • 01

    Conteúdo de vídeo curto: dramatização e teasers de anúncios

    Cenário de entretenimento. Até 30 segundos de narrativa com várias cenas a partir de um prompt, som incluído.

  • 02

    E-commerce: vitrine de produtos a partir de uma imagem

    Cenário de e-commerce — "carregue a imagem de um produto e uma descrição para obter uma vitrine dinâmica". Anexe a foto como Imagem 1.

  • 03

    Educação: simulações de cenários encenados

    Cenário de educação — uma consulta médica ou chamada de suporte encenada a partir de um prompt, com diálogo gerado.

  • 04

    Rascunhe em 480p, entregue em 1080p

    Adição da Popcraft: 11 créditos por segundo em 480p tornam um rascunho de 30 segundos acessível antes de você se comprometer com o 1080p.

Wan 3.0 — perguntas frequentes

É o modelo de vídeo tudo-em-um da Alibaba, do Tongyi Lab. Um único modelo cobre texto-para-vídeo, imagem-para-vídeo, controle de quadros inicial e final e geração de múltiplas referências, produzindo de 2 a 30 segundos em uma etapa a 30 fps, com som nativo.

Qualquer segundo inteiro de 2 a 30, em uma única etapa — sem cadeias de extensão ou montagens. Na Popcraft, você define a duração e o arquivo entregue corresponde exatamente ao pedido.

Sim, por padrão. O modelo gera nativamente diálogos, música de fundo e efeitos sonoros, permitindo especificar falas e sons no prompt. A chave de Áudio na Popcraft permite desativar esse recurso.

Anexe até 4 imagens, 5 clipes de vídeo e 5 de áudio e mencione-os no prompt como Imagem 1, Vídeo 1, Áudio 1, etc. Imagens definem personagens ou cenários; vídeos definem movimento; áudio define voz ou ritmo.

Sim, o modelo foi construído para isso. A Alibaba lista a consistência de aparência, vestuário e ambiente como uma capacidade principal. O Wan 3.0 prioriza a imagem que você fornece.

Atualmente na Popcraft não. Ele usa clipes como referência de movimento; para estender ou editar filmagens, use o Seedance 2.5 ou Gemini Omni 1.1 Flash.

Ele usa referências de áudio para capturar o timbre e o ritmo, enquanto a fala é escrita no prompt para gerar o movimento labial natural. Não é uma ferramenta de dublagem direta de gravação; para isso use o OmniHuman.

É cobrado por segundo: 11 créditos em 480p, 20 em 720p e 40 em 1080p. Um rascunho de 30 segundos em 480p custa 330 créditos; o mesmo clipe em 1080p custa 1.200.

Trinta segundos, um único pedido. Tente em 480p primeiro.

Crie um rascunho por 330 créditos, avalie a história e renderize a versão final em 1080p — ou traga uma folha de personagem e um clipe e deixe-os interagir.

Continue explorando

Modelos relacionados