Alibaba · Tongyi Lab
Wan 3.0: vídeos de IA de 30 segundos em uma etapa, com som próprio
O Wan 3.0 é o gerador de vídeo de IA tudo-em-um da Alibaba. Ele transforma um prompt, uma imagem ou um conjunto de referências em vídeos de qualquer duração entre 2 e 30 segundos em um único pedido, até 1080p e 30 fps, e renderiza diálogos, música e efeitos sonoros no mesmo processo. Na Popcraft, começa em 11 créditos por segundo.
No estúdio de vídeo, quadros Canvas e no conector MCP
- 2–30 s
- qualquer segundo inteiro, etapa única
- 1080p 30 fps
- níveis de 480p e 720p também
- 4 · 5 · 5 refs
- imagens, clipes, áudio
- 11 cr / s
- em 480p — 330 por 30 s
Duração nativa de 30s
O primeiro grande destaque da Alibaba: "narrativa mais completa e liberdade criativa" a partir de uma etapa nativa de 30 segundos. O filme principal acima em seis pontos de sua linha do tempo, e o que o relógio e o arquivo registraram sobre os clipes que geramos para esta página.
1s
6s
12s
18s
24s
29s| Pedido | Entregue | Tempo real |
|---|---|---|
| 30 s · 1080p · apenas texto | 30,02 s · 1920×1080 · estéreo | 5 min 38 s |
| 5 s · 720p · apenas texto | 5,04 s · 1280×720 · estéreo | 1 min 37 s |
| 3 s e 10 s · a partir de um clipe de referência de 6 s | 3,02 s e 10,03 s · o clipe definiu o movimento, não a duração | ≈ 1 min 25 s cada |
O tempo real reflete do envio ao arquivo na Popcraft, setembro de 2026. Cada clipe chegou com precisão de centésimos de segundo em relação ao pedido, então os créditos que você vê antes de gerar são exatamente os créditos que você gasta.
Experiência imersiva: realismo, textura e design de som
Palavras da Alibaba: "realismo elevado, textura e design de som". Três filmes, três estilos — live action, CG estilo cinema, fantasia de marca — cada um com um pedido, um take contínuo, 30 segundos, com a trilha sonora gerada no mesmo processo. Apenas o prompt foi alterado.
Cortina
O filme principal acima: uma artista de ópera de Pequim do espelho do camarim, pelo corredor, através da cortina de veludo até um teatro lotado. Tambores crescem, um gongo soa, a plateia vai ao delírio.
Espírito de raposa
Uma raposa de nove caudas corre sobre telhados iluminados por lanternas, salta um vão enquanto lanternas se espalham, paira contra a lua cheia e pousa na torre do sino enquanto as lanternas da cidade sobem. Estilo 3D pictórico apenas por prompt de texto.
Máquina de venda
Uma garota com capa de chuva amarela aperta um botão em um beco chuvoso e é puxada através do vidro para um mundo de cores pop, onde um mascote lhe entrega uma lata. O gás vira fogos de artifício, e a câmera recua de volta para o beco.
Cada filme aqui é exibido exatamente como foi entregue: sem edição, sem música adicionada. Rascunhos em 480p custam 330 créditos cada; 1080p custa 1.200.
O que é o Wan 3.0?
O Wan 3.0 (万相 3.0) é o modelo de vídeo do Tongyi Lab da Alibaba, em beta público desde agosto de 2026. A Alibaba o define como um modelo de vídeo de referência tudo-em-um: um único modelo para texto-para-vídeo, imagem-para-vídeo, controle de primeiro e último quadro e geração por referências mistas, em vez de modelos separados. Ele é acessível apenas via API — não há pesos abertos — e a Popcraft utiliza a edição prime, a versão mais veloz da Alibaba.
Guia do Alibaba Cloud Model Studio e referência de API para wan3.0-video; README oficial do repositório Wan 3.0; resumo de lançamento da comunidade Alibaba. As afirmações acima são da Alibaba; as medições nesta página são nossas.
“Gera de forma estável até 30 segundos de vídeo por pedido, a 30 quadros por segundo.”
Duração
“Gera nativamente diálogos, música de fundo e efeitos sonoros — sem necessidade de dublagem em pós-produção.”
Som
“Consistência de aparência de personagens, roupas, adereços, ambiente e estilo visual; movimentos de câmera de aproximação, afastamento, panorâmica e acompanhamento.”
Consistência e câmera
- Duração Nativa de 30s“Narrativas mais completas e maior liberdade criativa.”Na Popcraft: qualquer duração de 2 a 30 segundos, em uma etapa.
- Omni-Creation“Até 20 ativos de referência, com análise de documentos e páginas web.”Na Popcraft: 4 imagens, 5 clipes, 5 áudios. Documentos e páginas web em breve.
- Consistência Pixel-Perfect“Aumente a certeza na entrega de fluxos de produção.”Na Popcraft: sim — veja os quadros estáticos abaixo.
- Experiência Imersiva“Realismo, textura e design de som elevados.”Na Popcraft: sim — diálogos, música e efeitos gerados com a imagem.
- Edição de Vídeo de Precisão“Edição mais controlável para aumentar a eficiência criativa.”Ainda não disponível na Popcraft — use Seedance 2.5 ou Gemini Omni para editar ou estender.
Omni-Creation: imagens, clipes e áudio em um único prompt
O segundo grande destaque da Alibaba — gere a partir de entradas multimodais. Na Popcraft, isso significa até 4 imagens, 5 clipes de vídeo e 5 clipes de áudio em um único pedido, cada um nomeado no prompt como Imagem 1, Vídeo 1 ou Áudio 1 na ordem em que foram anexados. A plataforma da Alibaba também analisa documentos; essa parte ainda não está na Popcraft.
Assuntos, produtos e cenários
Uma folha de personagem fixa o rosto e o guarda-roupa; uma foto de produto fixa o objeto; uma foto de local fixa o cenário. O modelo preserva o que está na imagem, portanto, descreva as mudanças explicitamente. Duas imagens com "primeiro quadro" e "último quadro" no prompt tornam-se quadros-chave (keyframes).
JPEG, PNG, WEBP ou BMP · 240 a 8.000 px por lado · 20 MB cada
A mulher da Imagem 1 caminha pela rua da Imagem 2 ao entardecer, com a câmera acompanhando ao lado. Mantenha o cabelo, casaco e bolsa exatamente como na Imagem 1.
Movimento, câmera e atuação
Um clipe transporta seu caminho de câmera, posicionamento e atuação para a nova cena. Combine-o com uma imagem e o assunto da imagem executará o movimento do clipe no cenário do clipe. O clipe define o movimento, não a duração — o seletor cuida disso.
MP4 ou MOV · 1 a 15 s cada e 15 s no total · 100 MB cada
O homem da Imagem 1 está entre os pilares. Siga o movimento de câmera do Vídeo 1 exatamente: um ângulo baixo e aberto orbitando à direita para um close-up de três quartos.
O timbre de uma voz ou a batida de uma trilha
A técnica da Alibaba: o áudio fornece a voz ou o ritmo, e a fala vai no prompt; o modelo gera a fala e o movimento da boca simultaneamente. Não é uma ferramenta de sincronização labial sobre gravação — para isso, use um modelo de avatar como o OmniHuman.
WAV ou MP3 · 1 a 15 s cada e 15 s no total · 15 MB cada
Use o timbre do Áudio 1 e faça o personagem dizer: "Sério? Isso parece ótimo — quando você volta?" A fala gerada comanda o movimento natural da boca.
Quadros-chave e referências não se misturam. Duas imagens marcadas como primeiro e último quadro criam um clipe de keyframe sozinhas; todo o resto — imagens de assunto, clipes, áudio — combina-se livremente até os limites acima.
Consistência pixel-perfect
O terceiro destaque da Alibaba: "melhorar a certeza de entrega para fluxos de produção" — a documentação do modelo destaca a preservação de detalhes do personagem e referências entre os quadros. A mesma artista do filme principal em três pontos, com 28 segundos de diferença.
1 s
12 s
29 sComo criar prompts para o Wan 3.0
O modelo planeja todo o clipe a partir do prompt, então o prompt deve dizer que tipo de clipe ele é. Nossas renderizações funcionaram sempre que nomeamos a continuidade — um take sem cortes ou uma lista numerada de cenas.
Diga "sem cortes" e cronometre os ritmos
Comece com "um take contínuo, sem cortes, sem transições", dê a cada intervalo de segundos uma ação e um verbo de câmera, mantenha um único assunto principal no quadro e escreva o som como sua própria frase.
UM TAKE CONTÍNUO, SEM CORTES, SEM TRANSIÇÕES, 30 s. Fotorealismo cinematográfico, alto contraste. Uma artista de ópera de Pequim com maquiagem de rosto pintado e traje carmesim e dourado. 0–6 s: close-up extremo em um espelho de camarim cercado de lâmpadas; ela abre os olhos. 6–16 s: ela caminha por um corredor estreito nos bastidores, assistentes se encostam nas paredes, a câmera recua à frente dela enquanto os tambores crescem. 16–24 s: ela atravessa pesadas cortinas de veludo vermelho para a luz ofuscante do palco; a câmera gira para trás do seu ombro. 24–30 s: a revelação — um teatro lotado sob lanternas vermelhas; ela ergue uma manga d'água enquanto um gongo soa. Som: tambores crescendo, passos, o ruído da cortina, um gongo, aplausos. Sem diálogos, sem texto na tela.
- Nomeie as referências
- Imagem 1, Vídeo 1, Áudio 1 — numerados por tipo na ordem de anexo — e diga para que servem: "Imagem 1 é o personagem; Vídeo 1 é o movimento de câmera".
- Direcione o som
- Por padrão, o modelo escreve diálogos, música e efeitos. Peça o que deseja — "chuva e um bonde distante, sem diálogo" — ou desligue a chave de Áudio para um arquivo silencioso.
- Fidelidade acima de tudo
- Ao receber uma imagem, o modelo mantém o que está nela. Para uma grande mudança — clima, vestuário, um cenário diferente — descreva a alteração explicitamente em vez de esperar que o prompt anule a imagem.
- Foque em um protagonista
- Uma única figura, um caminho de câmera definido e as palavras "sem cortes" nos deram um take limpo todas as vezes. Multidões, mãos e pequenos objetos são onde qualquer modelo de vídeo pode apresentar falhas.
- Rascunhe barato, entregue caro
- 480p é o mesmo modelo por um quarto do preço de 1080p. Valide a história em 480p e depois renderize a versão final em 1080p com o mesmo prompt e referências.
Wan 3.0 vs Seedance 2.5 vs Gemini Omni 1.1 Flash
Três modelos na Popcraft que geram som com a imagem. A vantagem do Wan é o take de 30 segundos mais barato e a fidelidade às referências; a do Seedance é o número de referências e edição; a do Omni é o 4K e 40 segundos via extensão. Escolha conforme o trabalho.
| Capacidade | Wan 3.0 | Seedance 2.5 | Gemini Omni 1.1 Flash |
|---|---|---|---|
| Clipe mais longo por pedido | 30 s em uma etapa | 30 s | 40 s por extensão de cena (30 s em 4K) |
| Resoluções | 480p / 720p / 1080p a 30 fps | Até 1080p | Rascunho 360p até 4K |
| Áudio nativo | Diálogo, música, efeitos; desativável | Sim | Fala, música, efeitos sonoros |
| Imagens de referência | Até 4 | Até 30 | Até 10 |
| Vídeos de referência | Até 5, 15 s no total | Até 10 | Até 3 |
| Áudio de referência | Até 5, 15 s no total | Até 10 | — |
| Editar ou estender clipe | — (use Seedance ou Omni) | Editar; estender antes ou depois | Editar; estender em blocos de 10 s |
| Um rascunho de 30 segundos | 330 créditos em 480p | Por segundo, por resolução | 150 créditos em 360p |
Os dados do Wan são do guia oficial da Alibaba; os limites da Popcraft são os disponíveis no seletor hoje. Os tetos dos provedores mudam; o seletor sempre mostra o que está disponível. Comparações completas: Seedance 2.5 · Gemini Omni 1.1 Flash.
Preços do Wan 3.0 na Popcraft
Cobrado por segundo entregue, por resolução. Referências são gratuitas para anexar. Como a duração entregue corresponde ao pedido, o preço exibido antes de gerar é o preço que você paga.
Todo plano inclui créditos; a página de preços lista as taxas atuais para todos os modelos. Downloads no nível gratuito levam uma marca d'água da Popcraft, que os planos pagos removem.
Para que a Alibaba recomenda o Wan 3.0
Os três cenários do material de lançamento da Alibaba e como executá-los na Popcraft.
- 01
Conteúdo de vídeo curto: dramatização e teasers de anúncios
Cenário de entretenimento. Até 30 segundos de narrativa com várias cenas a partir de um prompt, som incluído.
- 02
E-commerce: vitrine de produtos a partir de uma imagem
Cenário de e-commerce — "carregue a imagem de um produto e uma descrição para obter uma vitrine dinâmica". Anexe a foto como Imagem 1.
- 03
Educação: simulações de cenários encenados
Cenário de educação — uma consulta médica ou chamada de suporte encenada a partir de um prompt, com diálogo gerado.
- 04
Rascunhe em 480p, entregue em 1080p
Adição da Popcraft: 11 créditos por segundo em 480p tornam um rascunho de 30 segundos acessível antes de você se comprometer com o 1080p.
Wan 3.0 — perguntas frequentes
É o modelo de vídeo tudo-em-um da Alibaba, do Tongyi Lab. Um único modelo cobre texto-para-vídeo, imagem-para-vídeo, controle de quadros inicial e final e geração de múltiplas referências, produzindo de 2 a 30 segundos em uma etapa a 30 fps, com som nativo.
Qualquer segundo inteiro de 2 a 30, em uma única etapa — sem cadeias de extensão ou montagens. Na Popcraft, você define a duração e o arquivo entregue corresponde exatamente ao pedido.
Sim, por padrão. O modelo gera nativamente diálogos, música de fundo e efeitos sonoros, permitindo especificar falas e sons no prompt. A chave de Áudio na Popcraft permite desativar esse recurso.
Anexe até 4 imagens, 5 clipes de vídeo e 5 de áudio e mencione-os no prompt como Imagem 1, Vídeo 1, Áudio 1, etc. Imagens definem personagens ou cenários; vídeos definem movimento; áudio define voz ou ritmo.
Sim, o modelo foi construído para isso. A Alibaba lista a consistência de aparência, vestuário e ambiente como uma capacidade principal. O Wan 3.0 prioriza a imagem que você fornece.
Atualmente na Popcraft não. Ele usa clipes como referência de movimento; para estender ou editar filmagens, use o Seedance 2.5 ou Gemini Omni 1.1 Flash.
Ele usa referências de áudio para capturar o timbre e o ritmo, enquanto a fala é escrita no prompt para gerar o movimento labial natural. Não é uma ferramenta de dublagem direta de gravação; para isso use o OmniHuman.
É cobrado por segundo: 11 créditos em 480p, 20 em 720p e 40 em 1080p. Um rascunho de 30 segundos em 480p custa 330 créditos; o mesmo clipe em 1080p custa 1.200.
Trinta segundos, um único pedido. Tente em 480p primeiro.
Crie um rascunho por 330 créditos, avalie a história e renderize a versão final em 1080p — ou traga uma folha de personagem e um clipe e deixe-os interagir.
Continue explorando
Modelos relacionados
O Seedance 2.5 gera até 30 segundos de vídeo em uma única tarefa, com até 50 ativos de referência, edição de vídeo controlável, extensão temporal de alta fidelidade, qualquer proporção de tela de 0,4 a 2,5 e prompts nativos em mais de 10 idiomas. Disponível no Popcraft.
Gemini Omni 1.1 Flash é o modelo de vídeo do Google que cria e edita vídeos a partir de qualquer entrada. Até 40 segundos por extensão de cena, saída em 1080p e 4K, interpolação do primeiro e do último quadro, até 10 imagens de referência e fala, música e efeitos sonoros gerados juntamente com a imagem. Já disponível no Popcraft.
O MiniMax H3 gera vídeo 2K a 24 fps com trilha estéreo sincronizada — efeitos, ambiência e diálogos em um só job. Multi-shot a partir de um prompt, 5 a 15s, controle de frames inicial e final. Já na Popcraft.
Gere vídeos cinematográficos em 4K a partir de texto, imagens ou clipes com o Seedance 2.0 no Popcraft. Áudio sincronizado nativo, sequências multi-shot e detalhe afiadíssimo em até 4K (2160p).