Seedance 2.5 · ByteDance
Trinta segundos, numa única geração
Um anúncio inteiro, uma demonstração de produto ou o ritmo de uma cena é retornado como uma geração de trinta segundos em vez de cinco clipes e uma junção — mantido coeso por até cinquenta ativos de referência e editado posteriormente sem necessidade de regerar.
Disponível no Popcraft, ao lado do Seedance 2.0.
Trinta segundos, duas vezes
Dois dos filmes de demonstração da própria ByteDance, na duração para a qual o modelo foi concebido. Cada um é uma única geração — imagem, mudanças de câmera e som chegam juntos, sem nada montado depois.
O que procurar neles
Os quatro avanços são os detalhes que decidem se uma tomada parece uma filmagem real ou um resultado gerado.
Luz que obedece ao ambiente
Os reflexos nos olhos parecem vidro com profundidade, e a direção, a atenuação e a reflexão seguem a física da cena em vez de parecerem pintados.
Movimentos que mantêm a linha
As trajetórias de aproximação, afastamento, panorâmica e inclinação voltam mais suaves e estáveis, o que faz com que um movimento de trinta segundos se sustente ao longo de toda a sua duração.
Expressão como uma curva
Microexpressões — um tremor nos olhos, o pressionar dos lábios — conduzidas como movimento contínuo ao longo de todo o tempo, em vez de alternadas bruscamente entre poses.
Pele, cabelo e a lacuna da estranheza
Textura da pele, brilho do cabelo e pequenos movimentos faciais mais próximos de como uma câmera os registra, com menos do aspecto plástico que denuncia um rosto gerado.
Quatro coisas mudam, e apenas uma delas é a duração
O 2.5 avança em quatro eixos: gerações mais longas, referências mais ricas, edição precisa e criação multilíngue. A duração é o grande destaque. A edição é a mudança que realmente se sente no dia a dia de trabalho.
Trinta segundos a partir de uma única geração
Até trinta segundos em uma única geração, mantendo o movimento de câmera, a continuidade e um arco narrativo completo em todo o clipe. O Seedance 2.0 atinge no máximo quinze. A Extensão Temporal de Alta Fidelidade avança ou recua um clipe curto, ou conecta dois deles.
Tudo o que a cena precisa, em um único briefing
Trinta imagens, dez clipes de vídeo e dez clipes de áudio podem ser incluídos numa única geração — elenco, produto, local, comportamento da câmera, música e voz juntos. Na versão 2.0, esse limite era de nove imagens e três clipes.
Altere um detalhe, mantenha o clipe
A Edição de Vídeo Controlável mantém o enquadramento, a câmera e o ritmo, e reescreve apenas o que você especificar: um fundo, uma peça de roupa, um produto, a expressão de um ator, a música. Uma falha em trinta segundos bons deixa de ser motivo para gerar tudo de novo.
Descreva com suas próprias palavras
Chinês, inglês, espanhol, indonésio, malaio, tailandês, árabe, português, vietnamita, japonês e coreano, entre outros, nativamente — o prompt não precisa mais ser traduzido antes que o modelo o leia. O cumprimento de instruções está mais forte em todos os aspectos.
2.5 ao lado de 2.0, linha por linha
O Seedance 2.0 continua na linha e, em 4K, ainda é a ferramenta certa para um plano curto.
| Capacidade | Seedance 2.0 | Seedance 2.5 |
|---|---|---|
| Geração única mais longa | 15s | 30s |
| Imagens de referência | 9 | 30 |
| Clipes de vídeo e áudio de referência | 3 | 10 de vídeo + 10 de áudio |
| Duração total de referência | 15s | 30s de vídeo, 30s de áudio, contados separadamente |
| Referência apenas de áudio | — | Suportado |
| Marcações de tempo no prompt | Apenas números de plano | Marcas de tempo em segundos inteiros |
| Imagens do sujeito em múltiplos ângulos | Não recomendado | Suportado |
| Proporção de tela de saída | Seis proporções fixas | Qualquer proporção de 0,4 a 2,5, definida pela entrada |
| Saída em MOV, para edição e extensão | — | Suportado — continuidade de cor e áudio na junção |
Cada recurso chega com uma função
A contagem é a parte fácil. O que o torna útil é que cada ativo é anexado com um símbolo @ e recebe uma função declarada, para que o modelo saiba qual imagem é o ator e qual é a iluminação.
Até 4K, 30 MB cada. JPEG, PNG, WebP, BMP, TIFF, GIF, HEIC, HEIF. Conjuntos multivistas do mesmo assunto são suportados no 2.5, ao passo que o 2.0 os desaconselhava.
De 480p a 4K, 200 MB cada, 2–30s por clipe, MP4 ou MOV. Os clipes compartilham um total de trinta segundos.
15 MB cada, 2–30s por clipe, MP3 ou WAV, com seu próprio total separado de trinta segundos. As referências apenas de áudio são novas no 2.5 — uma trilha musical de fundo, uma voz ou uma faixa de efeitos podem guiar o ritmo, a sincronização de batidas e a sincronização labial por conta própria.
O que uma referência pode transmitir
- Sujeito
- A aparência ou a voz de uma pessoa, animal, produto, objeto de cena, local ou personagem inventado — aquilo que precisa se manter igual durante todo o clipe.Use a mulher em @image 1 como personagem principal, caminhando por uma rua da cidade ao anoitecer.
- Movimento
- Ação, movimento de câmera, ritmo e efeitos extraídos de um clipe e aplicados a um sujeito diferente. Funciona entre diferentes espécies e estilos, não apenas entre tomadas.Siga o movimento de câmera e o ritmo de corrida em @video 1; o sujeito é @image 1.
- Modelo branco
- Um modelo 3D simples e sem textura orienta a coreografia da câmera e a composição da cena; os materiais finalizados, a iluminação e a atmosfera vêm de imagens estáticas. Uma geometria simples funciona melhor aqui do que um modelo detalhado.Renderize o movimento no modelo branco do @video 1; sujeito na @image 1, cena na @image 2.
- Estilo
- Paleta, gradação de cor e textura extraídas de uma imagem ou clipe, enquanto o elenco permanece o seu.Use a gradação noturna azul-fria de @video 1, mantendo a personagem principal de @image 1.
- Áudio
- Música, melodia, diálogo ou timbre vocal. Atribua uma voz para cada personagem e o filme responde falando com ela.A voz do pai: grave, pausada, de meia-idade. Referência @audio 1.
- Storyboard
- Um storyboard de vários quadros lido como um esboço de enredo. Quinze quadros ou menos, arte em traço preferencialmente a um quadro renderizado, e nenhum texto desenhado nos quadros. O resultado segue a história, e não o desenho quadro a quadro.Siga os quatro painéis em @image 1; o personagem é @image 2.
- Quadros-chave
- Uma imagem como primeiro quadro, duas como primeiro e último, ou um conjunto de quadros-chave independentes. Diferente de um storyboard, o resultado segue estes elementos de perto.A @image 1 é o primeiro quadro, a @image 5 é o último; leve-a do ambiente interno para o externo.




O re-roll deixa de ser a única opção
Ambas as capacidades utilizam um clipe finalizado como @video 1 e não alteram nada do que você não mencionar. A edição reescreve parte do que já existe. A extensão escreve o que vem antes ou depois.


Reescreva uma região, mantenha o resto
Adicione um sujeito, remova outro, troque uma peça de roupa ou uma cena em relação a uma imagem de referência, ou altere o áudio — uma trilha sonora diferente, um efeito adicionado, uma fala redublada. As marcas de tempo restringem a edição a uma janela: 0:02–0:05 e nada fora dela se move.
O padrão que funciona tem três partes: aponte para a origem, nomeie o objeto e a alteração, depois adicione uma cláusula de preservação para que o modelo não altere o restante do quadro.
Substitua a roupa escura do homem no @video 1\npela roupa da @image 2.\nMantenha todo o resto inalterado.
Escreva o que vem antes e depois
Estenda para a frente a partir do último quadro, para trás até o momento anterior ao primeiro, ou gere a ponte que falta entre dois clipes para que se unam. Personagem, cena e câmera mantêm-se ao longo da transição, e é possível solicitar que ela seja contínua tanto na imagem como no som.
A extensão é como seis segundos fortes se tornam trinta finalizados sem regenerar a parte que já funciona. MOV na entrada e MOV na saída é o caminho recomendado — mantém a consistência de cor, brilho e áudio ao longo da junção.
Comece a partir do quadro final do @video 1 e estenda\n6 segundos: ela sai do quadro, o céu escurece,\nas luzes da rua acendem uma a uma. Mantenha a transição fluida.
O que a entrada decide por você
O 2.5 divide as tarefas conforme os ativos de origem definam ou não o formato do resultado. O 2.0 não estabelece essa linha, e esta é a parte com mais probabilidade de surpreender quem estiver migrando.
| Tarefa | Proporção de tela | Duração |
|---|---|---|
| Edição | Bloqueado ao clipe de origem | Segue a fonte, com margem de cerca de um terço de segundo |
| Primeiro quadro, ou primeiro e último | Bloqueado à imagem do primeiro quadro | Você define |
| Extensão | Bloqueado ao clipe de origem | Você define |
| Geração de referência | Aberto | Você define |
| Storyboards e quadros-chave | Aberto | Você define |
Onde trinta segundos mostram seu valor
Os casos de uso do modelo dividem-se em cinco famílias. Quatro deles são tarefas que se tornam mais rápidas. O quinto só se torna possível quando uma geração dura tanto tempo.
Uma cena que se desenrola
Um momento do enredo executado na íntegra em uma única geração, com um elenco mantido coeso por imagens estáticas de referência. Correções de continuidade — uma estrutura visível, um objeto disperso — tornam-se uma edição em vez de uma nova filmagem.
Um máster, depois todas as versões
Um corte principal e depois as versões: troque o SKU, o modelo, o texto na tela ou o mercado, mantendo a aparência do produto e o visual da marca bloqueados por referência. A locução segue nos idiomas que você precisa.
Toda a ideia numa única tomada
Uma ideia explicada do início ao fim em trinta segundos, um apresentador substituído sem necessidade de regravação e o mesmo conjunto distribuído em vários idiomas.
Um procedimento, do início ao fim
Etapas de montagem e operação exibidas de ponta a ponta, com placas de identificação, painéis de especificações e textos de embalagem reescritos por produto, mantendo a gravação original.
O trabalho que quinze segundos recusavam
Trailers de jogos e CG, apresentadores virtuais, um curta expandido para uma série, um personagem envelhecido ou com novo estilo para um corte sazonal.
Escreva como uma lista de tomadas
Trate o modelo como um produtor que lê um briefing estruturado. O formato abaixo é o que sobrevive ao ser repassado a outra pessoa.









Cinco partes, nesta ordem
Assunto, local, evento, gênero e estilo, movimento de câmera. Em seguida, uma sequência de planos — marcações de tempo em segundos inteiros ou planos numerados, ambos são lidos — descrevendo por segmento o que é visto, como a câmera se move, o que é dito e o que é ouvido. Conclua com as constantes: o ângulo, o ambiente, a atmosfera, o som de fundo.
Mantenha cerca de um segundo de história por segundo de tela. Pouco conteúdo em uma janela faz o modelo improvisar; muito conteúdo faz com que ele corte freneticamente ou descarte metade.
Mapeie cada um, no texto
Numere os ativos na ordem de envio e vincule cada um no prompt: qual é o sujeito, qual é a voz, qual é a ação, qual é a cena. Escrever um nome na imagem e usá-lo no prompt é a maneira confiável de obter dois do mesmo personagem.
Quando uma referência já for precisa, diga para segui-la e pare. Redescrever o movimento contido nela dá ao modelo duas instruções para reconciliar.
img1–2 são o personagem 1, dublado por @audio 1;\nimg3–4 são o personagem 2, dublado por @audio 2.\nSiga a ação de lançamento de feitiço em @video 1 e o\nmovimento de órbita em @video 2.
- Linguagem de câmera
- Termos padrão são inseridos como estão — tamanhos de plano, push in, pull out, pan, track, orbit, ângulo baixo, take único, dolly zoom, câmera na mão, speed ramp. Um termo de nicho precisa de uma explicação simples em seguida, e uma transição precisa do seu ponto de ativação e do seu método.
- Ação e expressão
- Descreva a maior parte da ação de forma geral e reserve os detalhes para os dois ou três momentos principais que precisam de impacto. As expressões são melhor interpretadas quando descritas por extenso do que nomeadas com uma expressão idiomática.
- Positivo em vez de negativo
- Diga o que deve estar presente. Instruções negativas são respeitadas quando se referem a legendas e áudio — sem legendas, sem música de fundo —, que também são os dois elementos que o modelo mais tende a adicionar sem ser solicitado.
- Som
- Ambiência, efeitos, diálogos e trilha sonora podem ser definidos a partir de uma referência de áudio e descritos nas instruções, incluindo qual deles deve dar lugar quando alguém fala.
Quanto custa um segundo do 2.5
O Seedance 2.5 é cobrado por segundo de vídeo gerado, na resolução que você escolher. As tarifas do nível do plano aplicam-se automaticamente — o desconto pertence ao plano e aplica-se a cada geração.
O custo de uma geração do Seedance 2.5 em 720p na tarifação padrão. 480p custa 24 créditos por segundo — a forma mais barata de iterar antes de uma passagem final.
−20% na cobrança mensal. O desconto aplica-se a cada geração do Seedance, e não apenas uma vez.
−40% na cobrança mensal. A maior taxa de desconto e o motivo pelo qual vale a pena executar duas vezes uma geração de trinta segundos.
Perguntas
Sim — o Seedance 2.5 está disponível no seletor de modelos de vídeo do Popcraft. Escolha-o ao lado do Seedance 2.0, defina uma duração de até trinta segundos e gere.
Não. O Seedance 2.0 e o Seedance 2.0 4K permanecem na lista de modelos. Uma tomada de produto de seis segundos não precisa de um limite de trinta segundos, e a saída em 4K é um motivo para escolher o 2.0 para isso. O que o 2.5 adiciona é a duração, a quantidade de referências e a capacidade de editar um clipe que você já possui.
Cinquenta é o limite máximo, e a recomendação é ficar bem abaixo disso: oito ou menos sujeitos de imagem, cinco ou menos quando as referências principais forem áudio ou vídeo, clipes de cinco a dez segundos e storyboards de quinze quadros ou menos. Além desses limites, a estabilidade cai e as gerações começam a precisar de repetições.
Pegue um clipe de que você já gosta e estenda-o. A extensão é o teste mais barato dessa afirmação, pois começa a partir de um material que você já aprovou. Se a emenda se mantiver — o rosto, a gradação de cor, a velocidade da câmera —, vale a pena investir numa geração mais longa para o restante das promessas do modelo. Se não se mantiver, você descobriu isso pelo preço de poucos segundos.
Trinta segundos é o anúncio inteiro
A junção entre dois clipes de quinze segundos é onde um filme gerado se revela. O Seedance 2.5 torna essa junção opcional.
Continue explorando
Modelos relacionados
O MiniMax H3 gera vídeo 2K a 24 fps com trilha estéreo sincronizada — efeitos, ambiência e diálogos em um só job. Multi-shot a partir de um prompt, 5 a 15s, controle de frames inicial e final. Já na Popcraft.
Gere vídeos cinematográficos em 4K a partir de texto, imagens ou clipes com o Seedance 2.0 no Popcraft. Áudio sincronizado nativo, sequências multi-shot e detalhe afiadíssimo em até 4K (2160p).

O Seedance 2.0 Mini é o nível de vídeo mais leve da ByteDance — até 50% mais barato do que o Seedance 2.0 padrão e ~2× mais rápido do que o Fast, com prompts de texto, imagem, vídeo e áudio. Disponível no Popcraft.

Transforme imagens e prompts em vídeos cinematográficos com o Seedance 2.0 no Popcraft. Recursos de referência para vídeo, primeiro/último quadro e formatos de proporção variados em até 4K.
