Transforme uma foto em vídeo falante com OmniHuman 1.5
Forneça um único retrato e qualquer faixa de voz e o OmniHuman 1.5 entrega sincronização labial de nível cinematográfico, expressão facial e gestos naturais de cabeça.
O que o OmniHuman 1.5 pode fazer
Avatar de imagem única
Anime um retrato em um personagem totalmente performático — sem rigging, sem treinamento, sem regravação.
Sincronização labial precisa
Formas labiais, movimento da mandíbula e timing de fonemas se sincronizam firmemente com a faixa de voz fornecida.
Performance emocional
Expressões, micro-movimentos e gestos de cabeça respondem à prosódia e energia do áudio.
Qualidade cinematográfica
O gerador aprimorado da ByteDance produz pele, cabelo e iluminação naturais que se sustentam em close-ups.
Vertical, quadrado, widescreen
Exporte 9:16 para Shorts, 1:1 para feed e 16:9 para YouTube ou web a partir da mesma imagem fonte.
Direcionamento por máscara
Use suporte de máscara para direcionar a sincronização labial ao sujeito correto quando múltiplos rostos compartilham o quadro.
Feito para criadores reais
Vídeos de porta-voz para redes sociais
Transforme um headshot de fundador em explainers para TikTok, Reels e Shorts em qualquer idioma, sem reservar tempo de estúdio ou talento presencial.
Criativos de anúncio e demos de produto
Gere dezenas de anúncios de avatar localizados a partir de um retrato — troque roteiros e vozes enquanto a performance permanece consistente.
Vídeos de curso e treinamento
Construa módulos de onboarding, RH e e-learning onde um instrutor amigável fala diretamente para a câmera por até trinta segundos de cada vez.
Divulgação personalizada e vendas
Crie intros de 15 segundos com cabeça falante para e-mail e LinkedIn que parecem gravadas mas escalam como texto.
Especificações
- Provedor
- ByteDance
- Tipos de entrada
- Imagem de retrato + áudio
- Formatos de imagem suportados
- JPEG / PNG
- Formatos de áudio suportados
- MP3 / WAV / M4A
- Proporções de aspecto
- 9:16, 16:9, 1:1
- Resoluções
- 720p, 1080p
- Duração máxima (720p)
- 60 segundos
- Duração máxima (1080p)
- 30 segundos
- Suporte a máscara
- Sim (direcionar rosto específico)
- Guia por prompt de texto
- Opcional
Como o Popcraft usa o OmniHuman 1.5
O OmniHuman 1.5 alimenta o fluxo de vídeo falante do Estúdio de Personagens do Popcraft. Envie um retrato, anexe uma faixa de voz do ElevenLabs TTS ou sua própria gravação, escolha uma proporção de aspecto e resolução, e o Popcraft cuida da seleção de máscara, envio através do gateway Batch AI e streaming de progresso via SSE. O clipe finalizado é salvo no seu projeto de Avatar e galeria de recursos, pronto para ser inserido no pipeline do Agente de IA junto com B-roll gerado, SFX e música de fundo na timeline multitrack do Remotion.
Perguntas frequentes
O OmniHuman 1.5 é um modelo de vídeo com cabeça falante da ByteDance que anima um único retrato em um personagem falante realista. Ele produz sincronização labial expressiva, performance facial e movimentos sutis de cabeça a partir de uma imagem mais áudio.
Você fornece um retrato e uma faixa de áudio. O modelo analisa a voz quanto ao ritmo, prosódia e fonemas, e então gera um vídeo onde a pessoa retratada fala sincronizada com o áudio e realiza expressões faciais correspondentes.
Contas gratuitas do Popcraft incluem créditos que podem ser usados no OmniHuman 1.5. Renders mais longos ou em maior resolução consomem mais créditos, e planos pagos ou recargas estendem seu orçamento mensal.
Os planos pagos do Popcraft concedem direitos comerciais para os vídeos que você renderiza. Você ainda precisa de consentimento para usar a imagem de qualquer pessoa real retratada no seu retrato fonte — nunca gere conteúdo de cabeça falante de alguém sem permissão.
Até 30 segundos por render em 1080p e até 60 segundos em 720p. Vídeos mais longos são montados unindo múltiplos clipes na timeline do Remotion.
9:16 para vídeo vertical de formato curto, 16:9 para YouTube widescreen e landing pages, e 1:1 para postagens quadradas de feed. O Popcraft disponibiliza todas as três no Estúdio de Personagens.
Abra a página Personagem, envie um retrato, anexe seu áudio, escolha proporção de aspecto e resolução, e envie. O progresso é transmitido ao vivo e o vídeo falante finalizado aparece na sua galeria.
Pronto para experimentar o OmniHuman 1.5?
Comece a criar em segundos com 100 créditos grátis — sem cartão necessário.
Experimente vídeo falante grátisContinue explorando
Modelos relacionados
Gere vídeos de avatar falante de longa duração com Kling Avatar no Popcraft. Saídas em 9:16, 16:9 e 1:1 de até 60 segundos a partir de uma única imagem e áudio.
O Seedance 2.5 gera até 30 segundos de vídeo em uma única tarefa, com até 50 ativos de referência, edição de vídeo controlável, extensão temporal de alta fidelidade, qualquer proporção de tela de 0,4 a 2,5 e prompts nativos em mais de 10 idiomas. Disponível no Popcraft.
O MiniMax H3 gera vídeo 2K a 24 fps com trilha estéreo sincronizada — efeitos, ambiência e diálogos em um só job. Multi-shot a partir de um prompt, 5 a 15s, controle de frames inicial e final. Já na Popcraft.
Gere vídeos cinematográficos em 4K a partir de texto, imagens ou clipes com o Seedance 2.0 no Popcraft. Áudio sincronizado nativo, sequências multi-shot e detalhe afiadíssimo em até 4K (2160p).