Transformez une photo en vidéo parlante avec OmniHuman 1.5
Fournissez un seul portrait et n'importe quelle piste audio et OmniHuman 1.5 produit une synchronisation labiale de qualité cinéma, des mouvements faciaux expressifs et des gestes de tête naturels.
Ce que OmniHuman 1.5 peut faire
Avatar à partir d'une seule image
Animez un portrait en un personnage qui joue pleinement — sans rigging, sans entraînement, sans retournage.
Synchronisation labiale précise
Les formes de la bouche, le mouvement de la mâchoire et le timing des phonèmes s'alignent étroitement sur la piste audio fournie.
Performance émotionnelle
Les expressions, micro-mouvements et gestes de tête répondent à la prosodie et à l'énergie de l'audio.
Qualité cinématographique
Le générateur amélioré de ByteDance produit une peau, des cheveux et un éclairage naturels qui tiennent en gros plan.
Vertical, carré, grand écran
Exportez en 9:16 pour les Shorts, 1:1 pour le fil et 16:9 pour YouTube ou le web à partir de la même image source.
Ciblage guidé par masque
Utilisez le support de masque pour verrouiller la synchronisation labiale sur le bon sujet lorsque plusieurs visages partagent le cadre.
Conçu pour les vrais créateurs
Vidéos de porte-parole pour les réseaux sociaux
Transformez un portrait de fondateur en explicatifs TikTok, Reels et Shorts dans n'importe quelle langue, sans réserver de studio ni de talent devant la caméra.
Créatifs publicitaires et démos produit
Générez des dizaines de publicités d'avatar localisées à partir d'un portrait — changez les scripts et les voix tandis que la performance reste cohérente.
Vidéos de cours et de formation
Construisez des modules d'intégration, de RH et d'e-learning où un instructeur sympathique parle directement à la caméra pendant moins de trente secondes par clip.
Prospection personnalisée et ventes
Créez des intros vidéo parlante de 15 secondes pour l'email et LinkedIn qui semblent enregistrées mais se déploient comme du texte.
Spécifications
- Fournisseur
- ByteDance
- Types d'entrée
- Image portrait + audio
- Formats d'image pris en charge
- JPEG / PNG
- Formats audio pris en charge
- MP3 / WAV / M4A
- Formats d'image
- 9:16, 16:9, 1:1
- Résolutions
- 720p, 1080p
- Durée max. (720p)
- 60 secondes
- Durée max. (1080p)
- 30 secondes
- Support de masque
- Oui (cibler un visage spécifique)
- Guidage par prompt texte
- Optionnel
Comment Popcraft utilise OmniHuman 1.5
OmniHuman 1.5 alimente le flux de travail de vidéo parlante du Character Studio de Popcraft. Téléversez un portrait, joignez une piste audio d'ElevenLabs TTS ou de votre propre enregistrement, choisissez le format d'image et la résolution, et Popcraft gère la sélection du masque, la soumission via le gateway Batch AI et le streaming de progression par SSE. Le clip terminé est sauvegardé dans votre projet Avatar et votre galerie d'actifs, prêt à être intégré dans le pipeline Agent IA aux côtés de B-roll généré, SFX et musique de fond sur la timeline multi-piste Remotion.
Questions fréquentes
OmniHuman 1.5 est un modèle de vidéo tête parlante de ByteDance qui anime un seul portrait en un personnage parlant réaliste. Il produit une synchronisation labiale expressive, une performance faciale et des mouvements subtils de tête à partir d'une image plus audio.
Vous fournissez un portrait et une piste audio. Le modèle analyse la voix pour le rythme, la prosodie et les phonèmes, puis génère une vidéo où la personne photographiée parle en synchronisation avec l'audio et effectue des expressions faciales correspondantes.
Les comptes gratuits Popcraft incluent des crédits utilisables pour OmniHuman 1.5. Les rendus plus longs ou en résolution supérieure consomment plus de crédits, et les forfaits payants ou recharges étendent votre budget mensuel.
Les forfaits payants Popcraft accordent des droits commerciaux sur les vidéos que vous rendez. Vous avez toujours besoin du consentement pour utiliser l'image de toute personne réelle figurant dans votre portrait source — ne générez jamais de contenu tête parlante de quelqu'un sans permission.
Jusqu'à 30 secondes par rendu en 1080p et jusqu'à 60 secondes en 720p. Les vidéos plus longues sont assemblées en enchaînant plusieurs clips sur la timeline Remotion.
9:16 pour les vidéos verticales courtes, 16:9 pour YouTube grand écran et les landing pages, et 1:1 pour les publications carrées. Popcraft expose les trois depuis le Character Studio.
Ouvrez la page Character, téléversez un portrait, joignez votre audio, choisissez le format d'image et la résolution, et soumettez. La progression est diffusée en direct et la vidéo parlante terminée arrive dans votre galerie.
Prêt à essayer OmniHuman 1.5 ?
Commencez à créer en quelques secondes avec 100 crédits gratuits — sans carte.
Essayez la vidéo parlante gratuitementContinuez à explorer
Modèles associés
Générez des vidéos d'avatar parlant longue durée avec Kling Avatar sur Popcraft. Sorties 9:16, 16:9 et 1:1 jusqu'à 60 secondes à partir d'une seule image et audio.
Seedance 2.5 génère jusqu'à 30 secondes de vidéo en une seule tâche, avec jusqu'à 50 ressources de référence, de l'édition vidéo contrôlable, de l'extension temporelle haute fidélité, n'importe quel ratio d'aspect de 0,4 à 2,5 et du prompting natif dans plus de 10 langues. Disponible sur Popcraft.
MiniMax H3 génère des vidéos 2K à 24 fps avec bande-son stéréo synchronisée : effets, ambiance et dialogues. Multi-plans, 5 à 15 s, contrôle des images clés. Sur Popcraft.
Générez de la vidéo cinématographique en 4K à partir de texte, d'images ou de clips avec Seedance 2.0 sur Popcraft. Audio synchronisé natif, séquences multi-plans et détail d'une netteté absolue jusqu'en 4K (2160p).