MiniMax H3
La vidéo qui arrive avec son propre son
MiniMax H3 génère une image 2K et une piste stéréo synchrone en une seule fois — effets, ambiance et dialogues, ensemble. Disponible sur Popcraft.
Films réalisés avec H3
Dialogues, titres, bande-annonce, films de marque, mode, interface, design d'affiche, effets, macro et cadre anamorphique. Lecture au défilement ; appuyez sur le haut-parleur.
Quelqu'un qui parle vraiment
Une créatrice en terrasse, parlant à la caméra. Les mots, la synchro labiale et la rue ont été générés ensemble — c'est le cœur de ce modèle.
Campagne d'optique
Tourné nativement en 9:16. Verres miroirs, silhouettes sculptées et studio épuré — l'identité reste constante à chaque coupe.
MIDNIGHT LINE
Un générique de film noir : écrans divisés, blocs de couleur et crédits synchronisés sur la batterie, avec sa propre musique jazz.
Un menu de jeu fonctionnel
Sélection de personnage, personnalisation d'armes, boutons lisibles. Rendre une interface nette est un défi pour l'IA, d'où sa présence ici.
THE STARS WERE LISTENING
Teaser de SF à haut contraste. Une petite silhouette face à un anneau géant, le titre sortant de l'ombre, et une musique montante.
POPUP! Series 001
Design d'affiche et d'objet de collection : typographie de titre, numérotation et personnage assez nets pour l'impression.
Feu et cuir
Mode éditoriale à haut contraste — flammes en arrière-plan, cuir verni devant, et un mannequin cohérent d'un plan à l'autre.
LEATHER IN MOTION
Crépuscule, voiture et étude de texture. Mouvements lents, source de lumière unique et typographie épurée sur l'image.
Dessin sur le monde réel
Animation de lignes lumineuses dessinées à la main sur une vidéo de tramway, changeant de forme tout au long du trajet.
Assez près pour compter les écailles
Un gecko à crête en macro extrême, langue sur l'œil. Texture de peau, reflets humides et micro-mouvements maintenus en 2K.
MINIMAX, 2.35:1
Pièce de marque livrée en 2944 by 1248 — un vrai cadre anamorphique plutôt qu'un recadrage 16:9, avec logo net sur les balustrades.
Le prompt à l'origine
Le brief, les références fournies et le film généré — musique, coupes et texte inclus, en une seule fois.
Un générique de 15 secondes en 16:9 pour un film noir. Langage visuel : titres anime rétro, silhouettes nettes, collage comics, écrans divisés asymétriques, blocs de couleur géométriques, crédits en anglais, un peu de katakana, ambiance jazz/crime. Ambiance 60% suspense, 40% jazz — mystérieux, cool, urbain ; pas d'horreur, pas de lourdeur.
Le mouvement doit évoquer un collage graphique : cadres se dessinant sur noir, limites d'écrans qui claquent, panneaux apparaissant bloc par bloc ; silhouettes, gros plans et crédits surgissant sur les coups de batterie.
Les crédits en anglais doivent être nets et lisibles : un cadre se dessine, le nom glisse, les lettres apparaissent, un bloc de couleur masque la révélation. Pas de chinois ajouté, pas de glyphes incohérents. Chaque crédit apparaît une seule fois.
Transitions : masque vinyle circulaire, balayage vertical, ombre portée, coupe ligne rouge, masque lettre géant. Tout sur le rythme. Pas de fondus, pas de morphings fluides.
Musique : thème original de 15 secondes, 60% suspense et 40% jazz — basse soutenue, cordes pizzicato tendues, pulse synthé froid, batterie, balais, fragment de walking-bass, saxo grave et cuivres courts. Montée basse/hats (2s), kick (3s), basse jazz (6s), riff sax/cuivres (10s), accord tendu final (13-15s). Ne pas imiter de mélodie existante.






Les six planches indiquées — « référencer le langage visuel de ces images ».
Une seule génération. Les crédits, les écrans divisés, les transitions et le jazz sont arrivés ensemble — rien n'a été ajouté après.
Cas d'utilisation
Là où le son généré et les coupes en une prise changent la donne.
Des pubs verticales prêtes dès le premier jet
Un montage 9:16 arrive avec ambiance, bruitages et voix déjà intégrés, pour que la première version vue soit complète.
Des packshots qui bougent
Encadrez un produit avec une première et une dernière image, le modèle génère le mouvement — le même pot, la même lumière, ouvert.
Un visage sur toute une série
Les images de référence maintiennent l'identité et la tenue entre les prises et les coupes, idéal pour un personnage récurrent.
Des animatiques avec caméra intégrée
Les mouvements sont décrits avec précision pour obtenir un vrai push-in plutôt que ce que le modèle décide au hasard.
Des versions courtes sans montage
Les coupes écrites dans le prompt sont livrées comme plusieurs plans dans un seul clip, avec une ambiance sonore continue.
Ce qui fait la différence
Trois points — et seul le premier est vraiment rare.
Son généré avec l'image
Effets, ambiance et dialogues synchronisés dans le même fichier. Les répliques scriptées reviennent mot pour mot et en synchro, 4 of 4.
Coupes dans une seule génération
Trois plans et deux coupes franches, placés selon le prompt, sans raccords indésirables, avec l'ambiance sonore en continu.
Toute durée entre 5 et 15 s
La durée est respectée à l'image près en mode référence. Un montage de onze secondes est livré en onze, pas arrondi à quinze.
H3 face à Seedance 2.0
Notre propre test : même prompt, mêmes images de référence. Un test, pas un benchmark définitif. H3 a choisi son propre format car il rejette le ratio imposé avec une image de référence.
| Mesure | MiniMax H3 | Seedance 2.0 |
|---|---|---|
| Image livrée | 1440 × 2560 · 24 fps | 1248 × 1664 · 24 fps |
| Répliques transcrites | mot pour mot et synchro, 4 of 4 | incohérent, désynchronisé |
| Durée demandée → livrée | 8 s → 8.000 s | 8 s → 8.08 s |
| Instruction de cadrage tenue | non — le pot a rétréci dans l'image | oui |
| Logo lisible, image par image | 134 of 192 | 159 of 193 |
Comparable sur l'image, nettement meilleur sur le son, moins précis sur les instructions. Aucun prompt ne demandait de dialogue, pourtant H3 en crée s'il n'a pas d'ordre contraire.
Comment rédiger les prompts
Trois parties. Indiquez le rôle de chaque fichier joint, écrivez une phrase sur l'intention créative, puis décrivez le clip plan par plan (durée, cadrage, mouvement, dialogue et son).
Énoncez clairement ce que vous ne voulez pas
Un élément négatif doit être une instruction. Pour le silence, réglez le champ de musique non diégétique sur N/A — écrit "non_diegetic_music": N/A. Omettre le champ n'est pas la même chose.
Ce n'est pas optionnel. Un de nos tests demandant une ambiance calme sans dialogue a généré une voix complète avec des arguments produits non sollicités.
Le paysage sonore a son propre champ
L'ambiance et les sons d'action vont dans overall_soundscape. La musique que les personnages n'entendent pas va dans non_diegetic_music. Le dialogue reste dans la description du plan.
Citez le texte, adaptez les répliques
Les mots à l'écran doivent être entre guillemets. Une réplique doit tenir dans la durée du plan ; elle peut chevaucher une coupe si vous nommez les plans concernés.
Un prompt rempli
les trois parties, au format lu par le modèleintegrated_multimodal_description: [Shot 1] A barista sets a mug on the marble counter shown in <Picture 1>, keeping the counter, the light and the mug's position. The camera pushes in with small amplitude at slow speed. The barista with a warm, low voice (S1) says: <d>[English] Yours.</d> [Shot 2] At 00:05.000, the shot cuts to an overhead close-up of steam rising from the mug while her last word carries over. overall_soundscape: Ceramic meets stone with one soft knock and low room tone continues underneath. An espresso machine hisses two rooms away. non_diegetic_music: N/A
Utilisation sur Popcraft
H3 se trouve dans la liste des modèles vidéo. Suivez ces trois étapes (la troisième est souvent oubliée).
Choisissez MiniMax H3
Réglez la durée — n'importe quelle seconde entre cinq et quinze — et le palier de qualité.
Joignez des références et précisez leur rôle
MiniMax échoue souvent si une pièce jointe n'est pas étiquetée. Précisez s'il s'agit de la première ou dernière image du plan.
Dirigez le son, y compris le silence
Décrivez le paysage sonore et ce que vous ne voulez pas. Sinon, H3 inventera et interprétera ses propres dialogues.
Questions
Un clip arrive avec ses effets et dialogues, donc le travail sonore devient un montage plutôt qu'une création intégrale. Ce n'est pas un mixage final : les niveaux varient, prévoyez donc une normalisation avant publication.
Oui, sauf instruction contraire. C'est le point crucial de H3. Un prompt demandant le silence a généré une voix avec des affirmations produits. Précisez le négatif comme une instruction à part entière. Pour un client, traitez cela comme une étape de validation obligatoire.
Une demande 768p ou 720p renvoie 768 pixels sur le petit côté. Une demande 1080p est poussée en 2K (1440 pixels), la seule valeur non respectée. Le palier inférieur est 40% plus rapide. Ce que vous perdez, c'est la netteté des textes fins.
Seulement sans image de référence. Le texte-vers-vidéo respecte le ratio. Avec une référence, le ratio devient adaptatif et non déterministe. Une référence 3:4 peut devenir du 9:16. Fiez-vous au fichier livré.
L'identité oui, le cadrage moins. Les images de référence verrouillent bien l'identité et la tenue. Les instructions de cadrage sont moins stables que sur Seedance 2.0. Redonnez la taille de plan et le nom du personnage à chaque coupe.
C'est le même modèle. MiniMax l'appelle MiniMax H3 ; certains l'appellent Hailuo 3.0. Sur Popcraft, il apparaît comme Hailuo 3. Cette page utilise MiniMax H3.
H3 facture à la seconde produite. Consultez la page des tarifs pour les prix actuels. Le palier 768p est plus léger et environ 40% plus rapide que le 2K.
Générez un clip qui a déjà son son
H3 est disponible sur Popcraft, avec le reste de la gamme vidéo.
Continuez à explorer
Modèles associés
Seedance 2.5 génère jusqu'à 30 secondes de vidéo en une seule tâche, avec jusqu'à 50 ressources de référence, de l'édition vidéo contrôlable, de l'extension temporelle haute fidélité, n'importe quel ratio d'aspect de 0,4 à 2,5 et du prompting natif dans plus de 10 langues. Disponible sur Popcraft.
Générez de la vidéo cinématographique en 4K à partir de texte, d'images ou de clips avec Seedance 2.0 sur Popcraft. Audio synchronisé natif, séquences multi-plans et détail d'une netteté absolue jusqu'en 4K (2160p).

Seedance 2.0 Mini est l'offre vidéo la plus légère de ByteDance — jusqu'à 50 % moins chère que Seedance 2.0 standard et ~2× plus rapide que Fast, avec des prompts texte, image, vidéo et audio. Disponible sur Popcraft.

Transformez vos images et vos prompts en vidéos cinématographiques avec Seedance 2.0 sur Popcraft. Génération à partir de références, première/dernière image et formats d'image multiples jusqu'en 4K.