MiniMax H3
Video, das seinen eigenen Sound mitbringt
MiniMax H3 generiert 2K-Bilder und eine synchronisierte Stereo-Spur in einem Durchgang — Effekte, Raumklang und Dialoge vereint. Jetzt auf Popcraft.
Filme erstellt mit H3
Dialoge, Titel, ein Trailer, Marken- und Produktfilme, Fashion, Game-Interfaces, Posterdesign, Effekte, Makro und echtes anamorphotisches Format. Wiedergabe beim Scrollen; Lautsprecher tippen für Ton.
Jemand, der wirklich spricht
Eine Creatorin in einem Straßencafé, die in die Kamera spricht. Die Worte, die Lippensynchronität und die Straße im Hintergrund entstanden in derselben Generierung — diese Fähigkeit ist das Herzstück des Modells.
Brillen-Kampagne
Nativ in 9:16 für Social Media aufgenommen. Spiegelnde Gläser, skulpturale Silhouetten und ein sauberer Studio-Sweep — die Identität bleibt über jeden Schnitt hinweg konsistent.
MIDNIGHT LINE
Ein Krimi-Vorspann: Split-Screens, harte Farbblöcke und Besetzungskarten, die im Takt der Drum-Beats schneiden, unterlegt mit einem eigenen Suspense-Jazz-Score.
Ein funktionierendes Spielemenü
Charakterwahl, Ausrüstungsanpassung, lesbare Schaltflächenzustände. Die Darstellung lesbarer Benutzeroberflächen ist die Schwäche vieler Videomodelle — genau deshalb zeigen wir sie hier.
THE STARS WERE LISTENING
Ein kontrastreicher Sci-Fi-Teaser. Eine kleine Figur vor einem gewaltigen Ring, der Titel, der sich aus der Dunkelheit schält, und ein Score, der dazu anschwillt.
POPUP! Series 001
Ein Poster- und Sammlerstück-Design, flach und lesbar gehalten: Headline-Typografie, Seriennummerierung und ein Charakter, der sauber genug für den Druck gerendert wurde.
Feuer und Leder
Editorial-Fashion mit vollem Kontrast — Flammen im Hintergrund, Lackleder vorne, und das Model bleibt von Shot zu Shot konsistent.
LEATHER IN MOTION
Dämmerung, ein Auto und eine Texturstudie. Langsame Bewegungen, eine einzige reale Lichtquelle und sauber über das Bild gesetzte Typografie.
Über die reale Welt gezeichnet
Handgezeichnete, leuchtende Linienanimationen auf Live-Action-Aufnahmen einer Straßenbahn, die beim Fahren durch den Wagen ihre Form verändern.
Nah genug, um Schuppen zu zählen
Ein Kronengecko in extremem Makro, die Zunge schnellt über das Auge. Hauttextur, nasser Glanz und Mikrobewegungen bleiben bei 2K stabil.
MINIMAX, 2.35:1
Ein Markenvideo im Format 2944 by 1248 — ein echtes anamorphotisches Bild statt eines 16:9-Crops, mit sauber gesetzten Schriftzügen entlang der Balustraden.
Der Prompt dahinter
Das Briefing, die Moodboards und der fertige Film — inklusive Score, Schnitten und On-Screen-Typografie in einer einzigen Generierung.
Eine 15-sekündige 16:9-Titelsequenz für einen Krimi mit leichter Spannung. Bildsprache: retro japanische Anime-Titel, hartkantige Silhouetten, Comic-Collage, asymmetrische Split-Screens, starke geometrische Farbblöcke, englische Credits, etwas Katakana, Jazz-Krimi-Feeling. Stimmung 60% Suspense, 40% Jazz — geheimnisvoll, cool, urban; kein Horror, nicht schwerfällig und kein fröhliches Jazz-Video.
Die Bewegung soll als Motion-Graphic-Collage wirken: Linienrahmen zeichnen sich auf Schwarz, Split-Grenzen rasten ein, Farbblöcke und Panels fügen sich Block für Block ein; Silhouetten, Requisiten-Close-ups und Credits gleiten, ploppen auf und enthüllen sich per Maske passend zu den Drum-Beats.
Englische Credits müssen sauber und lesbar sein und dürfen animiert werden: Ein dünner Rahmen zeichnet sich, der Name gleitet hinein, Buchstaben erscheinen einzeln, ein Farbblock maskiert die Enthüllung, dann Standbild. Kein zusätzliches Chinesisch, keine fehlerhaften Glyphen, keine Rechtschreibfehler. Jeder Credit und jede Rolle erscheint genau einmal — keine wiederholten Rollen oder Namen, niemand hat zwei Jobs.
Übergänge: kreisförmige Vinyl-Maske, vertikale Autotür-Wischblende, ein langer Schatten, der über das Bild fegt, ein roter Linienschnitt, eine riesige Buchstaben-Maske, Split-Frame-Reassembly, harte Farbblock-Schnitte. Alles im Takt. Keine weichen Überblenden, keine flüssigen Morphs.
Musik: Ein originaler 15-sekündiger Titel-Cue, 60% Suspense und 40% Jazz — langanhaltender Bass, gespannte Pizzicato-Streicher, ein kalter Synth-Puls, Kick, dezente Besen, ein Walking-Bass-Fragment, tiefe Saxophon-Phrasen und kurze Blechbläser-Stabs. Low-End und Hi-Hats bauen 2s lang auf, Kick bei 3s, Jazz-Bass bei 6s, ein kurzes Saxophon-/Blechbläser-Riff bei 10s und ein spannungsgeladener Akkord mit Drums zum Abschluss der letzten 2s. Keine existierenden Melodien imitieren.






Die sechs Boards des Briefings — "referenziere die Bildsprache dieser Bilder".
Eine einzige Generierung. Besetzungskarten, Split-Screens, Vinyl-Masken-Übergänge und der Suspense-Jazz kamen zusammen zurück — nichts davon wurde nachträglich vertont, beschriftet oder geschnitten.
Anwendungsbereiche
Projekte, bei denen generierter Sound und Schnitte in einer Aufnahme den gesamten Workflow verändern.
Vertikale Ads, die sofort funktionieren
Ein 9:16-Schnitt wird direkt mit Raumklang, Foley und gesprochenem Text geliefert, sodass Stakeholder von Anfang an mehr als nur ein stummes Animatic sehen.
Bewegte Packshots
Fassen Sie ein Produktfoto mit einem First- und einem Last-Frame ein — das Modell füllt den Bewegungsablauf dazwischen: das gleiche Glas, das gleiche Licht, jetzt geöffnet.
Ein Gesicht für eine ganze Serie
Referenzbilder bewahren Identität und Garderobe über verschiedene Aufnahmen und Schnitte hinweg — essenziell für eine wiederkehrende On-Camera-Persönlichkeit.
Animatics mit definierter Kameraführung
Kamerabewegungen werden als präzise Sätze formuliert, sodass ein Push-in auch wirklich ein Push-in ist und nicht das, was das Modell zufällig generiert.
Cutdowns ohne Schnittprogramm
In den Prompt geschriebene Schnitte werden als mehrere Shots innerhalb eines Clips ausgegeben, wobei die Atmo unterbrechungsfrei weiterläuft.
Was den Unterschied macht
Drei Dinge — und nur das erste ist wirklich selten.
Sound-Generierung mit dem Bild
Effekte, Atmo und lippensynchrone Dialoge in einer Datei. Wir haben das Audio mehrfach rücktranskribiert; die Zeilen waren jedes Mal wortgetreu und synchron.
Schnitte innerhalb einer Generierung
Drei Shots und zwei harte Schnitte, exakt dort platziert, wo der Prompt sie vorsah — ohne ungewollte Bildfehler in der fertigen Datei und mit durchgehendem Raumklang.
Jede volle Sekunde von 5 bis 15
Die Dauer wird im Referenzmodus auf den Frame genau eingehalten. Ein elfsekündiger Schnitt wird als elf Sekunden geliefert, nicht auf fünfzehn aufgerundet.
H3 im Vergleich zu Seedance 2.0
Unser Test: der gleiche Prompt und dieselben Referenzbilder, mit dem Modell als einziger Variable. Ein Prompt, kein Benchmark-Test. Ein Feld musste angepasst werden: H3 ignoriert feste Seitenverhältnisse, wenn ein Referenzbild angehängt ist, und wählt selbst.
| Messwert | MiniMax H3 | Seedance 2.0 |
|---|---|---|
| Geliefertes Bild | 1440 × 2560 · 24 fps | 1248 × 1664 · 24 fps |
| Gesprochener Text, rücktranskribiert | wortgetreu und synchron, 4 von 4 | unverständlich, asynchron |
| Angeforderte → gelieferte Dauer | 8 s → 8.000 s | 8 s → 8.08 s |
| Bildkomposition eingehalten | nein — das Glas wurde kleiner | ja |
| Schriftzug lesbar, Frame für Frame | 134 von 192 | 159 von 193 |
Vergleichbares Bild, deutlich besserer Sound, schwächer bei Instruktionstreue. Keiner der Prompts enthielt Dialoge und beide baten nur um leise Raum-Atmo — so lernten wir, dass H3 eigene Dialoge schreibt, wenn man es lässt.
Anleitung zum Prompting
Drei Teile: Zweck jedes Anhangs nennen, einen Kernsatz zur Kreation schreiben und dann den Clip Shot für Shot beschreiben — inklusive Schnittzeitpunkt, Framing, Kamerabewegung, Dialog und Sound.
Explizit sagen, was man NICHT will
Negativ-Anweisungen müssen separat erfolgen. Für Stille setzen Sie das Feld für nicht-diegetische Musik auf N/A — geschrieben als "non_diegetic_music": N/A. Das Feld wegzulassen ist nicht dasselbe.
Das ist obligatorisch. Ein Prompt von uns, der leise Raum-Atmo verlangte und keinen Dialog enthielt, lieferte eine komplette Sprachaufnahme mit Lippensynchronität und Produktversprechen, die niemand getippt hatte.
Die Klanglandschaft hat ein eigenes Feld
Atmo und Aktions-Sounds gehören nicht in die Shot-Beschreibung. Sie kommen in overall_soundscape, ein bis vier Sätze für den ganzen Clip. Musik, die Charaktere nicht hören können, kommt in non_diegetic_music. Dialoge bleiben beim jeweiligen Shot.
Text zitieren und Zeilen auf Shots anpassen
Worte, die auf dem Bildschirm erscheinen sollen, müssen exakt so in Anführungszeichen im Prompt stehen. Ein gesprochener Satz muss in die Sekunden des jeweiligen Shots passen; er kann über einen Schnitt fortgesetzt werden, wenn die Shots benannt werden.
Ein ausgefüllter Beispiel-Prompt
die drei Teile im Feldformat, das das Modell liestintegrated_multimodal_description: [Shot 1] A barista sets a mug on the marble counter shown in <Picture 1>, keeping the counter, the light and the mug's position. The camera pushes in with small amplitude at slow speed. The barista with a warm, low voice (S1) says: <d>[English] Yours.</d> [Shot 2] At 00:05.000, the shot cuts to an overhead close-up of steam rising from the mug while her last word carries over. overall_soundscape: Ceramic meets stone with one soft knock and low room tone continues underneath. An espresso machine hisses two rooms away. non_diegetic_music: N/A
Nutzung auf Popcraft
H3 befindet sich in der Liste der Videomodelle neben Seedance. Drei Schritte — der dritte wird oft übersehen.
Wähle MiniMax H3
Lege die Länge fest — jede volle Sekunde von fünf bis fünfzehn — und wähle die Bildqualitätsstufe.
Referenzen anhängen und Zweck zuweisen
Nicht gekennzeichnete Anhänge sind bei MiniMax die häufigste Fehlerquelle. Ein Bild ist entweder Start- oder Endframe (bitte angeben); zwei Bilder fassen den Shot ein.
Sound steuern, inklusive der Stille
Beschreibe die Klanglandschaft und formuliere, was du nicht willst, als eigene Anweisung. Ohne Vorgabe schreibt und spricht H3 eigene Dialoge.
Fragen
Ein Clip wird mit Effekten, Atmo und Dialogen geliefert, sodass die Sound-Postproduktion eher zum Editieren als zum kompletten Neuaufbau wird. Es ist jedoch kein fertiger Mix. Die Pegel können variieren, planen Sie also eine Lautheitsanpassung vor der Veröffentlichung ein.
Ja, außer man untersagt es explizit. Das ist das Wichtigste bei H3. Ein Test-Prompt verlangte leise Atmo ohne Dialog; H3 generierte eine komplette Sprachaufnahme inklusive Produktversprechen. Soundfelder wegzulassen bedeutet nicht 'Stille'. Schreiben Sie die Negativ-Anweisung separat und steuern Sie die Klanglandschaft jedes Mal aktiv.
Eine 768p-Anfrage liefert 768 Pixel an der kurzen Kante. 720p liefert dasselbe. Eine 1080p-Anfrage wird auf 2K hochgestuft — 1440 Pixel an der kurzen Kante. Die kleinere Stufe ist etwa 40% schneller und verbraucht nur ein Drittel des Speichers. Der Preis ist die Lesbarkeit kleiner Schriften: Ein Logo bleibt bei 768p erhalten, eine sehr kleine zweite Zeile darunter meist nicht.
Nur wenn kein Referenzbild angehängt ist. Text-to-Video hält sich an ein angegebenes Verhältnis. Sobald eine Referenz dabei ist, muss das Verhältnis auf 'adaptive' gestellt werden — und das ist nicht deterministisch, es kopiert nicht einfach die Referenz. Eine 3:4-Referenz wurde bei uns als 9:16 ausgegeben. Prüfen Sie die fertige Datei.
Die Identität ja, das Framing weniger zuverlässig. Referenzbilder fixieren Identität und Kleidung gut, auch bei Schnitten innerhalb einer Aufnahme. Framing-Instruktionen wurden weniger strikt befolgt als bei Seedance 2.0 — unser Produkt wurde im Bildverlauf kleiner. Wiederholen Sie Einstellungsgröße und Charakternamen bei jedem Schnitt.
Dasselbe Modell unter zwei Namen. MiniMax veröffentlicht es als MiniMax H3; einige Anbieter listen es als Hailuo 3.0 — im Popcraft-Modell-Picker erscheint es als Hailuo 3. Diese Seite verwendet durchgehend MiniMax H3.
H3 wird pro Sekunde Output abgerechnet. Die aktuellen Preise finden Sie auf der Pricing-Seite. Gut zu wissen: Die 768p-Stufe benötigt nur etwa ein Drittel des Datenvolumens von 2K und ist ca. 40% schneller.
Generiere Clips, die ihren Sound bereits mitbringen
H3 ist jetzt auf Popcraft verfügbar, zusammen mit unseren anderen Videomodellen.
Weiter erkunden
Ähnliche Modelle
Seedance 2.5 generiert bis zu 30 Sekunden Video in einem einzigen Durchgang, mit bis zu 50 Referenz-Assets, steuerbarer Videobearbeitung, hochpräziser zeitlicher Verlängerung, jedem Seitenverhältnis von 0,4 bis 2,5 und nativem Prompting in über 10 Sprachen. Jetzt live auf Popcraft.
Generiere filmreifes 4K-Video aus Text, Bildern oder Clips mit Seedance 2.0 auf Popcraft. Nativ synchronisierter Ton, Multi-Shot-Sequenzen und gestochen scharfes Detail bis 4K (2160p).

Seedance 2.0 Mini ist die schlankeste Videostufe von ByteDance – bis zu 50 % günstiger als das Standard-Seedance 2.0 und ~2× schneller als Fast, mit Text-, Bild-, Video- und Audio-Prompting. Live auf Popcraft.

Verwandle Bilder und Prompts mit Seedance 2.0 auf Popcraft in kinoreife Videos. Reference-to-Video, First/Last Frame und Ausgaben in mehreren Seitenverhältnissen mit bis zu 4K.