NEWDeine nächste virale UGC-Anzeige ist nur einen Klick entfernt. Erlebe Studio.Anzeige erstellen
PopcraftPopcraft
Neues Modell

MiniMax H3

Video, das seinen eigenen Sound mitbringt

MiniMax H3 generiert 2K-Bilder und eine synchronisierte Stereo-Spur in einem Durchgang — Effekte, Raumklang und Dialoge vereint. Jetzt auf Popcraft.

2K bei 24 fpsStereo Audio, generiert5–15s in 1s-Schritten6 SeitenverhältnisseMulti-Shot in einer Aufnahme
Dialog
Titelsequenz
Markenfilm
Game-Interface
Trailer
Zeichentrick-Effekte
Produktfilm
Makro

Filme erstellt mit H3

Dialoge, Titel, ein Trailer, Marken- und Produktfilme, Fashion, Game-Interfaces, Posterdesign, Effekte, Makro und echtes anamorphotisches Format. Wiedergabe beim Scrollen; Lautsprecher tippen für Ton.

Dialog

Jemand, der wirklich spricht

Eine Creatorin in einem Straßencafé, die in die Kamera spricht. Die Worte, die Lippensynchronität und die Straße im Hintergrund entstanden in derselben Generierung — diese Fähigkeit ist das Herzstück des Modells.

Fashion, vertikal

Brillen-Kampagne

Nativ in 9:16 für Social Media aufgenommen. Spiegelnde Gläser, skulpturale Silhouetten und ein sauberer Studio-Sweep — die Identität bleibt über jeden Schnitt hinweg konsistent.

Titel und Packaging

MIDNIGHT LINE

Ein Krimi-Vorspann: Split-Screens, harte Farbblöcke und Besetzungskarten, die im Takt der Drum-Beats schneiden, unterlegt mit einem eigenen Suspense-Jazz-Score.

Interface und Games

Ein funktionierendes Spielemenü

Charakterwahl, Ausrüstungsanpassung, lesbare Schaltflächenzustände. Die Darstellung lesbarer Benutzeroberflächen ist die Schwäche vieler Videomodelle — genau deshalb zeigen wir sie hier.

Trailer

THE STARS WERE LISTENING

Ein kontrastreicher Sci-Fi-Teaser. Eine kleine Figur vor einem gewaltigen Ring, der Titel, der sich aus der Dunkelheit schält, und ein Score, der dazu anschwillt.

Grafikdesign

POPUP! Series 001

Ein Poster- und Sammlerstück-Design, flach und lesbar gehalten: Headline-Typografie, Seriennummerierung und ein Charakter, der sauber genug für den Druck gerendert wurde.

Markenfilm

Feuer und Leder

Editorial-Fashion mit vollem Kontrast — Flammen im Hintergrund, Lackleder vorne, und das Model bleibt von Shot zu Shot konsistent.

Produktfilm

LEATHER IN MOTION

Dämmerung, ein Auto und eine Texturstudie. Langsame Bewegungen, eine einzige reale Lichtquelle und sauber über das Bild gesetzte Typografie.

Effekte

Über die reale Welt gezeichnet

Handgezeichnete, leuchtende Linienanimationen auf Live-Action-Aufnahmen einer Straßenbahn, die beim Fahren durch den Wagen ihre Form verändern.

Makro

Nah genug, um Schuppen zu zählen

Ein Kronengecko in extremem Makro, die Zunge schnellt über das Auge. Hauttextur, nasser Glanz und Mikrobewegungen bleiben bei 2K stabil.

Ultra-Wide

MINIMAX, 2.35:1

Ein Markenvideo im Format 2944 by 1248 — ein echtes anamorphotisches Bild statt eines 16:9-Crops, mit sauber gesetzten Schriftzügen entlang der Balustraden.

Der Prompt dahinter

Das Briefing, die Moodboards und der fertige Film — inklusive Score, Schnitten und On-Screen-Typografie in einer einzigen Generierung.

Prompt — scrollen

Eine 15-sekündige 16:9-Titelsequenz für einen Krimi mit leichter Spannung. Bildsprache: retro japanische Anime-Titel, hartkantige Silhouetten, Comic-Collage, asymmetrische Split-Screens, starke geometrische Farbblöcke, englische Credits, etwas Katakana, Jazz-Krimi-Feeling. Stimmung 60% Suspense, 40% Jazz — geheimnisvoll, cool, urban; kein Horror, nicht schwerfällig und kein fröhliches Jazz-Video.

Die Bewegung soll als Motion-Graphic-Collage wirken: Linienrahmen zeichnen sich auf Schwarz, Split-Grenzen rasten ein, Farbblöcke und Panels fügen sich Block für Block ein; Silhouetten, Requisiten-Close-ups und Credits gleiten, ploppen auf und enthüllen sich per Maske passend zu den Drum-Beats.

Englische Credits müssen sauber und lesbar sein und dürfen animiert werden: Ein dünner Rahmen zeichnet sich, der Name gleitet hinein, Buchstaben erscheinen einzeln, ein Farbblock maskiert die Enthüllung, dann Standbild. Kein zusätzliches Chinesisch, keine fehlerhaften Glyphen, keine Rechtschreibfehler. Jeder Credit und jede Rolle erscheint genau einmal — keine wiederholten Rollen oder Namen, niemand hat zwei Jobs.

Übergänge: kreisförmige Vinyl-Maske, vertikale Autotür-Wischblende, ein langer Schatten, der über das Bild fegt, ein roter Linienschnitt, eine riesige Buchstaben-Maske, Split-Frame-Reassembly, harte Farbblock-Schnitte. Alles im Takt. Keine weichen Überblenden, keine flüssigen Morphs.

Musik: Ein originaler 15-sekündiger Titel-Cue, 60% Suspense und 40% Jazz — langanhaltender Bass, gespannte Pizzicato-Streicher, ein kalter Synth-Puls, Kick, dezente Besen, ein Walking-Bass-Fragment, tiefe Saxophon-Phrasen und kurze Blechbläser-Stabs. Low-End und Hi-Hats bauen 2s lang auf, Kick bei 3s, Jazz-Bass bei 6s, ein kurzes Saxophon-/Blechbläser-Riff bei 10s und ein spannungsgeladener Akkord mit Drums zum Abschluss der letzten 2s. Keine existierenden Melodien imitieren.

Referenzen
Style reference board 1 for the MIDNIGHT LINE title sequenceStyle reference board 2 for the MIDNIGHT LINE title sequenceStyle reference board 3 for the MIDNIGHT LINE title sequenceStyle reference board 4 for the MIDNIGHT LINE title sequenceStyle reference board 5 for the MIDNIGHT LINE title sequenceStyle reference board 6 for the MIDNIGHT LINE title sequence

Die sechs Boards des Briefings — "referenziere die Bildsprache dieser Bilder".

Output

Eine einzige Generierung. Besetzungskarten, Split-Screens, Vinyl-Masken-Übergänge und der Suspense-Jazz kamen zusammen zurück — nichts davon wurde nachträglich vertont, beschriftet oder geschnitten.

Anwendungsbereiche

Projekte, bei denen generierter Sound und Schnitte in einer Aufnahme den gesamten Workflow verändern.

Marketing

Vertikale Ads, die sofort funktionieren

Ein 9:16-Schnitt wird direkt mit Raumklang, Foley und gesprochenem Text geliefert, sodass Stakeholder von Anfang an mehr als nur ein stummes Animatic sehen.

E-Commerce

Bewegte Packshots

Fassen Sie ein Produktfoto mit einem First- und einem Last-Frame ein — das Modell füllt den Bewegungsablauf dazwischen: das gleiche Glas, das gleiche Licht, jetzt geöffnet.

Creators

Ein Gesicht für eine ganze Serie

Referenzbilder bewahren Identität und Garderobe über verschiedene Aufnahmen und Schnitte hinweg — essenziell für eine wiederkehrende On-Camera-Persönlichkeit.

Film und Previs

Animatics mit definierter Kameraführung

Kamerabewegungen werden als präzise Sätze formuliert, sodass ein Push-in auch wirklich ein Push-in ist und nicht das, was das Modell zufällig generiert.

Social Media

Cutdowns ohne Schnittprogramm

In den Prompt geschriebene Schnitte werden als mehrere Shots innerhalb eines Clips ausgegeben, wobei die Atmo unterbrechungsfrei weiterläuft.

Was den Unterschied macht

Drei Dinge — und nur das erste ist wirklich selten.

Das Seltene

Sound-Generierung mit dem Bild

Effekte, Atmo und lippensynchrone Dialoge in einer Datei. Wir haben das Audio mehrfach rücktranskribiert; die Zeilen waren jedes Mal wortgetreu und synchron.

Das Nützliche

Schnitte innerhalb einer Generierung

Drei Shots und zwei harte Schnitte, exakt dort platziert, wo der Prompt sie vorsah — ohne ungewollte Bildfehler in der fertigen Datei und mit durchgehendem Raumklang.

Das Praktische

Jede volle Sekunde von 5 bis 15

Die Dauer wird im Referenzmodus auf den Frame genau eingehalten. Ein elfsekündiger Schnitt wird als elf Sekunden geliefert, nicht auf fünfzehn aufgerundet.

H3 im Vergleich zu Seedance 2.0

Unser Test: der gleiche Prompt und dieselben Referenzbilder, mit dem Modell als einziger Variable. Ein Prompt, kein Benchmark-Test. Ein Feld musste angepasst werden: H3 ignoriert feste Seitenverhältnisse, wenn ein Referenzbild angehängt ist, und wählt selbst.

MesswertMiniMax H3Seedance 2.0
Geliefertes Bild1440 × 2560 · 24 fps1248 × 1664 · 24 fps
Gesprochener Text, rücktranskribiertwortgetreu und synchron, 4 von 4unverständlich, asynchron
Angeforderte → gelieferte Dauer8 s → 8.000 s8 s → 8.08 s
Bildkomposition eingehaltennein — das Glas wurde kleinerja
Schriftzug lesbar, Frame für Frame134 von 192159 von 193

Vergleichbares Bild, deutlich besserer Sound, schwächer bei Instruktionstreue. Keiner der Prompts enthielt Dialoge und beide baten nur um leise Raum-Atmo — so lernten wir, dass H3 eigene Dialoge schreibt, wenn man es lässt.

Anleitung zum Prompting

Drei Teile: Zweck jedes Anhangs nennen, einen Kernsatz zur Kreation schreiben und dann den Clip Shot für Shot beschreiben — inklusive Schnittzeitpunkt, Framing, Kamerabewegung, Dialog und Sound.

Die wichtigste Regel

Explizit sagen, was man NICHT will

Negativ-Anweisungen müssen separat erfolgen. Für Stille setzen Sie das Feld für nicht-diegetische Musik auf N/A — geschrieben als "non_diegetic_music": N/A. Das Feld wegzulassen ist nicht dasselbe.

Das ist obligatorisch. Ein Prompt von uns, der leise Raum-Atmo verlangte und keinen Dialog enthielt, lieferte eine komplette Sprachaufnahme mit Lippensynchronität und Produktversprechen, die niemand getippt hatte.

Sound

Die Klanglandschaft hat ein eigenes Feld

Atmo und Aktions-Sounds gehören nicht in die Shot-Beschreibung. Sie kommen in overall_soundscape, ein bis vier Sätze für den ganzen Clip. Musik, die Charaktere nicht hören können, kommt in non_diegetic_music. Dialoge bleiben beim jeweiligen Shot.

Handwerk

Text zitieren und Zeilen auf Shots anpassen

Worte, die auf dem Bildschirm erscheinen sollen, müssen exakt so in Anführungszeichen im Prompt stehen. Ein gesprochener Satz muss in die Sekunden des jeweiligen Shots passen; er kann über einen Schnitt fortgesetzt werden, wenn die Shots benannt werden.

Ein ausgefüllter Beispiel-Prompt

die drei Teile im Feldformat, das das Modell liest
integrated_multimodal_description: [Shot 1] A barista sets a mug on the marble counter shown in <Picture 1>, keeping the counter, the light and the mug's position. The camera pushes in with small amplitude at slow speed. The barista with a warm, low voice (S1) says:
<d>[English] Yours.</d>
[Shot 2] At 00:05.000, the shot cuts to an overhead close-up of steam rising from the mug while her last word carries over.

overall_soundscape: Ceramic meets stone with one soft knock and low room tone continues underneath. An espresso machine hisses two rooms away.

non_diegetic_music: N/A

Nutzung auf Popcraft

H3 befindet sich in der Liste der Videomodelle neben Seedance. Drei Schritte — der dritte wird oft übersehen.

01

Wähle MiniMax H3

Lege die Länge fest — jede volle Sekunde von fünf bis fünfzehn — und wähle die Bildqualitätsstufe.

02

Referenzen anhängen und Zweck zuweisen

Nicht gekennzeichnete Anhänge sind bei MiniMax die häufigste Fehlerquelle. Ein Bild ist entweder Start- oder Endframe (bitte angeben); zwei Bilder fassen den Shot ein.

03

Sound steuern, inklusive der Stille

Beschreibe die Klanglandschaft und formuliere, was du nicht willst, als eigene Anweisung. Ohne Vorgabe schreibt und spricht H3 eigene Dialoge.

Fragen

Ein Clip wird mit Effekten, Atmo und Dialogen geliefert, sodass die Sound-Postproduktion eher zum Editieren als zum kompletten Neuaufbau wird. Es ist jedoch kein fertiger Mix. Die Pegel können variieren, planen Sie also eine Lautheitsanpassung vor der Veröffentlichung ein.

Ja, außer man untersagt es explizit. Das ist das Wichtigste bei H3. Ein Test-Prompt verlangte leise Atmo ohne Dialog; H3 generierte eine komplette Sprachaufnahme inklusive Produktversprechen. Soundfelder wegzulassen bedeutet nicht 'Stille'. Schreiben Sie die Negativ-Anweisung separat und steuern Sie die Klanglandschaft jedes Mal aktiv.

Eine 768p-Anfrage liefert 768 Pixel an der kurzen Kante. 720p liefert dasselbe. Eine 1080p-Anfrage wird auf 2K hochgestuft — 1440 Pixel an der kurzen Kante. Die kleinere Stufe ist etwa 40% schneller und verbraucht nur ein Drittel des Speichers. Der Preis ist die Lesbarkeit kleiner Schriften: Ein Logo bleibt bei 768p erhalten, eine sehr kleine zweite Zeile darunter meist nicht.

Nur wenn kein Referenzbild angehängt ist. Text-to-Video hält sich an ein angegebenes Verhältnis. Sobald eine Referenz dabei ist, muss das Verhältnis auf 'adaptive' gestellt werden — und das ist nicht deterministisch, es kopiert nicht einfach die Referenz. Eine 3:4-Referenz wurde bei uns als 9:16 ausgegeben. Prüfen Sie die fertige Datei.

Die Identität ja, das Framing weniger zuverlässig. Referenzbilder fixieren Identität und Kleidung gut, auch bei Schnitten innerhalb einer Aufnahme. Framing-Instruktionen wurden weniger strikt befolgt als bei Seedance 2.0 — unser Produkt wurde im Bildverlauf kleiner. Wiederholen Sie Einstellungsgröße und Charakternamen bei jedem Schnitt.

Dasselbe Modell unter zwei Namen. MiniMax veröffentlicht es als MiniMax H3; einige Anbieter listen es als Hailuo 3.0 — im Popcraft-Modell-Picker erscheint es als Hailuo 3. Diese Seite verwendet durchgehend MiniMax H3.

H3 wird pro Sekunde Output abgerechnet. Die aktuellen Preise finden Sie auf der Pricing-Seite. Gut zu wissen: Die 768p-Stufe benötigt nur etwa ein Drittel des Datenvolumens von 2K und ist ca. 40% schneller.

Generiere Clips, die ihren Sound bereits mitbringen

H3 ist jetzt auf Popcraft verfügbar, zusammen mit unseren anderen Videomodellen.

Weiter erkunden

Ähnliche Modelle